五千亿参数里只有二百三十亿在动:Reflection 把开放权重的账算到了推理端

10 月 5 日凌晨,Reflection 在自家博客放出 Beam 的技术细节。标题里的数字是 501 billion total parameters,正文的另一个数字是 23 billion active。

目录
  1. 📐 标题写的是五千亿,每次真正跑的只有二百三十亿
  2. 🧮 训练账:不到四周,六千一百四十四张卡
  3. 🎯 效率的价:在 DeepSWE 上要付 23.6 分
  4. 🔧 把「陈旧」变成一个可训练的量
  5. 🧯 沙箱工厂:十亿次创建请求
  6. ⚖️ 公司自己承认的那句话
  7. 📌 信源与限定

📐 标题写的是五千亿,每次真正跑的只有二百三十亿

10 月 5 日凌晨,Reflection 在自家博客放出 Beam 的技术细节。标题里的数字是 501 billion total parameters,正文的另一个数字是 23 billion active。

差二十一倍多。 Beam 是个稀疏混合专家模型,每个 token 只会激活一小撮专家参数。标题抓的是仓库体积,正文抓的是每 token 的算力。 这两个数都不是玄学,前者决定你下载时硬盘要留多少空间,后者决定你推理时账单长什么样。

公司自己给出了两句互相拉扯的话。 第一句:Kimi K3 在原始能力上仍然领先。 第二句:Beam 的优势在推理时的效率。 【直引】Reflection 自己承认了第一句,所以这篇通稿的卖点其实只剩第二句。

🧮 训练账:不到四周,六千一百四十四张卡

预训练部分:23.8 万亿 token,来自网页与专有授权数据集;集群规模 6144 张 GB300 NVL72,耗时不到四周。 按 28 天连续满负荷折算,【推论】这一段约 413 万 GPU 小时(6144 × 28 × 24)。

数据筛选的数字更狠。 原文说约 95% 的原始互联网 token 在解析去重后被丢掉,理由是常规方法会漏掉约 1.8 万亿高质量 token,其中 87% 是他们精挑的网页代码。 【推论】1.8 万亿占 23.8 万亿的 7.6%,换句话说这套管线省下的不是一点边角,是七个多百分点的语料。

模型 52 层。 残差流的均方根值在整个预训练过程中保持有界。 做到这件事靠四样东西:depth-based scaling、SandwichNorm,加上逐元素注意力门控与 FP32 残差累加。 训练期间跑了九次半自动回滚,原因是梯度范数尖峰与疑似静默数据损坏;后期 goodput 达92.3%。

训练阶段规模时长
预训练6144 张 GB300 NVL72不到 4 周
高算力 RL10.5K 张 GB3004 周
沙箱环境约 100 万个编码与 STEM 环境累计 13 亿次调用
两段加起来约 1120 万 GPU 小时,【推论】其中强化学习一段占了六成上下。 全程纯文本模型,其他模态只有被转成文本时才进得去。

🎯 效率的价:在 DeepSWE 上要付 23.6 分

两边都有报数的基准,直接对读:

基准BeamKimi K3差距
DeepSWE v1.144.468.023.6
SWE Bench Pro v2-Hard77.288.211.0
Terminal Bench v2.180.188.38.2
SWE Atlas 代码库问答34.668.033.4
四项 Beam 全部落后。 落差最悬殊的是代码库问答,差距 33.4 分,约为 Terminal Bench 上 8.2 分差距的四倍。【判断】同一份权重在长上下文检索类任务上被甩得最开,这更像上下文与检索训练配比的问题,而不是参数量的问题。

效率侧的说法是:与 GLM-5.2 相比,在高阶推理基准上用 3 到 4 倍更少的推理算力拿到相近分数。 这里的算法是 FLOPs 约等于二乘以激活参数量再乘以每次尝试生成的平均 token 数,模型自己的说明里明确排除了 prefill、与上下文相关的注意力运算与服务开销,并自称这是一次近似算力比较,不是实测推理成本。 【直引】作者把免责声明写在了正文里。

🔧 把「陈旧」变成一个可训练的量

高算力 RL 跑了超过一亿次 rollout。 Beam 的推理专家吃掉了其中八千万次,Inkling 用了三千万次,MiMo 用了七十五万三千次。 【推论】三者的比值约 106 比 40 比 1,Reflection 显然把预算压在了自研主力上。

异步策略梯度这一段值得单拎出来。 长 rollout 常常横跨多个 checkpoint,早期 token 相对当前策略已经过时;训练引擎与推理引擎之间的数值差异会继续放大这个问题。 他们的处理是给每个 token 记下产生它的模型版本,并在训练算法层面补偿策略陈旧度。 实测口径是:让交互数据比当前策略落后一天、也就是落后 107 个权重版本时,数值依然稳定。

配套的基础设施数字也一并给了:平均维持 11 万并发 rollout,推理与训练的 GPU 比在 3.9 比 1 到 5.4 比 1 之间调整,新权重送达推理集群的中位时间约 12 秒,跨机架流量减 75%,全队采用新权重的速度快 2.2 倍。 处理过 71 次推理事故,训练任务没有因此中断,推理容量恢复的中位时间是 8 分钟,丢失容量占服务 GPU 分钟的 0.02%。

🧯 沙箱工厂:十亿次创建请求

这是整篇里最不起眼、也最能说明问题的一段。

最多同时支持 17 万个并发沙箱,处理了超过十亿次沙箱创建请求,铺在 20 多个集群上,跨两个云与四个地区。 【推论】十亿次除以 100 万个环境,同一个环境平均被复用了一千次左右。 90% 的新沙箱在 10 秒内就绪,动态打包让训练批次平均 99.99% 满载,单 GPU 训练吞吐波动控制在 1.5% 以内。 平均 rollout 长度增长接近 70% 的情况下,吞吐量保持住了。

【判断】这项数字比参数量更能解释 Beam 的成本结构。 跑一亿次 rollout 意味着评测与训练环境必须能被程序化地批量生成,否则这条曲线在几千次的时候就断了。

⚖️ 公司自己承认的那句话

Beam 与 Kimi K3 的差距,公司没有绕。 【直引】原文写的是在前沿开放模型如 Kimi K3 仍领先原始能力的情况下,Beam 的优势在于推理时效率。

真正有意思的是三件被顺带承认的事。 第一,效率对比中有一半模型的成绩来自 Artificial Analysis 与 DataCurve 的公开数据,不是各家自己跑。 第二,一亿次 rollout 的规模被表述为我们相信这是公开实验室中最大规模之一,带了 we believe。第三,安全评估结果当时还没出,说要等技术报告。

安全训练走的是第二条独立管线:从预训练 checkpoint 出发,独立的 SFT 与 RL,合并两位 teacher。 一个是大规模 RL teacher,一个专职安全对齐,合并方式是多 teacher 在策略蒸馏。 预测奖励变化的相关系数里,预测 RL 增益是 r 等于 0.79,预测 Best-of-N 上限只有 r 等于 0.46。

权重计划以 Apache 2.0 在本月内放出,连同技术报告、模型卡与完整的运行评估微调工具栈。 发布当天模型仍在最终红队测试中,只有候补名单上的少量用户能试。 关于开放权重这个词,此时的准确状态是:公告已发,权重未到。

📌 信源与限定

  • 全部架构、训练与基准数字取自 Reflection 10 月 5 日官方博客 introducing-beam,未核到技术报告。
  • 413 万与 1120 万 GPU 小时是按标称卡数与时长折算,非公司披露。
  • 3 到 4 倍推理算力为原文估算,公式与排除项一并转述,公司自己标注为近似比较。
  • Beam 为纯文本模型;其他模态须先转为文本。 权重、许可与技术报告在发布日尚未公开。
暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens