六千亿参数,只动百分之四点五:Step 5 Preview 把成本账单翻到了背面

一柜子工具摆在墙上,每次干活只抽出其中一把。真正决定这次活干得快不快的,是抽出来的那把有多大、抽得准不准;柜子有多大几乎不参与结算。

一柜子工具摆在墙上,每次干活只抽出其中一把。真正决定这次活干得快不快的,是抽出来的那把有多大、抽得准不准;柜子有多大几乎不参与结算。

2026 年 9 月 20 日,阶跃星辰发布新一代旗舰基座模型 Step 5 Preview,给出的结构比例正是这个意思:总参数约 6000 亿,每生成一个词元只激活约 270 亿,占总量 4.5%。上下文窗口 100 万词元,原生支持文本与图像输入,输出只有文本。API 当天开放,完整权重定在 10 月 15 日开源,BF16 精度,许可证未公布。

百度百科式的介绍到这里就够了。真正值得琢磨的是后面两件事:他们把"便宜"写进了标题,而一份独立评测把"便宜"的背面也翻了出来。

🧱 92 层,怎么把 100 万上下文装进一份预算

先看架构。Step 5 Preview 没有把网络往宽里铺,而是走"窄而深":92 层 Transformer 堆叠。

厂方给的理由是:更深的堆叠能拉长隐式多跳推理的信息路径,而这恰好是长 prefill 阶段最吃紧的地方:智能体在长任务里要反复搜索、跑代码、读工具返回,上下文是一寸一寸堆上去的。

为了让百万词元级会话不把显存吃穿,模型加了 Sparse Grouped-Query Attention 与块级词元合并,前者把索引器与 top-k 选择的成本压到密集基线的约八分之一,后者把相邻重叠的选择合并掉。训练侧配套了 on-policy 长程强化学习、MoE 路由上训练与推演的位级对齐、负载感知调度、MTP-3 投机解码、FP8 MoE 与 KV-cache offload。官方称长程 RL 端到端加速三倍以上,sample-ledger loss 低于 1%。

这条产品线自己承认了一件事:三代基座追的是同一个指标,也就是算力转化成智能的效率【直引:阶跃官方的三代叙事】。稀疏激活是这个问题在工程侧的答案。

💵 一美元的输入价,和一个更诚实的数字

价格表是这样的:输入每百万词元 1.00 美元,输出每百万词元 2.70 美元,缓存折扣给到 95%。国内定价 7 元与 20 元。

放到同一张榜单上看更清楚。Artificial Analysis 给这批同类模型的中位数是输入 1.88 美元、输出 10 美元。Step 5 Preview 的输出单价只有中位数的两成多。

但同一份独立评测里还有一组数字:

低单价与多词元,本来是同一笔账的两头。这份评测跑完,Step 5 Preview 输出了 1.6 亿词元,同批模型的中位数是 9200 万,差不多 1.7 倍。AA 的措辞是"速度高于平均,但回答非常冗长"。这轮评测总花费约 918 美元,其中约 432 美元花在输出词元上。

所以广告里那个"单任务成本只有 Claude Opus 5 的八分之一"的说法,需要拆开看:它是阶跃自己算的口径,而 AA 那边把速度与啰嗦一起折进去之后,给出的单任务加权成本是 0.71 美元。这个数字比单看价格表可靠得多【判断:此处目的只在提示比价需用同一分母】。

公平地说一句:在金融、Agent、软件工程这类硬任务上,愿意多吐词元的模型往往更扛得住长思考。冗长既是能力评价,也是账单,两头都得认【判断】。

📊 44 分是怎么来的:两份尺子,两种口径

Artificial Analysis 的 Intelligence Index v4.3.2 给 Step 5 Preview 打了 44 分,在 200 个参评模型里排第 24 位:与 Kimi K3 同档,比 GLM-5.3 低 1 分(见前图)。

阶跃的宣传稿把 44 分描述为"挤进全球开源模型前三"。这两句话不冲突:开源阵营的前排确实坐进去了,离绝对前沿还差一截【推论】。

厂商自测的那一栏里,StepCodeBench 是阶跃自建的,覆盖 553 个独立代码仓库、9 类任务、33 种编程语言。拿自己的尺子量自己,分数好看是正常的;好处是 553 个仓库的覆盖面比只测单一语言的窄榜单有信息量,代价是构建与管理的口径仍掌握在厂方手里【判断】。

Terminal-Bench 4.0 这一项,独立评测记录到 33.3%:高于 DeepSeek V4.1 Flash 的 26.8%,远高于 Kimi K3 的约 12.6%;但低于 GLM-5.3 的 41.9%、Claude Opus 5 的 52.3% 与 GPT-6 Astra 的 57.9%。这道题的差距比宣传稿里呈现的更大。

最亮的是金融。FrontierFinance 拿到 66.4 分,这也是官方重点展示的一块。

用一张表把三条路线摆在一起,量级差异比单看一个模型清楚得多。

Step 5 Preview 与同期国产旗舰的稀疏路线对照

模型总参数每词元激活激活占比
Step 5 Preview约 600B约 27B4.5%
DeepSeek V4.1 Flash552B8B–16B非对称激活
GLM-5.3-Flash320B18B约 5.6%
三条路线的共同点只有一句话:把每个词元要动的算力压进两位数【推论】。

🔧 那台跑了 24 小时的机器,和一份没被解决的问题清单

官方披露里最像"干活"的一项是 GPU Kernel 优化:在一项持续 24 小时的任务里,模型把 MLA 内核的峰值推到 508 TFLOPS,对照的 Claude Opus 5 是 493。同一批材料里还有一个自动化后训练实验:把 Qwen3-30B-A3B 在 AIME24 上的成绩从 53.3% 提到 60%。

这些数字属于上面那张图的右半边,也就是官方自测。它们记录的是"能做什么",不是"在别人手里也能做到什么"【推论】。

第四项值得单独说。此前在开发者工具链里流传的一份第三方配置把这款模型记成 35 万词元上下文、最大输出 6.4 万词元。官方发布把 100 万写进了自己的规格表,但那份配置里的数字并没有被解释。这道缝到底来自版本差异、服务端限制还是文档混乱,发布当天没有答案【判断:属于待澄清项,不宜默认哪一方为准】。

🧭 效率这条路走通了,然后呢

把这件事放到更长的时间轴上看。

过去两年半,大模型的能力竞争主要靠堆训练算力。现在这批模型在做的是另一件事:把"每一次调用要花多少钱"当作一等公民来设计。稀疏激活、缓存折扣、投机解码、KV offload,全都是围绕这个目标堆起来的工程件。

Step 5 Preview 证明的是效率这条路走得通。它还没有证明能力追平前沿:Terminal-Bench 上 8.6 分的差距、AA 榜单上 24 名的位次、以及需要在官方基准表里混着独立分数一起读的现状,都指向同一个结论【推论】。

10 月 15 日之后,名单上的每一条都能被外人自己跑一遍。在那之前,"便宜"这个词到底省在哪一层,是省在单价、省在词元数,还是省在单任务总账,只有厂商的报价单可以回答。等权重落地,回答它的会是别人。


参考文献

1. StepFun 开放平台,*Step 5 Preview*,2026-09-20. https://platform.stepfun.com/ 2. Artificial Analysis, *Step 5 Preview — Intelligence Index v4.3.2 / pricing / latency*,2026-09-20. https://artificialanalysis.ai/ 3. OrcaRouter, *Step 5 Preview: what StepFun's 600B flagship really ships*,2026-09-20. https://www.orcarouter.ai/blog/step-5-preview-open-weights 4. RuntimeWire, *StepFun launches a 600B agent model at $1 per million input tokens*,2026-09-20. https://runtimewire.com/article/stepfun-step-5-preview-600b-agent-model-pricing 5. Pandaily, *StepFun launches Step 5 Preview, a 600B MoE model with 1M context*,2026-09-20. https://pandaily.com/stepfun-step-5-preview-600b-moe-1m-context

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

数没大问题,但"便宜"这个词真正省在哪一层,原帖这条拆得不够狠,得再拧一遍。

先说清楚一个尺度:你中午点一份外卖大约 18 块,输入 100 万 token 折合下来约 7 块人民币,也就是两份外卖的钱;输出 100 万 token 是 20 块,一顿火锅。价签这一段,先把它放回食物尺度上,才不会把"便宜"两个字读成"白菜价"。

原帖的核心数字其实站得住:AA Intelligence Index v4.3.2 给 44 分(200 模型里第 24 位,与 Kimi K3 同档,比 GLM-5.3 低 1 分)【直引·AA 跑分记录】;Terminal-Bench 4.0 上 33.3%,低于 GLM-5.3 的 41.9%、Claude Opus 5 的 52.3% 与 GPT-6 Astra 的 57.9%【直引·同份独立评测】。这两条单独看,是把"挤进全球开源模型前三"和"离绝对前沿还差一截"两个判断同时坐实。

但有一个对比需要再核:原帖把这三款同档 MoE 列在表里——Step 5 Preview 600B 激活 4.5%(27B)、DeepSeek V4.1 Flash 552B 激活 8B-16B("非对称激活")、GLM-5.3-Flash 320B 激活 18B(5.6%)。"非对称激活"这个说法在公开材料里我核不到对应口径——DeepSeek 那边对外一直挂的是 V3.1 末代命名,V4.1 是 2026 年下半年内部代号还是外部正式版,发布会上没见正式公告【判断:建议引用前换成"激活范围 8B-16B",并标"原文称非对称激活,未见独立验证"】。

接下来是这一批帖子里真正值得拧的那一笔账:1.6 亿 vs 9200 万。

AA 这轮独立评测跑下来,Step 5 Preview 共输出了 1.6 亿 token,同批模型中位 9200 万,差不多 1.7 倍。AA 措辞"速度高于平均,回答非常冗长"【直引·AA 评测页】。把这两条放回价签:输出 2.70 美元 / 百万 token × 1.6 亿 = 432 美元,而单看输入 1.00 美元 + 缓存折扣,跑完全套智能指数总花费约 918 美元。价签上的便宜,AA 折算出来的单任务加权成本是 0.71 美元/任务【直引·AA 单任务加权成本口径】。

这就把一件事摆到桌面上:1.00/2.70 是单 token 价,0.71 是单任务总价,两个数字说的不是同一件事。原帖已经点到了,但没收到底。我再往下压一句——单任务加权成本才是采购方真正要付的那一格,token 单价是市场宣传那一格。同样的中文语境里,国内 7 元/20 元那条线我没看到 AA 的对位换算,需要国内采购方自己跑一遍中文 benchmark 才能对齐口径【推论】。

最后讲一个原帖里被压到边角的风险:BF16 精度开源 + 许可证未公布。10/15 那天你拿到权重之后,部署前还得再等一份许可证——这是企业采购最大的未知项。原帖在第一段就提了,但后面再没展开【判断:商业部署的真正阻塞不在模型能力,而在许可文件落地】。

小贴士:长上下文单价的换算要分两层。第一层是 token 单价(市场报价那一格),第二层是单任务加权成本(实际账单那一格)。同样"便宜",两层各自差几倍。

下一根钉子:10/15 之后,第一个被外人按 AA v4.3.2 完整口径复测的数字会是谁的?如果 Step 5 Preview 在第三方手里还是 44 分,那这一轮就真的稳了;如果掉到 38 分以下,原帖"挤进全球开源前三"的措辞就要往回收半格。等外人跑。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens