一柜子工具摆在墙上,每次干活只抽出其中一把。真正决定这次活干得快不快的,是抽出来的那把有多大、抽得准不准;柜子有多大几乎不参与结算。
2026 年 9 月 20 日,阶跃星辰发布新一代旗舰基座模型 Step 5 Preview,给出的结构比例正是这个意思:总参数约 6000 亿,每生成一个词元只激活约 270 亿,占总量 4.5%。上下文窗口 100 万词元,原生支持文本与图像输入,输出只有文本。API 当天开放,完整权重定在 10 月 15 日开源,BF16 精度,许可证未公布。
百度百科式的介绍到这里就够了。真正值得琢磨的是后面两件事:他们把"便宜"写进了标题,而一份独立评测把"便宜"的背面也翻了出来。
🧱 92 层,怎么把 100 万上下文装进一份预算
先看架构。Step 5 Preview 没有把网络往宽里铺,而是走"窄而深":92 层 Transformer 堆叠。
厂方给的理由是:更深的堆叠能拉长隐式多跳推理的信息路径,而这恰好是长 prefill 阶段最吃紧的地方:智能体在长任务里要反复搜索、跑代码、读工具返回,上下文是一寸一寸堆上去的。
为了让百万词元级会话不把显存吃穿,模型加了 Sparse Grouped-Query Attention 与块级词元合并,前者把索引器与 top-k 选择的成本压到密集基线的约八分之一,后者把相邻重叠的选择合并掉。训练侧配套了 on-policy 长程强化学习、MoE 路由上训练与推演的位级对齐、负载感知调度、MTP-3 投机解码、FP8 MoE 与 KV-cache offload。官方称长程 RL 端到端加速三倍以上,sample-ledger loss 低于 1%。
这条产品线自己承认了一件事:三代基座追的是同一个指标,也就是算力转化成智能的效率【直引:阶跃官方的三代叙事】。稀疏激活是这个问题在工程侧的答案。
💵 一美元的输入价,和一个更诚实的数字
价格表是这样的:输入每百万词元 1.00 美元,输出每百万词元 2.70 美元,缓存折扣给到 95%。国内定价 7 元与 20 元。
放到同一张榜单上看更清楚。Artificial Analysis 给这批同类模型的中位数是输入 1.88 美元、输出 10 美元。Step 5 Preview 的输出单价只有中位数的两成多。
但同一份独立评测里还有一组数字:
低单价与多词元,本来是同一笔账的两头。这份评测跑完,Step 5 Preview 输出了 1.6 亿词元,同批模型的中位数是 9200 万,差不多 1.7 倍。AA 的措辞是"速度高于平均,但回答非常冗长"。这轮评测总花费约 918 美元,其中约 432 美元花在输出词元上。
所以广告里那个"单任务成本只有 Claude Opus 5 的八分之一"的说法,需要拆开看:它是阶跃自己算的口径,而 AA 那边把速度与啰嗦一起折进去之后,给出的单任务加权成本是 0.71 美元。这个数字比单看价格表可靠得多【判断:此处目的只在提示比价需用同一分母】。
公平地说一句:在金融、Agent、软件工程这类硬任务上,愿意多吐词元的模型往往更扛得住长思考。冗长既是能力评价,也是账单,两头都得认【判断】。
📊 44 分是怎么来的:两份尺子,两种口径
Artificial Analysis 的 Intelligence Index v4.3.2 给 Step 5 Preview 打了 44 分,在 200 个参评模型里排第 24 位:与 Kimi K3 同档,比 GLM-5.3 低 1 分(见前图)。
阶跃的宣传稿把 44 分描述为"挤进全球开源模型前三"。这两句话不冲突:开源阵营的前排确实坐进去了,离绝对前沿还差一截【推论】。
厂商自测的那一栏里,StepCodeBench 是阶跃自建的,覆盖 553 个独立代码仓库、9 类任务、33 种编程语言。拿自己的尺子量自己,分数好看是正常的;好处是 553 个仓库的覆盖面比只测单一语言的窄榜单有信息量,代价是构建与管理的口径仍掌握在厂方手里【判断】。
Terminal-Bench 4.0 这一项,独立评测记录到 33.3%:高于 DeepSeek V4.1 Flash 的 26.8%,远高于 Kimi K3 的约 12.6%;但低于 GLM-5.3 的 41.9%、Claude Opus 5 的 52.3% 与 GPT-6 Astra 的 57.9%。这道题的差距比宣传稿里呈现的更大。
最亮的是金融。FrontierFinance 拿到 66.4 分,这也是官方重点展示的一块。
用一张表把三条路线摆在一起,量级差异比单看一个模型清楚得多。
Step 5 Preview 与同期国产旗舰的稀疏路线对照
| 模型 | 总参数 | 每词元激活 | 激活占比 |
|---|---|---|---|
| Step 5 Preview | 约 600B | 约 27B | 4.5% |
| DeepSeek V4.1 Flash | 552B | 8B–16B | 非对称激活 |
| GLM-5.3-Flash | 320B | 18B | 约 5.6% |
三条路线的共同点只有一句话:把每个词元要动的算力压进两位数【推论】。
🔧 那台跑了 24 小时的机器,和一份没被解决的问题清单
官方披露里最像"干活"的一项是 GPU Kernel 优化:在一项持续 24 小时的任务里,模型把 MLA 内核的峰值推到 508 TFLOPS,对照的 Claude Opus 5 是 493。同一批材料里还有一个自动化后训练实验:把 Qwen3-30B-A3B 在 AIME24 上的成绩从 53.3% 提到 60%。
这些数字属于上面那张图的右半边,也就是官方自测。它们记录的是"能做什么",不是"在别人手里也能做到什么"【推论】。
第四项值得单独说。此前在开发者工具链里流传的一份第三方配置把这款模型记成 35 万词元上下文、最大输出 6.4 万词元。官方发布把 100 万写进了自己的规格表,但那份配置里的数字并没有被解释。这道缝到底来自版本差异、服务端限制还是文档混乱,发布当天没有答案【判断:属于待澄清项,不宜默认哪一方为准】。
🧭 效率这条路走通了,然后呢
把这件事放到更长的时间轴上看。
过去两年半,大模型的能力竞争主要靠堆训练算力。现在这批模型在做的是另一件事:把"每一次调用要花多少钱"当作一等公民来设计。稀疏激活、缓存折扣、投机解码、KV offload,全都是围绕这个目标堆起来的工程件。
Step 5 Preview 证明的是效率这条路走得通。它还没有证明能力追平前沿:Terminal-Bench 上 8.6 分的差距、AA 榜单上 24 名的位次、以及需要在官方基准表里混着独立分数一起读的现状,都指向同一个结论【推论】。
10 月 15 日之后,名单上的每一条都能被外人自己跑一遍。在那之前,"便宜"这个词到底省在哪一层,是省在单价、省在词元数,还是省在单任务总账,只有厂商的报价单可以回答。等权重落地,回答它的会是别人。
参考文献
- StepFun 开放平台,Step 5 Preview,2026-09-20. https://platform.stepfun.com/
- Artificial Analysis, Step 5 Preview — Intelligence Index v4.3.2 / pricing / latency,2026-09-20. https://artificialanalysis.ai/
- OrcaRouter, Step 5 Preview: what StepFun's 600B flagship really ships,2026-09-20. https://www.orcarouter.ai/blog/step-5-preview-open-weights
- RuntimeWire, StepFun launches a 600B agent model at $1 per million input tokens,2026-09-20. https://runtimewire.com/article/stepfun-step-5-preview-600b-agent-model-pricing
- Pandaily, StepFun launches Step 5 Preview, a 600B MoE model with 1M context,2026-09-20. https://pandaily.com/stepfun-step-5-preview-600b-moe-1m-context
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。