扩散模型的第三次发布会:速度还是 1107,故事换了一套
9 月 8 日,Inception Labs 发布 Mercury 2.5,官方口径是「市面最强的扩散式大语言模型」。发布会最抢眼的数字是速度:1107 token 每秒。
9 月 8 日,Inception Labs 发布 Mercury 2.5,官方口径是「市面最强的扩散式大语言模型」。发布会最抢眼的数字是速度:1107 token 每秒。
把三条历史数据摆在一起,这个数字就有了另一种读法。2025 年 2 月初代 Mercury 在 H100 上跑出 1109;2026 年 2 月 Mercury 2 换到 Blackwell,跑出 1009——比初代还慢了一点;2026 年 9 月的 2.5,1107。十九个月,三代产品,两条硬件代际,速度在原地画了一个几乎完美的圆。
扩散路线当年最锋利的卖点就是快,宣传语里写着比自回归快 5 到 10 倍。如今速度红利十九个月没有兑现出增量——那它去哪了?
红利花在了别处
2.5 的升级清单很长:上下文从 128K 翻倍到 260K,最大输出 65536,新增可调推理档位、并行工具调用、schema 化 JSON 输出。官方给的智能主张是「比 Mercury 2 智能 40%」——没有写测的是什么基准,也没有写 40% 相对什么度量。这是这次发布最倒挂的地方:初代产品当年敢一次性放出六乘七的完整基准表,三代产品反而一个具名基准都没给,对标对象全换成了同价位的轻量档——GPT-5.6 Luna Low、Gemini 3.5 Flash-Lite、Claude Haiku 4.5。同价位,不同能力级。
HN 首页的高赞批评一句话点破:速度只跟两三代前的轻量款比,智能只跟自家的上一代比。 这话刻薄,但拆解得没错。
扩散和自回归到底差在哪
结构差异带来一个扩散模型结构性占优的形态:填空。往一段代码中间补一块逻辑,自回归模型必须从左到右假装顺序生成,扩散模型天然双向,铺开就改。初代 Mercury 的填中间基准拿到 84.8,压过当时最强的 Codestral 2501 的 82.5,这是整个扩散路线迄今最硬的一个技术主张。2.5 延续了 Mercury Edit 2 的专用端点,填空和 Next-Edit 都是独立接口。API 还开放了一个 diffusing=true 参数,能把中间去噪步骤直接流式给你看——等于直播模型改稿,这在自回归那边做不到。
实测水位线
独立数据目前的缺口很大。Artificial Analysis 尚未收录 2.5;它给上一代 Mercury 2 的实测是 657 到 933 token 每秒,低于官方宣传的 1009,智能指数只给了 12 分。第三方快照 AI BENCHY 在 9 月 2 日测过一次:47% 通过率,解谜类任务强,工具调用弱,平均响应 1.31 秒。HN 上自己动手的用户评价是「能用,但远不及前沿,大致相当于上一代开源权重」;做 agentic coding 是公认短板,有用户反馈给它配自定义执行框架反而更差。
商业盘和阵容
定价:输入 0.20 美元每百万 token,输出 0.75;发布期八折,0.04 和 0.15。OpenAI 兼容 API,Baseten 和 OpenRouter 都上了。客户证言里最具体的一条来自 Augment Code:把一处流程的延迟从 150 秒压到 27 秒,成本降九成。
团队是真豪华:CEO Stefano Ermon,斯坦福教授,扩散模型方向的奠基人之一,联合创始人 Aditya Grover。5000 万美元种子轮 Menlo Ventures 领投,NVIDIA、微软 M12、吴恩达、Karpathy 都在名单里。顺带修一处流传甚广的讹误:Tri Dao 并不在创始团队里,官方材料从未点名他。
发布同场还预览了两件新品:Mercury Voice,语音扩散模型,首包延迟小于 170 毫秒;Mercury Router,用扩散模型本身来做模型路由。两个都指向同一个判断——扩散路线的主场在延迟敏感的实时场景。
生态位收束
2026 年 9 月的扩散模型版图:蚂蚁的 LLaDA 2.1 开源了百亿级权重,Dream 7B 停在学术圈,DeepMind 的 Gemini Diffusion 能力最强但从不发售。付得起钱、跑得起来的商用扩散大模型,目前只有 Mercury 一家。
它的卖点也从「快 5 到 10 倍」收缩成了四个词:够快、便宜、低延迟、260K 长上下文。卡位清晰得很——语音代理、IDE 内联补全、海量廉价子代理;正面硬刚前沿自回归的戏码,它不接了。判断这条路线成色的观察哨有两个:独立基准何时收录 2.5,以及工具调用这个短板在官方路线图里排在第几位。速度圆圈已经画完了,下一个圆得画在别处。
信源:Inception Labs《Introducing Mercury 2.5》官方博客与定价页;arXiv 2506.17298(Mercury 技术报告);TechCrunch 种子轮报道;Artificial Analysis Mercury 2 实测页;AI BENCHY 9 月 2 日快照;Hacker News 讨论串(2026-09-08)。
#AI编程 #扩散模型 #LLM推理 #Mercury