8 月 29 日 Live Science 的标题很抓眼球:新 AI 推理,成本最高只要某个 OpenAI 模型的 1/11。我去翻了原始论文(arXiv:2608.09888,Pathway 公司 8 月 10 日挂出)。数字都对。但脚注比正文精彩,这篇把两边都讲讲。
**主数字。**BDH-CQ,1.5 亿参数,ARC-AGI-1 公开评估集 400 题,pass@2 = 118/400 = 29.5%(95% 置信区间 25.2–34.2),自报推理成本每题 0.0007 美元。对照组 GPT-5.6 Luna(Low):34.2%,每题 0.040 美元(ARC Prize 排行榜价)。四舍五入就是"分数略低、成本便宜一个数量级"。
先说便宜几倍这件事,因为它比看上去曲折。论文原话是便宜 57 倍——按排行榜 8 月初的旧价。7 月 30 日 OpenAI 把 Luna 降价 80%,57 倍缩水成 11 倍。而且这是两把尺子量出来的:自己这头是硬件时间折算成本,对手那头是 API 标价。Live Science 标题取了保守的 11 倍,方向没错,但严格讲这不是同口径比较。我画出来你感受下差距本身——
**架构才是正菜。**Transformer 的账人人皆知:每个新 token 都要回头读全部上文,KV 缓存随对话长度一路膨胀,长任务 agent 的账单大头都在这。BDH 这套换成完全不同的记账法——
前作《Dragon Hatchling》(arXiv:2509.26507,2025 年 9 月)打的地基:把模型看成一群"神经元粒子"构成的图,推理期工作记忆全靠突触可塑性就地改写,不靠外挂文本。新论文 BDH-CQ 在这上面加了结构化潜工作区,推理时在潜空间里迭代循环——不给权重更新,靠演示对刷新递归记忆做上下文内适应。官方库 pathwaycom/bdh 有 3,531 星,lucidrains 8 月中已经出了独立实现。
一个细节要替论文澄清:Live Science 写"跑 200 圈和 20 圈耗的内存一样",论文里没有这句原话,是记者转述。架构上递归状态维度固定,说得通;但 Table 5 显示推理档位往下调(LOW)省 22% 成本要掉 8.5 个点。省的是时间,不是账单,两码事。
**三个没进新闻稿的脚注。**一,所谓"独立复现"——被点名的 Richard Zhong(NYU)和 Kinas(Bielik)都是论文共同作者,做的是黑盒、不给权重的协议化复验。独立,但没脱产学。二,Kaiser 那句漂亮的背书——"架构而不只是规模,能驱动下一次推理跃迁"——出自行家没错,《Attention Is All You Need》共同作者。但他的现职是 OpenAI 研究员,同时是 Pathway 的投资人兼顾问。前者 Live Science 没提,后者 Pathway 自己的博客披露了。三,ARC 分数不是零样本:模型在含 ARC-AGI-1 训练集的题风数据上特训过。ARC Prize 至今没做第三方审计——他们 2025 年拆 HRM 那次发现,大半收益来自外循环精化而非架构本身。前车之鉴摆在那。
**也说句公道话。**厂商敢放弱点数据:ConceptARC 里计数类概念只对 2/10;分布外测试做了——图可达性任务,距离 2 到 6 保持 pass@2,距离 7 到 8 崩到 1/24。只晒 SOTA 的公司见多了,肯晒塌方区的少。这比多数"吊打 GPT"的通稿体面。
为什么值得盯:现在推理成本的所有创新都困在 Transformer 框子里——KV 压缩、蒸馏、量化,全是在给"重读一切"这个设定打补丁。如果"固定记忆足迹的潜空间迭代"在规模化后依然成立,长任务 agent 的成本曲线会换斜率。这正是 agentic coding 最疼的地方:读一小时代码,烧一小时钱。
600B 参数的 scaling 实验已经启动。1B 上的早期曲线说明不了太多。我不知道这条路走到几百亿参数时潜推理优势还在不在——ARC-AGI-2 上见。
参考资料:论文 arXiv:2608.09888|前作 arXiv:2509.26507|Pathway 官方博客|Live Science 报道(2026-08-29)|GPT-5.6(OpenAI)|ARC Prize 的 HRM 拆解(2025)
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。