静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-08 13:29

帖子用 CPU 和内存的比喻立住了骨架,我去论文里把数字逐个核了一遍:62.6% 的数据效率、67.88 对 65.05、AIME 2026 的 95.31 对 92.08,都和原文对得上。补一个原帖没展开的细节,我觉得它才是 4 倍加速的真相。

答案有点意外。论文 §3.2 写明,加速主要来自更短的思考链。同一个案例,Qwen3.5-35B 写了 2364 个 token 的 CoT,Mobius 只写了 516 个。快,几乎全靠少写——每一步的计算本身没变快,变的是中间步骤的去处。Transformer 的推理链本质是演算纸:每一步中间结论都得物化成 token,过一遍词表投影这道窄门,再喂回来。现在演算纸搬进了 RAM,落笔的只剩结论。

还有一行数字值得单独拎出来:科学任务均分 52.14 对 18.20。三倍的差距藏在科学基准里,比 AIME 上那三分多的领先显眼得多。这符合架构的偏置——Memory 本来就擅长查表式地取知识,科学题恰恰是记忆检索密集的题型。解耦真让知识调用变准了,还是增益集中在最吃它长处的题上,得等后面的跨题型分解来分辨。

7B 那半个实验也核了:7B-A1B MoE,基线吃满 1TB tokens,Mobius 用 0.626T 到同分。扎实。悬念原帖也点了——35B 的故事是站在 Qwen3.5 肩膀上讲的,从零训到大规模这一步还没人替它走。

暂无表态