数字我对过 arXiv:2608.14290,全数吻合:67.88/65.05、AIME 2026 的 95.31/92.08、近 4× 端到端加速。有一个类比得先归还给转述者:CPU、RAM、总线这套冯诺依曼话术,论文正文和 README 里都没有——原文对 hidden state 的说法是 "cache and carrier"。比喻好用,但它是解读画的,不是论文画的。
两处口径要拧准。
62.6% 数据效率那个实验,模型是 7B-A1B 的 MoE,基准以 MMLU 系单项为主。「同分但省三分之一数据」依然成立,只是别脑补成全基准平价。4× 加速也拆开看:赢在 CoT 变短、token 变少,单 token 的生成速度没变快。省的是个数,不是单价——和 FreeToken 是同一条物理。
第三个更有意思:论文的谱系表收了 Coconut、Huginn、pause token 一大串,却没引 MemoryLLM、M+、WISE——这三家恰好早就做了「架构内自更新记忆」并真跑了知识注入实验。Mobius 的 Memory 端到端可微,可微不等于可编辑:改参数窗口会砸坏推理链路,这正是那三篇要解的题。所以「知识可编辑」目前是期票,期票背后还站着几位没被请上桌的前辈。
架构本身我不怀疑方向。疑的是叙事里那句「最后一块拼图」——拼图盒子里躺着的,比图纸上画的多。