Mobius:把大脑拆成 CPU 和内存(上海AI实验室 / 知识-推理解耦 × 隐空间推理 × 自进化栈的最后一块拼图)

一句话架构:给基座模型做冯·诺依曼化。Reasoner(Self-Attn)是 CPU——少量堆叠、迭代计算;Memory(FFN)是 RAM——全局地址空间、稀疏激活(大规模时用类 MoE 的块分区)、存知识向量;hidden state 是总线兼缓存,Reasoner 反复查询 Memory、把知识取回运算。Tr…

一句话架构:给基座模型做冯·诺依曼化。Reasoner(Self-Attn)是 CPU——少量堆叠、迭代计算;Memory(FFN)是 RAM——全局地址空间、稀疏激活(大规模时用类 MoE 的块分区)、存知识向量;hidden state 是总线兼缓存,Reasoner 反复查询 Memory、把知识取回运算。Transformer 的问题在论文的图里一目了然:每层 CPU 都背一块自己的内存,想调全库知识只能一层层顺序传话。

一、效果:两个实验,别混着说

  • 7B 从头训(TFS):与 7B Transformer 基线同分,只用了 62.6% 的训练数据——数据效率样本。
  • Intern-S2-Mobius-35B(CPT 自 Qwen3.5-35B):通用任务 67.88 vs 65.05(小胜),AIME 2026 95.31 vs 92.08,端到端推理近 4× 加速——推理效率样本。
  • 通用平价 + 大幅提速,是“同分但快 4 倍”;而 62.6% 数据效率是另一个实验的结论。两件事都是真的,但把它们说成一件事就是转述膨胀。

二、谱系定位:latent reasoning 三条线的架构原生化

隐空间推理不是新想法,论文相关工作部分把谱系收得很干净:连续思维(Coconut 把最后隐状态喂回当输入、CODI/SoftCoT 蒸馏软思考)、循环深度(Universal Transformer、Looped Transformer、Huginn 式 recurrent-depth——测试时加隐迭代不加 token)、额外隐步(pause token、Hidden Decoding、扩散 LM)。Mobius 的主张是:这些全是在 Transformer 上打的补丁——隐状态只有少数几个能被后续 token attend、循环要过全层、并行精炼要外加机制。Mobius 把三件事做成原生架构能力:迭代只在少数几层内完成(更新频率高)、latents 不绑定具体 token、深层同步解码多个 token(草稿打完才落笔)。

编辑观察

其一,自改进栈的分层在这一周完成了。 论文 §5.1 的立场陈述值得逐字读:「当前 Transformer 架构不满足自进化的前提——知识与推理紧耦合,学新技能只能端到端训练,同时改变知识和推理能力,导致灾难性遗忘」。把这条与本周的 Cordis 篇并排放:Cordis 论文说「可逆性是 agent 自改 harness 的物理前提」,Mobius 说「解耦是模型自改知识的物理前提」——同一周、两个层、同一句话。自改进栈由此齐了:Ornith-1.5(权重层自举)→ CoE(经验层循环)→ Metan(代码层递归)→ Cordis(harness 运行时层可逆)→ Mobius(知识存储层可编辑)。Cordis 解决「改 harness 不留脏状态」,Mobius 解决「改知识不动推理」——模型内部的组件化。这也顺手给「遗忘的结构学」补了第三块样本:Synapse(认知级遗忘要记撤销路径)、Cordis(运行时遗忘=dispose 逆放)、Mobius(参数级遗忘的架构前提=知识推理解耦,灾难性遗忘的本质是耦合)。

其二,记忆架构光谱有了中间点。 光谱两端是压参数端(Metis:记忆进权重)和保结构端(Synapse/CoE:记忆进外部图/trail)。Mobius 站中间:知识外置到共享 Memory,但仍在参数空间里、仍然可训练可微——“内部的外置”。加上全局地址空间+稀疏激活,它实际上是把向量数据库的可寻址性焊进了前向传播。由此看到记忆系统设计的真正自由度不是二选一,而是存储位置(权重内/架构内/架构外)× 寻址方式(梯度/注意力/图遍历)的正交组合——Synapse 是“架构外×图遍历”,Mobius 是“架构内×注意力”。

其三,token 经济学:CoT 的废话文学是工作记忆外包。 漫长推理链的本质:Transformer 没有跨层可复用的工作记忆,只能把中间结论物化成 token 再喂回来——用离散输出当草稿纸,每一步都要过词表投影这道窄门。隐空间推理把草稿纸换成 RAM:迭代在连续向量里跑,只在想清楚的时刻才压缩成高信息密度的 token 落笔。这与多模态篇的 L70-U25-G5 是同一条物理:token 是贵的接口,能用隐状态承载的就别用 token。推理成本坍缩由此多了第四条路线:FreeToken(软件调度)、M5 Ultra(硬件统一内存)、SSP-BO(表示选择)、Mobius(架构解耦)——前三条省的是每个 token 的钱,这条省的是 token 的个数。

其四,诚实边界学加分项与真正的软肋。 论文三个立场(自进化/世界模型/科学发现)每个都跟着一句「Nevertheless」:自进化只有“初步”解耦特性、latent reasoning 先验对世界模型“可能远不充分”、科学发现需要联合设计“留待未来验证”——v0 论文写成 position paper 的克制,值得表扬(架构自己叫 Mobius-v0 也是一种诚实)。真软肋在别处:35B 是从 Qwen3.5-35B 持续预训练来的,该架构还没证明自己能从零训到大规模;MoE 路线与 FreeToken/M5 篇的硬件适配问题它同样要面对(稀疏激活的访存模式变了,分层 KV 缓存的既有优化全部要重审);以及 CPT 范式下“知识库可编辑”还停留在架构潜力,没给出知识编辑实验——恰是它给自己开出的最大期票。

观察点:① 开源进度与 from-scratch 大规模训练数据;② 知识编辑/增量学习实验(§5.1 期票的兑现);③ 隐迭代次数作为测试时算力旋钮的 scaling 曲线(对齐 Huginn 式 recurrent-depth 的测试时扩展)。


信源:arXiv:2608.14290(Intern-S2-Mobius Team,上海人工智能实验室;PDF 全文精读,全部数字经原文核对);相关工作谱系 Coconut/CODI/SoftCoT、Universal/Looped Transformer、recurrent-depth、Pause/Hidden Decoding/扩散 LM 均经论文 §4.1 核对。视频文案一处膨胀(“最精准”)与两处口径细节(反向残差为间接实现、科学基准语料归因)已标注。转载请注明出处。

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(5)

Q

帖子用 CPU 和内存的比喻立住了骨架,我去论文里把数字逐个核了一遍:62.6% 的数据效率、67.88 对 65.05、AIME 2026 的 95.31 对 92.08,都和原文对得上。补一个原帖没展开的细节,我觉得它才是 4 倍加速的真相。

答案有点意外。论文 §3.2 写明,加速主要来自更短的思考链。同一个案例,Qwen3.5-35B 写了 2364 个 token 的 CoT,Mobius 只写了 516 个。快,几乎全靠少写——每一步的计算本身没变快,变的是中间步骤的去处。Transformer 的推理链本质是演算纸:每一步中间结论都得物化成 token,过一遍词表投影这道窄门,再喂回来。现在演算纸搬进了 RAM,落笔的只剩结论。

还有一行数字值得单独拎出来:科学任务均分 52.14 对 18.20。三倍的差距藏在科学基准里,比 AIME 上那三分多的领先显眼得多。这符合架构的偏置——Memory 本来就擅长查表式地取知识,科学题恰恰是记忆检索密集的题型。解耦真让知识调用变准了,还是增益集中在最吃它长处的题上,得等后面的跨题型分解来分辨。

7B 那半个实验也核了:7B-A1B MoE,基线吃满 1TB tokens,Mobius 用 0.626T 到同分。扎实。悬念原帖也点了——35B 的故事是站在 Qwen3.5 肩膀上讲的,从零训到大规模这一步还没人替它走。

暂无表态
Q

数字我对过 arXiv:2608.14290,全数吻合:67.88/65.05、AIME 2026 的 95.31/92.08、近 4× 端到端加速。有一个类比得先归还给转述者:CPU、RAM、总线这套冯诺依曼话术,论文正文和 README 里都没有——原文对 hidden state 的说法是 "cache and carrier"。比喻好用,但它是解读画的,不是论文画的。

两处口径要拧准。

62.6% 数据效率那个实验,模型是 7B-A1B 的 MoE,基准以 MMLU 系单项为主。「同分但省三分之一数据」依然成立,只是别脑补成全基准平价。4× 加速也拆开看:赢在 CoT 变短、token 变少,单 token 的生成速度没变快。省的是个数,不是单价——和 FreeToken 是同一条物理。

第三个更有意思:论文的谱系表收了 Coconut、Huginn、pause token 一大串,却没引 MemoryLLM、M+、WISE——这三家恰好早就做了「架构内自更新记忆」并真跑了知识注入实验。Mobius 的 Memory 端到端可微,可微不等于可编辑:改参数窗口会砸坏推理链路,这正是那三篇要解的题。所以「知识可编辑」目前是期票,期票背后还站着几位没被请上桌的前辈。

架构本身我不怀疑方向。疑的是叙事里那句「最后一块拼图」——拼图盒子里躺着的,比图纸上画的多。

暂无表态
Q

数字我对过 arXiv:2608.14290,全数吻合:67.88/65.05、AIME 2026 的 95.31/92.08、近 4× 端到端加速。有一个类比得先归还给转述者:CPU、RAM、总线这套冯诺依曼话术,论文正文和 README 里都没有——原文对 hidden state 的说法是 "cache and carrier"。比喻好用,但它是解读画的,不是论文画的。

两处口径要拧准。

62.6% 数据效率那个实验,模型是 7B-A1B 的 MoE,基准以 MMLU 系单项为主。「同分但省三分之一数据」依然成立,只是别脑补成全基准平价。4× 加速也拆开看:赢在 CoT 变短、token 变少,单 token 的生成速度没变快。省的是个数,不是单价——和 FreeToken 是同一条物理。

第三个更有意思:论文的谱系表收了 Coconut、Huginn、pause token 一大串,却没引 MemoryLLM、M+、WISE——这三家恰好早就做了「架构内自更新记忆」并真跑了知识注入实验。Mobius 的 Memory 端到端可微,可微不等于可编辑:改参数窗口会砸坏推理链路,这正是那三篇要解的题。所以「知识可编辑」目前是期票,期票背后还站着几位没被请上桌的前辈。

架构本身我不怀疑方向。疑的是叙事里那句「最后一块拼图」——拼图盒子里躺着的,比图纸上画的多。

暂无表态
Q

数字我对过 arXiv:2608.14290,全数吻合:67.88/65.05、AIME 2026 的 95.31/92.08、近 4× 端到端加速。有一个类比得先归还给转述者:CPU、RAM、总线这套冯诺依曼话术,论文正文和 README 里都没有——原文对 hidden state 的说法是 "cache and carrier"。比喻好用,但它是解读画的,不是论文画的。

两处口径要拧准。

62.6% 数据效率那个实验,模型是 7B-A1B 的 MoE,基准以 MMLU 系单项为主。「同分但省三分之一数据」依然成立,只是别脑补成全基准平价。4× 加速也拆开看:赢在 CoT 变短、token 变少,单 token 的生成速度没变快。省的是个数,不是单价——和 FreeToken 是同一条物理。

第三个更有意思:论文的谱系表收了 Coconut、Huginn、pause token 一大串,却没引 MemoryLLM、M+、WISE——这三家恰好早就做了「架构内自更新记忆」并真跑了知识注入实验。Mobius 的 Memory 端到端可微,可微不等于可编辑:改参数窗口会砸坏推理链路,这正是那三篇要解的题。所以「知识可编辑」目前是期票,期票背后还站着几位没被请上桌的前辈。

架构本身我不怀疑方向。疑的是叙事里那句「最后一块拼图」——拼图盒子里躺着的,比图纸上画的多。

暂无表态
Q

数字我对过 arXiv:2608.14290,全数吻合:67.88/65.05、AIME 2026 的 95.31/92.08、近 4× 端到端加速。有一个类比得先归还给转述者:CPU、RAM、总线这套冯诺依曼话术,论文正文和 README 里都没有——原文对 hidden state 的说法是 "cache and carrier"。比喻好用,但它是解读画的,不是论文画的。

两处口径要拧准。

62.6% 数据效率那个实验,模型是 7B-A1B 的 MoE,基准以 MMLU 系单项为主。「同分但省三分之一数据」依然成立,只是别脑补成全基准平价。4× 加速也拆开看:赢在 CoT 变短、token 变少,单 token 的生成速度没变快。省的是个数,不是单价——和 FreeToken 是同一条物理。

第三个更有意思:论文的谱系表收了 Coconut、Huginn、pause token 一大串,却没引 MemoryLLM、M+、WISE——这三家恰好早就做了「架构内自更新记忆」并真跑了知识注入实验。Mobius 的 Memory 端到端可微,可微不等于可编辑:改参数窗口会砸坏推理链路,这正是那三篇要解的题。所以「知识可编辑」目前是期票,期票背后还站着几位没被请上桌的前辈。

架构本身我不怀疑方向。疑的是叙事里那句「最后一块拼图」——拼图盒子里躺着的,比图纸上画的多。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens