Mobius:把大脑拆成 CPU 和内存(上海AI实验室 / 知识-推理解耦 × 隐空间推理 × 自进化栈的最后一块拼图)

先过素材海关。上海 AI 实验室 Intern-S2-Mobius(arXiv:2608.14290,书生团队,Kai Chen/Dahua Lin/Ning Ding 等,08-14 提交),视频文案三大机制名词全部核到原文:知识-推理解耦(全局共享 Memory + 迭代 Reasoner)✓、Backward…

Mobius:把大脑拆成 CPU 和内存,自进化栈的最后一块拼图

先过素材海关。上海 AI 实验室 Intern-S2-Mobius(arXiv:2608.14290,书生团队,Kai Chen/Dahua Lin/Ning Ding 等,08-14 提交),视频文案三大机制名词全部核到原文:知识-推理解耦(全局共享 Memory + 迭代 Reasoner)✓、Backward Residual Connection ✓、Dynamic Latent Reasoning ✓。但有三处要校准:①「极少 token 给出最精准答案」——论文口径是 markedly fewer high-quality tokens + 近 4× 端到端推理加速,且 HLE(人类最后一考)实际掉分(19.11 vs Qwen3.5-35B 的 22.40),“最精准”言过其实;②科学任务 52.14 vs 18.20 的大胜需要打折——持续预训练语料必然向科学倾斜,归因不能全给架构;③「反向残差连接」是间接实现:不是真的反向连线,而是把知识摊平进全局共享库,浅层深层互访自动成立——这个细节比文案的说法重要得多。

一句话架构:给基座模型做冯·诺依曼化。Reasoner(Self-Attn)是 CPU——少量堆叠、迭代计算;Memory(FFN)是 RAM——全局地址空间、稀疏激活(大规模时用类 MoE 的块分区)、存知识向量;hidden state 是总线兼缓存,Reasoner 反复查询 Memory、把知识取回运算。Transformer 的问题在论文的图里一目了然:每层 CPU 都背一块自己的内存,想调全库知识只能一层层顺序传话。

一、效果:两个实验,别混着说

  • 7B 从头训(TFS):与 7B Transformer 基线同分,只用了 62.6% 的训练数据——数据效率样本。
  • Intern-S2-Mobius-35B(CPT 自 Qwen3.5-35B):通用任务 67.88 vs 65.05(小胜),AIME 2026 95.31 vs 92.08,端到端推理近 4× 加速——推理效率样本。
  • 通用平价 + 大幅提速,是“同分但快 4 倍”;而 62.6% 数据效率是另一个实验的结论。两件事都是真的,但把它们说成一件事就是转述膨胀。

二、谱系定位:latent reasoning 三条线的架构原生化

隐空间推理不是新想法,论文相关工作部分把谱系收得很干净:连续思维(Coconut 把最后隐状态喂回当输入、CODI/SoftCoT 蒸馏软思考)、循环深度(Universal Transformer、Looped Transformer、Huginn 式 recurrent-depth——测试时加隐迭代不加 token)、额外隐步(pause token、Hidden Decoding、扩散 LM)。Mobius 的主张是:这些全是在 Transformer 上打的补丁——隐状态只有少数几个能被后续 token attend、循环要过全层、并行精炼要外加机制。Mobius 把三件事做成原生架构能力:迭代只在少数几层内完成(更新频率高)、latents 不绑定具体 token、深层同步解码多个 token(草稿打完才落笔)。

编辑观察

其一,自改进栈的分层在这一周完成了。 论文 §5.1 的立场陈述值得逐字读:「当前 Transformer 架构不满足自进化的前提——知识与推理紧耦合,学新技能只能端到端训练,同时改变知识和推理能力,导致灾难性遗忘」。把这条与本周的 Cordis 篇并排放:Cordis 论文说「可逆性是 agent 自改 harness 的物理前提」,Mobius 说「解耦是模型自改知识的物理前提」——同一周、两个层、同一句话。自改进栈由此齐了:Ornith-1.5(权重层自举)→ CoE(经验层循环)→ Metan(代码层递归)→ Cordis(harness 运行时层可逆)→ Mobius(知识存储层可编辑)。Cordis 解决「改 harness 不留脏状态」,Mobius 解决「改知识不动推理」——模型内部的组件化。这也顺手给「遗忘的结构学」补了第三块样本:Synapse(认知级遗忘要记撤销路径)、Cordis(运行时遗忘=dispose 逆放)、Mobius(参数级遗忘的架构前提=知识推理解耦,灾难性遗忘的本质是耦合)。

其二,记忆架构光谱有了中间点。 光谱两端是压参数端(Metis:记忆进权重)和保结构端(Synapse/CoE:记忆进外部图/trail)。Mobius 站中间:知识外置到共享 Memory,但仍在参数空间里、仍然可训练可微——“内部的外置”。加上全局地址空间+稀疏激活,它实际上是把向量数据库的可寻址性焊进了前向传播。由此看到记忆系统设计的真正自由度不是二选一,而是存储位置(权重内/架构内/架构外)× 寻址方式(梯度/注意力/图遍历)的正交组合——Synapse 是“架构外×图遍历”,Mobius 是“架构内×注意力”。

其三,token 经济学:CoT 的废话文学是工作记忆外包。 漫长推理链的本质:Transformer 没有跨层可复用的工作记忆,只能把中间结论物化成 token 再喂回来——用离散输出当草稿纸,每一步都要过词表投影这道窄门。隐空间推理把草稿纸换成 RAM:迭代在连续向量里跑,只在想清楚的时刻才压缩成高信息密度的 token 落笔。这与多模态篇的 L70-U25-G5 是同一条物理:token 是贵的接口,能用隐状态承载的就别用 token。推理成本坍缩由此多了第四条路线:FreeToken(软件调度)、M5 Ultra(硬件统一内存)、SSP-BO(表示选择)、Mobius(架构解耦)——前三条省的是每个 token 的钱,这条省的是 token 的个数。

其四,诚实边界学加分项与真正的软肋。 论文三个立场(自进化/世界模型/科学发现)每个都跟着一句「Nevertheless」:自进化只有“初步”解耦特性、latent reasoning 先验对世界模型“可能远不充分”、科学发现需要联合设计“留待未来验证”——v0 论文写成 position paper 的克制,值得表扬(架构自己叫 Mobius-v0 也是一种诚实)。真软肋在别处:35B 是从 Qwen3.5-35B 持续预训练来的,该架构还没证明自己能从零训到大规模;MoE 路线与 FreeToken/M5 篇的硬件适配问题它同样要面对(稀疏激活的访存模式变了,分层 KV 缓存的既有优化全部要重审);以及 CPT 范式下“知识库可编辑”还停留在架构潜力,没给出知识编辑实验——恰是它给自己开出的最大期票。

观察点:① 开源进度与 from-scratch 大规模训练数据;② 知识编辑/增量学习实验(§5.1 期票的兑现);③ 隐迭代次数作为测试时算力旋钮的 scaling 曲线(对齐 Huginn 式 recurrent-depth 的测试时扩展)。


信源:arXiv:2608.14290(Intern-S2-Mobius Team,上海人工智能实验室;PDF 全文精读,全部数字经原文核对);相关工作谱系 Coconut/CODI/SoftCoT、Universal/Looped Transformer、recurrent-depth、Pause/Hidden Decoding/扩散 LM 均经论文 §4.1 核对。视频文案一处膨胀(“最精准”)与两处口径细节(反向残差为间接实现、科学基准语料归因)已标注。转载请注明出处。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens