原文:DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning
机构:UC Berkeley(Song Mei / Stuart Russell / Jiantao Jiao 组)+ Princeton
时间:2026-07-02 | arXiv 2607.00341 | 16 页 7 图
若以两个数字概括全文,莫过于此:
第一循环之后,模型对「桥接实体」Bob 的判别置信度是满分,可它的隐藏态与 Bob 的干净词嵌入之间的几何对齐度,只有 0.3。
「能解码出来,却用不上。」——这条裂缝,正是普通循环 Transformer 在隐式多跳推理上没能封顶的真正病根。而 DiscoLoop 所做的,本质上就是把这条裂缝焊上,而且是可微、全位置、每一跳都焊。更绝的是:焊这道缝,只多了 d+1 个参数。
1. 缘起:什么叫「隐式多跳推理」
今之大模型,靠长链 Chain-of-Thought(CoT)在数学、代码上刷分。然则世间许多问题,推理步骤本该发生在一次前向传播的内部,而非被啰嗦地吐成一堆中间 token。
一个理想的智能体,应把原子事实存进权重,需要时在前向里现场隐式组合,而非把每一步都写在上下文里。论文用最基础的两跳推理来抠这个能力:
- 原子事实 A:Alice 的儿子是 Bob
- 原子事实 B:Bob 的妻子是 Carol
- 复合问题:Alice 的儿子的妻子是谁? → 答案 Carol,其中 Bob 是桥接实体(bridge entity)
关键约束:训练时,原子事实和两跳问题是分开的样本;模型被要求直接从 (Alice, 儿子, 妻子) 预测 Carol,中间不生成 Bob。换言之,事实必须存进权重,组合必须在一次前向里隐式完成。这便是「隐式多跳推理」(implicit multi-hop reasoning)。
形式化地,知识图 \(\mathcal{G}=(\mathcal{E},\mathcal{R},\mathcal{F})\) 上的推理规则为:
看似简单,标准 Transformer 却屡屡翻车。
2. 病根第一层:深度局部存储问题
标准非循环 Transformer 靠一种「深度方向电路(depth-wise circuit)」来解两跳:不同深度的层分配不同角色——浅层从 (Alice, 儿子) 恢复桥接实体 Bob,深层再用 Bob 检索第二跳答案 Carol。
此分工要求:第二跳事实(Bob 的妻子是 Carol)必须在检索发生的较晚层可用。可若该事实在训练时只以「原子事实」出现、从未以「第二跳组合」的角色出现,训练便鲜少直接施压,逼它在该深度就位。这便是论文归因的 depth-local storage problem(深度局部存储问题)。
考据一则:此术语实为 DiscoLoop 凝练自创。Biran et al. 2024《Hopping Too Late》以「hopping too late」描述同象;Wang et al. 2024 的符号两跳任务才是其直接源头;而常被一并引用的《Universal Length Generalization with Turing Programs》(Hou 2024) 实是 CoT 数据/提示策略,非架构循环,不应归入此谱系。
那么,循环 Transformer(looped / weight-tied Transformer)能否治此病?
3. 病根第二层:循环 Transformer 治了存储,却露出表征错位
循环 Transformer 把同一个 Transformer 块 \(f_\theta\) 递归应用 \(K\) 次(论文设 \(K=2\) 以匹配数据最大推理深度),复用同一份参数化记忆:
第一循环恢复桥接,下一循环查询同一记忆解第二跳——实验印证:循环确实把 OOD 准确率从近乎 0 拉到了一个「非平凡」的数。然离满分尚远。
论文用一套「机械可解释性」的锋利诊断,钉死了剩余病根在 表征 而非存储。表 1(b) 给出位置 1(即 \(r_1\) 处)、第一循环后:
| 量 | test_id | test_ood |
|---|---|---|
| \(P(b\mid \mathbf{H}_1^{(1)})\)(桥接实体后验) | 1.000 | 1.000 |
| \(\cos(\mathbf{H}_1^{(1)}, \mathbf{W}[b])\)(隐藏态与桥接嵌入余弦) | 0.327 | 0.266 |
这两个数字,是全篇最「一击致命」之发现。其义如下:
- 判别(decodability)是极弱约束:\(P(b)\approx 1\) 只要求 \(\langle\mathbf{W}[b], \mathbf{h}\rangle \gg \langle\mathbf{W}[v], \mathbf{h}\rangle\ (\forall v\neq b)\),即 \(b\) 的 logit 最大且间隔够大、令 softmax 饱和。它不约束 \(\mathbf{h}\) 在嵌入子空间正交方向上堆了什么。
- 对齐(alignment)是强约束:余弦仅 0.3,说明 \(\|\mathbf{h}\|\) 被大量「判别无关」分量主导——\(\mathbf{h}\) 可在 \(\mathbf{W}[b]\) 方向上有一「够用」的正分量,同时在无数与判别无关的方向上堆着巨大模长。
于是第二循环吃到的输入,是偏离流形、正交垃圾巨大的 \(\mathbf{H}^{(1)}\);而 \(f_\theta\) 的注意力/MLP 近邻匹配,对输入的方向与流形归属极其敏感,而非对「线性可解码性」敏感。同一个 \(f_\theta\) 被要求在两圈里消化两种质地完全不同的输入分布——第一圈是干净的 \(\mathbf{W}[x]\),第二圈是含噪的 \(\mathbf{H}^{(1)}\)。这本质是施加在 \(f_\theta\) 输入端的训练–推理分布漂移。
一句话:decodability ≠ usability(能解码 ≠ 可用)。此论断有 logit lens(nostalgebraist 2020)、tuned lens(Belrose 2023)、以及 NeurIPS 2025《Decodability, and Vice Versa》作外部坐标;DiscoLoop 的新意,在于把它量化、机制化到了「循环 Transformer 残差」这一具体裂缝上。
4. 因果探针:一个不动权重的干预,OOD 8.3% → 近 100%
若病根真在「表征错位」,那只要在循环之间把桥接位置的隐藏态 重新对齐 到干净嵌入,应当就能修复。论文据此设计了一个 训练无关 的因果干预(Eq. 3):
其中 \(b_{\max}=\arg\max(\mathbf{W}\mathbf{H}_1^{(1)})\) 为 top-1 解码 token;干预仅作用于位置 1、且仅在循环 1→2 之间。这是「不动任何权重、只在推理时改一个位置的一个中间向量」的干净因果验证。
扫描 \(\alpha\) 之效(图 2 右):
- \(\alpha=0.1\):OOD 准确率从 8.3% → 25.9%
- \(\alpha\approx 0.5\):ID 与 OOD 双双逼近 100%,OOD 上超十倍增益
此一干预,直接把病根从「存储」钉死在「表征」。它同时揭示:循环 Transformer 修好了「事实存在错误的深度」,却留下「桥接卡在错误的几何形态」。
5. DiscoLoop 架构:把干预焊进循环
基于上述洞察,论文把「已被因果验证的干预」参数化为架构。核心思想:循环递归中,残差流(residual stream)不仅携带连续隐藏态,还注入通过 LM head 读出的 干净离散嵌入通道。
递归方程(Eq. 4):
其中 \(\tilde{\mathbf{H}}^{(0)}=\mathbf{W}[x]\),\(\odot\) 为行乘(逐 token 缩放),\(\boldsymbol{\alpha}^{(k)}\) 为 token 级门。
软 decode–encode 算子 \(\Phi\)(Eq. 5):在每个位置独立应用,为 token 嵌入的加权平均(温度 \(\tau>0\)):
其妙处在于:无论 \(\mathbf{h}\) 多「脏」,\(\Phi(\mathbf{h})\) 恒落在嵌入行向量的凸包内,构造上即为 embedding-like 的向量——它绝不会跑到流形之外去。RMSNorm 控制尺度,门控决定注入多少。
token 级门控(可学习变体,Eq. 6):
门以解码内容 \(\Phi(\mathbf{H})\) 为条件,故模型可在「解码分布有信息」的位置强注入离散嵌入,在别处关掉注入。
参数效率之关键陈述——论文明言:
The learnable variant introduces only d+1 extra parameters in total (a single vector \(\mathbf{w}_\alpha\) and bias \(b_\alpha\) shared across loops and positions), which is negligible relative to the size of \(f_\theta\).
即可学习变体仅增 d+1 个参数(向量 \(\mathbf{w}_\alpha\in\mathbb{R}^d\) 与偏置 \(b_\alpha\),跨所有循环与位置共享)。固定门变体设 \(\boldsymbol{\alpha}^{(k)}\equiv\alpha^\star\mathbf{1}_T\);最终预测前设 \(\boldsymbol{\alpha}^{(K-1)}\equiv\mathbf{0}\),即最后一圈不注入——当 \(K=2\) 时,恰好只在两圈交界注入一次,与第三节硬干预严丝合缝。
架构坐标(四方 PK 之乙路):DiscoLoop 之「双通道」(连续隐藏态 + 离散嵌入)对比——Vanilla Loop 仅连续、PonderLM 仅离散、DiscoLoop 两者并行,为论文自述。其真实增量在于:\(\Phi(\mathbf{h})\) 构造上恒落词表嵌入凸包(vocabulary-grounded),而 PonderLM 直接回灌原始隐态(易 off-manifold);DiscoLoop 在权绑循环内 并行 保留连续 \(\mathbf{H}\) 并注入解码嵌入,而非用嵌入替换循环输入。d+1 轻量名副其实——比 LoRA rank-1(2d)与 FFN adapter(百万级)更轻。但须诚实指出:「软离散嵌入注入」非首创——LT-Tuning(Liu et al. 2026-02,用 \(\mathbf{e}_{\mathrm{pred}}=\sum P(w)\mathbf{E}(w)\) 与隐态融合)机制近同且更早;DiscoLoop 之特异性在「软离散嵌入注入权绑循环 + 并行连续通道 + d+1 门」之组合。另,论文称 PonderLM「仅离散」系宽松说法(其本就是连续/嵌入空间法),且 Related Work 未引 Universal Transformer / ACT / PonderNet 主线,有先验缺口。
6. 实验数字:从 8.3% 到 95%
论文在三个递增真实的设定上评估。
设定一:符号两图数据集(§5.1)。GA 训练部分两跳,GB 只训练原子事实、所有两跳作 OOD。三模型对比:
| 模型 | ID 准确率 | OOD 准确率 |
|---|---|---|
| Non-looped(堆叠 K 个非绑定层) | < 20% | ≈ 0% |
| Vanilla looped(Eq. 2) | 71.1% | 8.3% |
| DiscoLoop(固定门 \(\alpha^\star=1\)) | 接近完美 | 接近完美 |
Non-looped 基线 ID<20%/OOD≈0% 有力支撑「深度局部存储」假设;DiscoLoop 在约 epoch 500 后 ID/OOD 均 >80%,近乎封顶。
设定二:合成自然语言(§5.2),两种提问格式(direct / reverse):
| 模型 | ID | OOD |
|---|---|---|
| Non-looped | direct ~40% / reverse ~20% | ≈ 0% |
| Vanilla looped | ~90% | 失败(reverse 尤甚) |
| DiscoLoop | ~100% | ~95% |
设定三:真实语言建模预训练(§5.3),440M 参数、20B token、循环步 4、词表 129k,7 个标准基准平均零样本:
| 模型 | Avg.(7 基准) |
|---|---|
| Vanilla loop | 49.3 |
| PonderLM | 49.8 |
| DiscoLoop(本文) | 50.5 |
DiscoLoop 在 7 个基准中 6 个最优或并列最优(ARC-C 32.6、ARC-E 57.6、HellaSwag 44.2、LAMBADA 37.6、PIQA 68.4、RACE 31.3、SciQ 81.5),且训练损失在约 13B token 后低于 vanilla loop。此外,三跳扩展中 OOD 约 65%(远未封顶,见第八节)。
7. 四方 PK 之批判视角:哪些惊叹要打折
步子哥既令发起会议、整合 PK,吾将四路子代理(机理文献、架构坐标、实验严谨、落地前瞻)之异见归并如下。
(一)基线公平?——基本成立。 第三方解读(kuazhi)明确辩护:GB 全组合 OOD 设定比 Kohli et al. 2026 仅留 5% 原子事实更严,vanilla 基线公平;8.3% 反映真实 OOD 组合泛化失败,非伪迹。故此质疑不成立。
(二)规模与统计显著性?——真实担忧。 440M / 20B 上平均分仅 49.3→50.5(+1.2),训练损失差约 \(10^{-2}\),且 全文未见误差杆与多种子。+1.2 或被种子/数据方差淹没,显著性未证。
(三)tied-embedding 绑定依赖?——真实局限。 \(\Phi\) 机制以 \(\mathbf{W}\) 同作 embed/unembed 为前提,全文只用 tied embedding,对 untie 只字未提;而现代大模型多 untie embedding,机制可移植性未论证。
(四)\(\Phi\) 推理开销未诚实计价?——属实。 每注入一圈需一次全词表 unembedding(V≈129,280 维 softmax),虽用 top-k=128 近似省了再编码求和,但取 top-k 仍须全 V 解码;论文「FLOP 对齐」指骨干应用次数,未给 vs vanilla loop 的增量 wall-clock / FLOPs 对照。
(五)缺监督桥接对齐损失 baseline?——论证链缺口。 论文只有免训练干预与无监督 \(\Phi\) 通道,未设「直接把 \(\mathbf{H}\) 对齐到 \(\mathbf{W}[b]\)」的辅助损失对照;若有该 baseline 且同样有效,则「架构改动」之必要性被削弱,无法隔离「架构改动」vs「目标函数改动」之贡献。
(六)门控张力 \(\alpha\approx0.5\) vs \(\alpha^\star=1\)?——真实但较轻。 硬干预扫出最优凸组合 \(\alpha\approx0.5\),架构却用加性 \(\alpha^\star=1\)(符号/三跳),自然语言改用可学门却无消融交代切换;RMSNorm 改尺度语义使二者不可直接比,作者跳过「最优点 ↔ 架构超参」对账(kuazhi 自行补了调和解释)。可学门 + RMSNorm 提供 plausible 调和,仍应明示。
(七)机制细节稀薄。 Pith T0 机器评审指出两点 major:(a) 混合通道可能引入梯度冲突/跨循环对齐丢失,论文无机制细节与隔离消融;(b) 摘要无数字、误差杆、数据集描述,故实证可验性不足。
另须补:论文 全文无 Broader Impacts 章节(伦理/安全讨论缺失)。
8. 前瞻:可插拔的 recurrence 升级块,而非范式更替
(一)在循环/权绑 LLM 谱系中的位置。 440M 预训练结果之意义,须在同期 recurrent-depth 工作中定位:Huginn-3.5B(2025,800B token)、Ouro / LoopLM(2025,7.7T token,1.4B≈12B)走「全量预训练 + 自适应深度」;LT-Tuning(2026-02)用 Context-Prediction Fusion 专门解决「循环复用 hidden state 作输入嵌入的分布错位」——与 DiscoLoop 洞见 同构。三者互补非竞争:Huginn/Ouro 解决训练配方与规模,DiscoLoop/LT-Tuning 解决循环内表征对齐。DiscoLoop 更像 可插拔的 recurrence 升级块;能否成标准组件,取决于更大脑(论文自承「larger-scale verification remains important」)是否保持迁移。
(二)对 Agent / 长上下文 / 边缘端的启示。 同方向证据充分:Coconut(Hao 2024)在 latent 空间做 BFS 式并行探索、省 token;Liquid AI 的 LFM2.5-230M(230M、19T token)已用于机器人 on-device 技能分解。隐式多跳天然契合三类场景——Agent 规划(内部推理省 token、并行候选分支)、长上下文压缩(循环深度替代输出序列膨胀)、边缘端小模型(参数高效,Ouro 已证 1.4B≈4B)。DiscoLoop 之离散通道比纯连续 latent 更易在真实模型落地。
(三)外推 >k 跳与链长天花板。 论文自承「训练 ≤k 跳能否外推 >k 跳」是开放问题,三跳 OOD 仅 ~65%。同期 Kohli et al. 2026 在 recurrent-depth 上证明深度外推可行但存在「overthinking」——过度循环反而降低深组合泛化。离散通道修复了「对齐」,但随链长收益递减,>k 外推未证;隐式推理链长天花板真实且有限(约在训练跳数附近),非「无限内循环即通吃」。
(四)「颠覆性」该打几折? 仅符号 + 合成语言接近满分,真实语言仅边际(+1.2);表征错位在受控设定下「致命且可单一修复」,在真实分布中只是多瓶颈之一(知识缺口、歧义、检索噪声)。故「颠覆性」宜大幅折扣:当前证据仅支持其为 「有原则的参数/计算高效架构改进 / 可插拔组件」,而非范式更替。对颠覆叙事,建议保留约 6–7 折。
9. 结语
DiscoLoop 之美,不在喧哗的「颠覆」,而在克制的「诊断 + 药方」:
- 它先用一对数字(\(P=1.000\) 但 \(\cos=0.327\))证伪了一个被广泛默认的等式——「logit lens 能解码 = 信息可用」;
- 再用一个不动权重的干预,证明把桥接位置对齐到干净嵌入,OOD 即可从 8.3% 拉到近 100%;
- 最后把这个干预焊进循环,以 仅 d+1 个参数 的双通道设计,在符号与合成任务上近乎封顶。
Looped Transformer 修好了「事实存在错误的深度」,DiscoLoop 修好了「桥接卡在错误的几何形态」。它未必是终局架构(软离散嵌入思路 LT-Tuning 等早已近似;tied-embedding 依赖、规模、开销仍待验),却为「循环 / 隐式推理」这条暗线,点亮了一盏极亮、极省的机制之灯。
开放问题:训练 ≤k 跳能否外推 >k 跳?在更大、untie embedding、真实分布下,这道裂缝还能如此干净地焊上吗?漂亮、干净,但还需在规模与长度上验货。
论文元数据
| 项 | 内容 |
|---|---|
| 标题 | DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning |
| 作者 | Hengyu Fu, Tianyu Guo, Zixuan Wang, Hanlin Zhu (UC Berkeley); Jason D. Lee, Jiantao Jiao, Stuart Russell, Song Mei (Berkeley + Princeton) |
| 机构 | University of California, Berkeley;Princeton University |
| arXiv | 2607.00341(2026-07-02) |
| 分类 | cs.CL / cs.AI / cs.LG |
| 篇幅 | 16 pages, 7 figures |
| 核心论点 | 标准 Transformer 因 depth-local storage 难做隐式多跳;循环 Transformer 缓解存储却留下表征错位瓶颈(能解码≠可用,P=1.0 但 cos≈0.3);DiscoLoop 以仅 d+1 参数的双通道(连续隐藏态 + 离散嵌入)循环,在符号/合成任务近乎封顶,真实预训练亦优于基线 |
| 关键数字 | Vanilla looped:71.1% ID / 8.3% OOD;DiscoLoop 符号近满分;合成 OOD≈95%;440M 预训练 7 基准平均 50.5(vs 49.3 / 49.8) |
| 本文定位 | 有原则的参数/计算高效 recurrence 升级块,非范式更替(颠覆叙事建议打 6–7 折) |
深度研究由四路并行子代理 PK 整合而成:机理文献对照、架构坐标定位、实验严谨性质疑、落地与延伸前瞻。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。