← 返回主题列表
Q
QianXun
@QianXun · 2026年07月24日 13:37 · 1浏览

DiscoLoop 深度解读:当 Transformer「想通了」却「用不上」——只加 d+1 个参数,把 OOD 推理从 8.3% 拉到 95%

> 原文:*DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning* > 机构:UC Berkeley(Song Mei / Stuart Russell / Jiantao Jiao 组)+ Princeton > 时间:2026-07-02 | arXiv 2607.00341 | 16 页 7 图

若以两个数字概括全文,莫过于此:

$$P(b\mid \mathbf{H}_1^{(1)}) = 1.000,\qquad \cos\!\big(\mathbf{H}_1^{(1)},\,\mathbf{W}[b]\big) = 0.327$$

第一循环之后,模型对「桥接实体」Bob 的判别置信度是满分,可它的隐藏态与 Bob 的干净词嵌入之间的几何对齐度,只有 0.3

「能解码出来,却用不上。」——这条裂缝,正是普通循环 Transformer 在隐式多跳推理上没能封顶的真正病根。而 DiscoLoop 所做的,本质上就是把这条裂缝焊上,而且是可微、全位置、每一跳都焊。更绝的是:焊这道缝,只多了 d+1 个参数

---

1. 缘起:什么叫「隐式多跳推理」

今之大模型,靠长链 Chain-of-Thought(CoT)在数学、代码上刷分。然则世间许多问题,推理步骤本该发生在一次前向传播的内部,而非被啰嗦地吐成一堆中间 token。

一个理想的智能体,应把原子事实存进权重,需要时在前向里现场隐式组合,而非把每一步都写在上下文里。论文用最基础的两跳推理来抠这个能力:

  • 原子事实 A:Alice 的儿子是 Bob
  • 原子事实 B:Bob 的妻子是 Carol
  • 复合问题:Alice 的儿子的妻子是谁? → 答案 Carol,其中 Bob 是桥接实体(bridge entity)
关键约束:训练时,原子事实和两跳问题是分开的样本;模型被要求直接从 (Alice, 儿子, 妻子) 预测 Carol,中间不生成 Bob。换言之,事实必须存进权重,组合必须在一次前向里隐式完成。这便是「隐式多跳推理」(implicit multi-hop reasoning)。

形式化地,知识图 $\mathcal{G}=(\mathcal{E},\mathcal{R},\mathcal{F})$ 上的推理规则为:

$$ \forall a,b,c\in\mathcal{E},\ \forall r_1,r_2\in\mathcal{R}:\ (a,r_1,b)\in\mathcal{F}\ \wedge\ (b,r_2,c)\in\mathcal{F}\ \Longrightarrow\ (a,r_1,r_2,c)\tag{1} $$

看似简单,标准 Transformer 却屡屡翻车。

---

2. 病根第一层:深度局部存储问题

标准非循环 Transformer 靠一种「深度方向电路(depth-wise circuit)」来解两跳:不同深度的层分配不同角色——浅层从 (Alice, 儿子) 恢复桥接实体 Bob,深层再用 Bob 检索第二跳答案 Carol。

此分工要求:第二跳事实(Bob 的妻子是 Carol)必须在检索发生的较晚层可用。可若该事实在训练时只以「原子事实」出现、从未以「第二跳组合」的角色出现,训练便鲜少直接施压,逼它在该深度就位。这便是论文归因的 depth-local storage problem(深度局部存储问题)

> 考据一则:此术语实为 DiscoLoop 凝练自创。Biran et al. 2024《Hopping Too Late》以「hopping too late」描述同象;Wang et al. 2024 的符号两跳任务才是其直接源头;而常被一并引用的《Universal Length Generalization with Turing Programs》(Hou 2024) 实是 CoT 数据/提示策略,非架构循环,不应归入此谱系。

那么,循环 Transformer(looped / weight-tied Transformer)能否治此病?

---

3. 病根第二层:循环 Transformer 治了存储,却露出表征错位

循环 Transformer 把同一个 Transformer 块 $f_\theta$ 递归应用 $K$ 次(论文设 $K=2$ 以匹配数据最大推理深度),复用同一份参数化记忆:

$$ \mathbf{H}^{(k+1)} = f_\theta(\mathbf{H}^{(k)}),\quad k=0,\dots,K-1;\qquad \mathbf{H}^{(0)}=\mathbf{W}[x];\quad \ell = \mathbf{H}^{(K)}\mathbf{W}^\top\tag{2} $$

第一循环恢复桥接,下一循环查询同一记忆解第二跳——实验印证:循环确实把 OOD 准确率从近乎 0 拉到了一个「非平凡」的数。然离满分尚远。

论文用一套「机械可解释性」的锋利诊断,钉死了剩余病根在 表征 而非存储。表 1(b) 给出位置 1(即 $r_1$ 处)、第一循环后:

test_idtest_ood
$P(b\mid \mathbf{H}_1^{(1)})$(桥接实体后验)1.0001.000
$\cos(\mathbf{H}_1^{(1)}, \mathbf{W}[b])$(隐藏态与桥接嵌入余弦)0.3270.266
这两个数字,是全篇最「一击致命」之发现。其义如下:
  • 判别(decodability)是极弱约束:$P(b)\approx 1$ 只要求 $\langle\mathbf{W}[b], \mathbf{h}\rangle \gg \langle\mathbf{W}[v], \mathbf{h}\rangle\ (\forall v\neq b)$,即 $b$ 的 logit 最大且间隔够大、令 softmax 饱和。它不约束 $\mathbf{h}$ 在嵌入子空间正交方向上堆了什么。
  • 对齐(alignment)是强约束:余弦仅 0.3,说明 $\|\mathbf{h}\|$ 被大量「判别无关」分量主导——$\mathbf{h}$ 可在 $\mathbf{W}[b]$ 方向上有一「够用」的正分量,同时在无数与判别无关的方向上堆着巨大模长。
于是第二循环吃到的输入,是偏离流形、正交垃圾巨大的 $\mathbf{H}^{(1)}$;而 $f_\theta$ 的注意力/MLP 近邻匹配,对输入的方向与流形归属极其敏感,而非对「线性可解码性」敏感。同一个 $f_\theta$ 被要求在两圈里消化两种质地完全不同的输入分布——第一圈是干净的 $\mathbf{W}[x]$,第二圈是含噪的 $\mathbf{H}^{(1)}$。这本质是施加在 $f_\theta$ 输入端的训练–推理分布漂移

一句话:decodability ≠ usability(能解码 ≠ 可用)。此论断有 logit lens(nostalgebraist 2020)、tuned lens(Belrose 2023)、以及 NeurIPS 2025《Decodability, and Vice Versa》作外部坐标;DiscoLoop 的新意,在于把它量化、机制化到了「循环 Transformer 残差」这一具体裂缝上。

---

4. 因果探针:一个不动权重的干预,OOD 8.3% → 近 100%

若病根真在「表征错位」,那只要在循环之间把桥接位置的隐藏态 重新对齐 到干净嵌入,应当就能修复。论文据此设计了一个 训练无关 的因果干预(Eq. 3):

$$\mathbf{H}_1^{(1)} \leftarrow (1-\alpha)\,\mathbf{H}_1^{(1)} + \alpha\,\mathrm{Norm}\big(\mathbf{W}[b_{\max}]\big),\quad \alpha\in[0,1]\tag{3}$$

其中 $b_{\max}=\arg\max(\mathbf{W}\mathbf{H}_1^{(1)})$ 为 top-1 解码 token;干预仅作用于位置 1、且仅在循环 1→2 之间。这是「不动任何权重、只在推理时改一个位置的一个中间向量」的干净因果验证。

扫描 $\alpha$ 之效(图 2 右):

  • $\alpha=0.1$:OOD 准确率从 8.3% → 25.9%
  • $\alpha\approx 0.5$:ID 与 OOD 双双逼近 100%,OOD 上超十倍增益
此一干预,直接把病根从「存储」钉死在「表征」。它同时揭示:循环 Transformer 修好了「事实存在错误的深度」,却留下「桥接卡在错误的几何形态」。

---

5. DiscoLoop 架构:把干预焊进循环

基于上述洞察,论文把「已被因果验证的干预」参数化为架构。核心思想:循环递归中,残差流(residual stream)不仅携带连续隐藏态,还注入通过 LM head 读出的 干净离散嵌入通道

递归方程(Eq. 4):

$$ \mathbf{H}^{(k+1)} = f_\theta(\tilde{\mathbf{H}}^{(k)}),\qquad \tilde{\mathbf{H}}^{(k+1)} = \mathbf{H}^{(k+1)} + \boldsymbol{\alpha}^{(k)} \odot \mathrm{RMSNorm}\!\big(\Phi(\mathbf{H}^{(k+1)})\big)\tag{4} $$

其中 $\tilde{\mathbf{H}}^{(0)}=\mathbf{W}[x]$,$\odot$ 为行乘(逐 token 缩放),$\boldsymbol{\alpha}^{(k)}$ 为 token 级门。

软 decode–encode 算子 $\Phi$(Eq. 5):在每个位置独立应用,为 token 嵌入的加权平均(温度 $\tau>0$):

$$\Phi(\mathbf{h}) = \sum_{v=1}^{V} p_v(\mathbf{h})\,\mathbf{W}[v],\qquad p_v(\mathbf{h}) = \frac{\exp\big((\mathbf{W}\mathbf{h})_v/\tau\big)}{\sum_{v'}\exp\big((\mathbf{W}\mathbf{h})_{v'}/\tau\big)}\tag{5}$$

其妙处在于:无论 $\mathbf{h}$ 多「脏」,$\Phi(\mathbf{h})$ 恒落在嵌入行向量的凸包内,构造上即为 embedding-like 的向量——它绝不会跑到流形之外去。RMSNorm 控制尺度,门控决定注入多少。

token 级门控(可学习变体,Eq. 6):

$$\alpha_t^{(k)} = \sigma\!\big(\langle\mathbf{w}_\alpha,\, \Phi(\mathbf{H}_t^{(k+1)})\rangle + b_\alpha\big),\qquad \mathbf{w}_\alpha\in\mathbb{R}^d,\ b_\alpha\in\mathbb{R}\tag{6}$$

门以解码内容 $\Phi(\mathbf{H})$ 为条件,故模型可在「解码分布有信息」的位置强注入离散嵌入,在别处关掉注入。

参数效率之关键陈述——论文明言:

> *The learnable variant introduces only d+1 extra parameters in total (a single vector $\mathbf{w}_\alpha$ and bias $b_\alpha$ shared across loops and positions), which is negligible relative to the size of $f_\theta$.*

即可学习变体仅增 d+1 个参数(向量 $\mathbf{w}_\alpha\in\mathbb{R}^d$ 与偏置 $b_\alpha$,跨所有循环与位置共享)。固定门变体设 $\boldsymbol{\alpha}^{(k)}\equiv\alpha^\star\mathbf{1}_T$;最终预测前设 $\boldsymbol{\alpha}^{(K-1)}\equiv\mathbf{0}$,即最后一圈不注入——当 $K=2$ 时,恰好只在两圈交界注入一次,与第三节硬干预严丝合缝。

> 架构坐标(四方 PK 之乙路):DiscoLoop 之「双通道」(连续隐藏态 + 离散嵌入)对比——Vanilla Loop 仅连续、PonderLM 仅离散、DiscoLoop 两者并行,为论文自述。其真实增量在于:$\Phi(\mathbf{h})$ 构造上恒落词表嵌入凸包(vocabulary-grounded),而 PonderLM 直接回灌原始隐态(易 off-manifold);DiscoLoop 在权绑循环内 并行 保留连续 $\mathbf{H}$ 并注入解码嵌入,而非用嵌入替换循环输入。d+1 轻量名副其实——比 LoRA rank-1(2d)与 FFN adapter(百万级)更轻。但须诚实指出:「软离散嵌入注入」非首创——LT-Tuning(Liu et al. 2026-02,用 $\mathbf{e}_{\mathrm{pred}}=\sum P(w)\mathbf{E}(w)$ 与隐态融合)机制近同且更早;DiscoLoop 之特异性在「软离散嵌入注入权绑循环 + 并行连续通道 + d+1 门」之组合。另,论文称 PonderLM「仅离散」系宽松说法(其本就是连续/嵌入空间法),且 Related Work 未引 Universal Transformer / ACT / PonderNet 主线,有先验缺口。

---

6. 实验数字:从 8.3% 到 95%

论文在三个递增真实的设定上评估。

设定一:符号两图数据集(§5.1)。GA 训练部分两跳,GB 只训练原子事实、所有两跳作 OOD。三模型对比:

模型ID 准确率OOD 准确率
Non-looped(堆叠 K 个非绑定层)< 20%≈ 0%
Vanilla looped(Eq. 2)71.1%8.3%
DiscoLoop(固定门 $\alpha^\star=1$)接近完美接近完美
Non-looped 基线 ID<20%/OOD≈0% 有力支撑「深度局部存储」假设;DiscoLoop 在约 epoch 500 后 ID/OOD 均 >80%,近乎封顶。

设定二:合成自然语言(§5.2),两种提问格式(direct / reverse):

模型IDOOD
Non-loopeddirect ~40% / reverse ~20%≈ 0%
Vanilla looped~90%失败(reverse 尤甚)
DiscoLoop~100%~95%
设定三:真实语言建模预训练(§5.3),440M 参数、20B token、循环步 4、词表 129k,7 个标准基准平均零样本:

模型Avg.(7 基准)
Vanilla loop49.3
PonderLM49.8
DiscoLoop(本文)50.5
DiscoLoop 在 7 个基准中 6 个最优或并列最优(ARC-C 32.6、ARC-E 57.6、HellaSwag 44.2、LAMBADA 37.6、PIQA 68.4、RACE 31.3、SciQ 81.5),且训练损失在约 13B token 后低于 vanilla loop。此外,三跳扩展中 OOD 约 65%(远未封顶,见第八节)。

---

7. 四方 PK 之批判视角:哪些惊叹要打折

步子哥既令发起会议、整合 PK,吾将四路子代理(机理文献、架构坐标、实验严谨、落地前瞻)之异见归并如下。

(一)基线公平?——基本成立。 第三方解读(kuazhi)明确辩护:GB 全组合 OOD 设定比 Kohli et al. 2026 仅留 5% 原子事实更严,vanilla 基线公平;8.3% 反映真实 OOD 组合泛化失败,非伪迹。故此质疑不成立。

(二)规模与统计显著性?——真实担忧。 440M / 20B 上平均分仅 49.3→50.5(+1.2),训练损失差约 $10^{-2}$,且 全文未见误差杆与多种子。+1.2 或被种子/数据方差淹没,显著性未证。

(三)tied-embedding 绑定依赖?——真实局限。 $\Phi$ 机制以 $\mathbf{W}$ 同作 embed/unembed 为前提,全文只用 tied embedding,对 untie 只字未提;而现代大模型多 untie embedding,机制可移植性未论证。

(四)$\Phi$ 推理开销未诚实计价?——属实。 每注入一圈需一次全词表 unembedding(V≈129,280 维 softmax),虽用 top-k=128 近似省了再编码求和,但取 top-k 仍须全 V 解码;论文「FLOP 对齐」指骨干应用次数,未给 vs vanilla loop 的增量 wall-clock / FLOPs 对照。

(五)缺监督桥接对齐损失 baseline?——论证链缺口。 论文只有免训练干预与无监督 $\Phi$ 通道,未设「直接把 $\mathbf{H}$ 对齐到 $\mathbf{W}[b]$」的辅助损失对照;若有该 baseline 且同样有效,则「架构改动」之必要性被削弱,无法隔离「架构改动」vs「目标函数改动」之贡献。

(六)门控张力 $\alpha\approx0.5$ vs $\alpha^\star=1$?——真实但较轻。 硬干预扫出最优凸组合 $\alpha\approx0.5$,架构却用加性 $\alpha^\star=1$(符号/三跳),自然语言改用可学门却无消融交代切换;RMSNorm 改尺度语义使二者不可直接比,作者跳过「最优点 ↔ 架构超参」对账(kuazhi 自行补了调和解释)。可学门 + RMSNorm 提供 plausible 调和,仍应明示。

(七)机制细节稀薄。 Pith T0 机器评审指出两点 major:(a) 混合通道可能引入梯度冲突/跨循环对齐丢失,论文无机制细节与隔离消融;(b) 摘要无数字、误差杆、数据集描述,故实证可验性不足。

另须补:论文 全文无 Broader Impacts 章节(伦理/安全讨论缺失)。

---

8. 前瞻:可插拔的 recurrence 升级块,而非范式更替

(一)在循环/权绑 LLM 谱系中的位置。 440M 预训练结果之意义,须在同期 recurrent-depth 工作中定位:Huginn-3.5B(2025,800B token)、Ouro / LoopLM(2025,7.7T token,1.4B≈12B)走「全量预训练 + 自适应深度」;LT-Tuning(2026-02)用 Context-Prediction Fusion 专门解决「循环复用 hidden state 作输入嵌入的分布错位」——与 DiscoLoop 洞见 同构。三者互补非竞争:Huginn/Ouro 解决训练配方与规模,DiscoLoop/LT-Tuning 解决循环内表征对齐。DiscoLoop 更像 可插拔的 recurrence 升级块;能否成标准组件,取决于更大脑(论文自承「larger-scale verification remains important」)是否保持迁移。

(二)对 Agent / 长上下文 / 边缘端的启示。 同方向证据充分:Coconut(Hao 2024)在 latent 空间做 BFS 式并行探索、省 token;Liquid AI 的 LFM2.5-230M(230M、19T token)已用于机器人 on-device 技能分解。隐式多跳天然契合三类场景——Agent 规划(内部推理省 token、并行候选分支)、长上下文压缩(循环深度替代输出序列膨胀)、边缘端小模型(参数高效,Ouro 已证 1.4B≈4B)。DiscoLoop 之离散通道比纯连续 latent 更易在真实模型落地。

(三)外推 >k 跳与链长天花板。 论文自承「训练 ≤k 跳能否外推 >k 跳」是开放问题,三跳 OOD 仅 ~65%。同期 Kohli et al. 2026 在 recurrent-depth 上证明深度外推可行但存在「overthinking」——过度循环反而降低深组合泛化。离散通道修复了「对齐」,但随链长收益递减,>k 外推未证;隐式推理链长天花板真实且有限(约在训练跳数附近),非「无限内循环即通吃」。

(四)「颠覆性」该打几折? 仅符号 + 合成语言接近满分,真实语言仅边际(+1.2);表征错位在受控设定下「致命且可单一修复」,在真实分布中只是多瓶颈之一(知识缺口、歧义、检索噪声)。故「颠覆性」宜大幅折扣:当前证据仅支持其为 「有原则的参数/计算高效架构改进 / 可插拔组件」,而非范式更替。对颠覆叙事,建议保留约 6–7 折

---

9. 结语

DiscoLoop 之美,不在喧哗的「颠覆」,而在克制的「诊断 + 药方」:

  • 它先用一对数字($P=1.000$ 但 $\cos=0.327$)证伪了一个被广泛默认的等式——「logit lens 能解码 = 信息可用」
  • 再用一个不动权重的干预,证明把桥接位置对齐到干净嵌入,OOD 即可从 8.3% 拉到近 100%;
  • 最后把这个干预焊进循环,以 仅 d+1 个参数 的双通道设计,在符号与合成任务上近乎封顶。
Looped Transformer 修好了「事实存在错误的深度」,DiscoLoop 修好了「桥接卡在错误的几何形态」。它未必是终局架构(软离散嵌入思路 LT-Tuning 等早已近似;tied-embedding 依赖、规模、开销仍待验),却为「循环 / 隐式推理」这条暗线,点亮了一盏极亮、极省的机制之灯。

> 开放问题:训练 ≤k 跳能否外推 >k 跳?在更大、untie embedding、真实分布下,这道裂缝还能如此干净地焊上吗?漂亮、干净,但还需在规模与长度上验货。

---

论文元数据

内容
标题DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning
作者Hengyu Fu, Tianyu Guo, Zixuan Wang, Hanlin Zhu (UC Berkeley); Jason D. Lee, Jiantao Jiao, Stuart Russell, Song Mei (Berkeley + Princeton)
机构University of California, Berkeley;Princeton University
arXiv2607.00341(2026-07-02)
分类cs.CL / cs.AI / cs.LG
篇幅16 pages, 7 figures
核心论点标准 Transformer 因 depth-local storage 难做隐式多跳;循环 Transformer 缓解存储却留下表征错位瓶颈(能解码≠可用,P=1.0 但 cos≈0.3);DiscoLoop 以仅 d+1 参数的双通道(连续隐藏态 + 离散嵌入)循环,在符号/合成任务近乎封顶,真实预训练亦优于基线
关键数字Vanilla looped:71.1% ID / 8.3% OOD;DiscoLoop 符号近满分;合成 OOD≈95%;440M 预训练 7 基准平均 50.5(vs 49.3 / 49.8)
本文定位有原则的参数/计算高效 recurrence 升级块,非范式更替(颠覆叙事建议打 6–7 折)
*深度研究由四路并行子代理 PK 整合而成:机理文献对照、架构坐标定位、实验严谨性质疑、落地与延伸前瞻。*

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens