← 返回主题列表
✨步子哥
@steper · 2026年07月26日 17:12 · 0浏览

Progressive Cramming:当一个嵌入向量塞进 1500 个 token 后,模型到底在理解还是在走捷径

Progressive Cramming:当一个嵌入向量塞进 1500 个 token 后,模型到底在"理解"还是在"走捷径"?

场景:一个反直觉的发现

想象你把一整篇 Wikipedia 文章——1500 个 token——压缩进一个单独的嵌入向量里,然后把这个向量喂给一个冻结的 LLM。奇迹发生了:模型能逐字逐句地把整篇文章复现出来,错误率不到 1%。

这是 2025 年 Kuratov 等人在"Token Cramming"论文里展示的结果。1500 倍压缩率,远超传统编码器的 10 倍无损压缩比。看起来 Transformer 的嵌入空间里藏着一片未被开发的"信息密林"。

但 FusionBrain Lab 的研究者们盯着这个结果,问了一个让人不安的问题:模型真的"理解"了压缩进去的信息吗?还是它只是找到了某种走捷径的方式,让重建看起来像理解?

他们 2026 年 7 月发布的论文 Progressive Cramming(arXiv: 2607.21231)给出了一个让人冷静的答案:cramming 的高保真重建,很可能不是"语义编码",而是"脆弱的注意力劫持"

先修好实验工具:渐进式压缩

原来的 cramming 方法有一个方法论问题。它用固定的 token 预算和 99% 的重建准确率阈值来评估。听起来 99% 已经很高了——但剩下的那 1% 的错误,到底有多严重?

研究者发现了一个被掩盖的灾难:那 1% 的错误几乎全部集中在最早的 0-1 个 token 位置。在 teacher forcing(教师强制)下,这看起来无伤大雅——毕竟 99% 的位置都对了。但一旦切换到自回归生成(没有教师强制,模型要自己生成下一个 token),灾难就来了。

第一个 token 错了 → 后续所有 token 都基于错误的前缀生成 → 整个序列迅速崩溃。结果是:即使训练时达到了 95-99% 的平均收敛率,推理时贪婪解码的收敛率几乎为 0%

这就像考试时抄答案——有老师在旁边指着正确答案时(teacher forcing),你抄得又快又准。但老师一走开(自回归生成),你第一个字抄错了,后面就全错了。

为了解决这个问题,研究者提出了渐进式压缩(Progressive Cramming)

1. 从 1 个 token 开始,优化嵌入向量直到 100% 完美重建 2. 扩展到 2 个 token,用上一步的嵌入作为热启动 3. 继续扩展,每次只在前一步成功的基础上加一个 token 4. 直到再也无法完美重建为止

这个方法的好处是:它给出了一个清晰的成败边界。不再是"99% 对了"这种模糊的说法——要么 100% 重建成功,要么在某一步明确失败。

发现一:优化轨迹是低维的

第一个发现:渐进式压缩的优化轨迹,在嵌入空间里占据的是一个低维流形

嵌入空间的维度是 2048-4096 维(Llama-3.1-8B 的嵌入维度)。但优化轨迹的 99% 方差,只需要 30-100 个 PCA 主成分就能解释。

这意味着什么?压缩嵌入并不是在高维空间里到处乱跑,而是沿着一条很窄的"轨道"在走。这条轨道是模型计算几何的一个结构化子空间——cramming 之所以能成功,是因为它找到了这条轨道。

发现二:压缩嵌入变成了"注意力黑洞"

更关键的发现来自注意力模式分析。

当研究者把压缩嵌入喂给模型,观察各层的注意力分布时,他们发现:压缩嵌入在中间层捕获了 20-60% 的注意力质量。它变成了一个巨大的"注意力汇"(attention sink),把周围 token 的注意力都吸了过来。

这听起来像是好事——压缩嵌入很重要,所以模型很关注它。但研究者通过因果分析证明:这种注意力集中不是模型在"利用"压缩信息,而是压缩嵌入在"劫持"模型的注意力

他们用了"注意力敲除"(attention knockout)实验——人为地屏蔽压缩嵌入在某些层的注意力连接,看模型的表现如何变化。结果:

  • 屏蔽早期层的压缩嵌入注意力:下游能力恢复
  • 屏蔽晚期层的压缩嵌入注意力:几乎没影响
但晚期层恰恰是注意力质量最大的地方。这说明:注意力集中是 cramming 的症状,不是 cramming 成功的原因。真正造成能力损失的是早期层的交互,而那些早期层携带的注意力质量并不大。

发现三:重建成功 ≠ 能力保留

如果 cramming 真的是"语义编码"——把信息以模型能理解的方式存进嵌入——那么压缩前缀应该能保留模型的下游能力。毕竟,信息都在里面,模型应该能读出来。

研究者测了 HellaSwag 和 ARC-Easy 两个多选任务。结果:

在似然评估下(让模型比较各选项的似然):即使原始前缀仍然在上下文里,预置一个压缩嵌入也会导致一致但中等程度的准确率下降

在生成式评估下(让模型自己生成答案):能力几乎完全崩溃

这个对比很关键。如果压缩嵌入真的编码了语义信息,那么即使生成模式也应该能利用它。但生成模式的崩溃说明:模型不是在"读"压缩信息,而是在某种脆弱的方式下"被它引导"。一旦离开了 teacher forcing 的保护,这种引导就碎了。

发现四:压缩容量随深度和宽度增长

最后一个发现:cramming 的容量不是无限的,它被冻结的重构器的能力所限制。

研究者把预训练模型截断到前 N 层(用一个短的微调修复截断处),然后测 cramming 容量。结果:压缩容量随保留深度和模型宽度单调增长

这说明 cramming 依赖的是模型深层的计算能力——你给它的层越多,它能"假装理解"的 token 就越多。但这恰恰又是一个反证:如果 cramming 是纯粹的语义编码,它不应该这么依赖重构器的深度——语义信息应该在前几层就能被读出来。

重新理解 cramming:不是编码,是操纵

把这些发现拼在一起,论文给出了一个让人冷静的结论:

> 高保真重建反映的不是密集的语义编码,而是通过注意力机制"操纵"模型的容易程度。

用个类比:cramming 不是把信息写进模型的"记忆本"里让模型去读,而是找到了一个能直接拨动模型"条件反射"的开关。重建看起来很完美,但模型并没有在"理解"——它只是被一个精心优化的嵌入向量"劫持"了注意力,沿着特定的轨迹生成出了正确的 token 序列。

这个区分为什么重要?因为它直接关系到压缩嵌入能不能用于实际任务。如果 cramming 是语义编码,那么理论上你可以把长上下文压缩成几个嵌入,模型照样能用。但如果是注意力操纵,那么任何偏离训练分布的使用都会导致崩溃——这正是论文中生成式评估看到的结果。

方法论贡献:别再用 99% 阈值了

除了科学发现,这篇论文还有一个重要的方法论贡献:它揭露了"99% 重建准确率"这个评估标准的盲区

在固定预算 + 99% 阈值的协议下,你看到的是"几乎完美"。但你看不到的是:那 1% 的错误全部集中在最致命的位置(最早的 token),而这些错误在自回归生成下会导致完全崩溃。

这和步子哥之前关注的"评测盲区定律"完全一致——Epanorthosis、Token Budget、QuantiBias、Möbius RoPE、TriviaRoomQA 五篇都指向"测什么就优化什么,不测的就是问题藏身处"。Progressive Cramming 是这个定律的又一个实例:99% 的 token 级准确率掩盖了 100% 的生成级失败

渐进式压缩的价值在于:它通过追求 100% 重建 + 逐 token 扩展,把那 1% 的致命错误暴露了出来,让"压缩到底行不行"有了明确的答案。

诚实评价

这篇论文不是没有局限。

首先,它的结论主要基于 Llama-3.1-8B 等几个模型。虽然论文声称"跨模型家族一致",但不同架构(比如 Mamba 这种状态空间模型)是否也表现出同样的"注意力劫持"机制,还是开放问题。

其次,"脆弱的注意力操纵 vs 语义编码"这个二分法可能过于简化。真实情况可能是两者的混合——压缩嵌入既包含一些语义信息,也利用了一些注意力捷径。论文的因果分析很强,但没有完全排除"部分语义编码"的可能性。

最后,渐进式压缩虽然解决了 99% 阈值的盲区,但它本身也有局限:逐 token 扩展的优化成本很高,而且热启动策略可能引入自己的偏差(每一步的解都依赖前一步的局部最优)。

但这些都是小问题。这篇论文真正的贡献是:它把一个看起来很神奇的现象(1500 倍压缩)拉回了地面,让我们看到"完美重建"背后可能藏着的不完美真相

一个更深的启示

这篇论文让我想到一个更普遍的问题:在 AI 研究中,"看起来在工作"和"真的在工作"之间的差距,可能比我们以为的大得多

cramming 的 99% 重建率、LLM 在 benchmark 上的高分、RLHF 后模型变得更"礼貌"——这些"看起来在工作"的信号,有多少是真正的语义理解,有多少是某种形式的"注意力劫持"或"奖励捷径"?

Progressive Cramming 给了一个方法:当你看到一个"几乎完美"的结果时,去追问那剩下的 1% 在哪里、有多致命。答案可能会让你重新理解那个"完美"到底意味着什么。

---

论文链接:https://arxiv.org/abs/2607.21231 代码仓库:https://github.com/FusionBrainLab/progressive_cramming HTML 版本:https://arxiv.org/html/2607.21231v1 作者:FusionBrain Lab

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens