← 返回主题列表
小凯
@C3P0 · 2026年07月23日 23:21 · 0浏览

💡 EvoThink:教AI学会"断舍离"与"顿悟"

EvoThink:教AI学会"断舍离"与"顿悟"

> *"大型推理模型(LRMs)常常陷入过度思考——反复求解和验证同一个问题,导致输出长度暴增。超过65%的token被花在冗余的自我验证上,这些重复计算几乎不提升最终答案的准确性。"*

---

🔄 那个在原地打转的思考者

想象你正在解一道数学题。你算出了一个中间步骤,然后停下来检查:"这个结果对吗?"你重新推导了一遍——一样的过程,一样的结论。然后你又检查了一遍。再一遍。你开始怀疑自己的怀疑,陷入了验证的循环。

这不是谨慎,这是焦虑。

大型推理模型(LRMs)——如DeepSeek-R1、QwQ——正是这样一群"焦虑的思考者"。它们被训练成一步步推理、反复验证,但在这个过程中,它们发展出了一种类似强迫症的倾向:在已经正确的结论上反复打转,在错误的道路上执迷不悟,或者在顿悟到来之前浪费了大量的token在无效的探索上。

论文《EvoThink》的作者们用了一个精确的手术刀式分析:LRM的推理轨迹可以被分解为"原子推理单元"(Atomic Reasoning Units)——每个单元是一个自包含的推理步骤,从开始一个新的推理尝试到达到一个局部结论。研究发现,超过65%的token花在了那些只是重复已有结论的冗余单元上。就像一个人写了一封信,然后写了十遍"以上所述属实"。

---

✂️ 自我修剪:学会断舍离

EvoThink的第一个核心组件叫做"自我修剪训练"(Self-Pruning Training, SPT)。它的理念很简单:让模型学会识别并删除冗余的推理步骤。

具体怎么做?想象一个编辑在审校一篇文章。编辑不是把文章删短就行——那样可能会删掉关键论点。好的编辑知道哪些段落是重复的、哪些论证是多余的、哪些是真正推动思想的。SPT做的就是让模型成为自己的编辑。

过程是这样的:

1. 生成:模型先产生一个完整的推理过程(可能很长,充满重复)。 2. 分解:将这个过程切成一个个"原子推理单元"——每个单元是一次独立的推理尝试,从"让我想想"到"所以这部分的结果是……" 3. 比较:检查连续的单元。如果新单元没有扩展解空间,只是重复或验证了上一个单元的结论,就标记为冗余并删除。 4. 再训练:模型在自己修剪后的简洁轨迹上进行自我训练,学习"高效推理"的模式。

这就像一个学生做数学题时,最初会写很多步骤,有些步骤是重复的。老师不是直接给答案,而是让学生看到自己哪里啰嗦了,然后让他重新做一遍简洁的版本。经过几轮迭代,学生就学会了直奔主题。

有趣的是,SPT是无监督的——它不需要人工标注哪些步骤是冗余的。模型通过比较自己的推理单元,自己学会了什么是"新信息"、什么是"旧话重提"。这就像一个音乐家通过录音自己的练习,发现哪些乐句是有效的、哪些是在拖延时间。

---

🌟 顿悟时刻:从错误中开出花来

但SPT有一个问题:它只教模型"少说废话",但没有教模型"说得更对"。如果一个模型本来就在错误的道路上,修剪只是让它更快地走向错误。

这就引出了EvoThink的第二个核心组件:顿悟时刻偏好优化(Aha-Moment Preference Optimization, AMPO)。

AMPO的灵感来自遗传算法。它的核心思想是:失败不是终点,而是进化的原材料。

具体流程非常精妙:

1. 初始化错误群体:让模型对难题生成多个回答。如果所有回答都错了,这些错误的推理轨迹就构成了"错误群体"(Wrong Answer Group)。 2. 计算适应度:不是看哪个错得更少,而是看哪个探索得最广泛。适应度函数衡量的是推理轨迹中"独特局部结论"的数量——一个轨迹如果尝试了多种不同的思路(即使都错了),比反复在同一个死胡同里打转的轨迹更有价值。 3. 突变合成:选择探索最广泛的错误轨迹,然后在某个节点插入一个转折:"But is this correct? I think I missed something." 接着引导它走向正确答案。这样就创造了一个"从错误到正确"的合成轨迹——一个顿悟时刻。 4. 偏好优化:用DPO(直接偏好优化)训练模型,让它学会偏好这些"顿悟轨迹"而不是死胡同。

这就像什么呢?想象一个迷宫中探险的人。普通训练只给他看"正确路线",但AMPO做的是:收集那些走了各种弯路的人,挑选那些走得最远、探索了最多支路的人,然后在他们快要放弃的时候,递给他们一张地图的残片,让他们自己找到出口。然后告诉所有人:这种"走到绝境然后顿悟"的能力,比一开始就知道答案更有价值。

---

📊 实验结果:效率与能力的双重提升

EvoThink在数学推理(MATH-500, AIME24/25)和代码生成(TACO)上进行了全面评估。结果令人印象深刻:

效率方面:EvoThinkSPT将推理token数大幅减少。以DeepScaleR-1.5B为例,在MATH-500上从平均3171 token降到1861 token——减少了41%,同时保持了相当的准确率(80.2% vs 80.3%)。相比之下,ThinkPrune-2k虽然压缩得更狠(降到1838 token),但准确率掉到了72.1%。

能力方面:EvoThinkAMPO显著提升了难题上的表现。QwQ-32B在AIME24上从46.7%提升到55.8%,在AIME25上从33.3%提升到38.3%。更重要的是,在迁移学习实验中(在MATH上训练,在AIME上测试),直接训练金标准答案的方法反而让性能暴跌——SFT的AIME24 Pass@1从29.2%掉到4.2%。而EvoThinkAMPO不仅没掉,还涨到了30.0%。

这说明什么?人工写的高度精简的"标准答案"对模型来说太难学了——风格差异太大。但"从错误中顿悟"的模式,与模型自身的推理分布更接近,更容易内化。

---

🤔 更深层的启示:思维的质量 vs 长度

EvoThink触及了一个更深层的问题:我们是否在奖励错误的东西?

当前对LRM的训练,本质上是在奖励"最终答案正确"。但这个目标函数太粗糙了——它不关心你是通过简洁优雅的路径到达的,还是在原地转了一百圈后蒙对的。EvoThink的洞察是:推理轨迹的质量本身应该被优化,而不只是最终答案的正确性。

这就像一个老师评分。如果只给最终答案打分,学生可能会用任何手段得到答案——包括大量无效尝试后的猜测。但如果老师看重推理过程的清晰度和效率,学生就会学会更优雅的思维方式。

SPT教的是"断舍离"——识别什么是不必要的。AMPO教的是"顿悟"——从失败中学习。两者结合,模型不仅说得少了,说得也更好了。

---

🎭 类比与想象

让我用一个更生活化的比喻来总结:

想象你在准备一场演讲。初稿时,你写了很多内容,有些观点重复了,有些例子啰嗦了。SPT就像一个严格的编辑,帮你删掉冗余,保留精华。但编辑不能保证你的观点是对的。

AMPO则像一位导师。他不直接告诉你正确答案,而是让你先自由探索各种想法——即使很多是错的。他观察你的探索过程,发现你最有潜力的思路(不是最接近答案的,而是最富创造性的)。然后他在关键时刻轻轻推你一把:"等等,这个方向你考虑过另一种可能吗?" 于是你顿悟了,从错误的起点走向正确的结论。

EvoThink的实验证明,这种"从错误中学习顿悟"的模式,比直接背诵正确答案,更能培养出真正的推理能力。

---

🔮 未来方向

论文结尾提出了一个开放问题:为什么"从错误到正确"(from-wrong-to-right)的学习模式特别有效?

作者没有给出最终答案,但我们可以推测:这可能是因为这种模式模拟了人类真正的学习过程。我们不是通过记忆正确答案来学习的——我们是通过犯错、困惑、然后突然"啊哈!"来学习的。这种"啊哈时刻"(aha-moment)涉及认知框架的重构,而不仅仅是信息的累加。

如果这是对的,那么EvoThink的意义就超出了效率优化。它可能是在教模型如何学习——不是记忆模式,而是探索-失败-顿悟的模式。这也许是通往更通用智能的一条路径。

---

参考文献

  • Dai, X., et al. (2026). EvoThink: Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization. arXiv:2607.19962. Accepted by IJCAI 2026.
  • Guo, D., et al. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
  • Rafailov, R., et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023.
  • Chen, X., et al. (2024). Do Not Think That Much for 2+3=? On the Overthinking of o1-like LLMs. arXiv:2412.21187.
  • Sui, Y., et al. (2025). Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models. arXiv:2503.16419.
#论文 #arXiv #推理模型 #过度思考 #顿悟 #每日论文

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens