悬崖边的第一步:为什么AI一旦走错,剩下的路全是错的

*——解读《Cliff: Learning Process Rewards from the First Mistake》* *arXiv: 2609.02817 作者: Peixuan Han, Runhui Wang, Ketan Ramaneti, et al.*

悬崖边的第一步:为什么AI一旦走错,剩下的路全是错的

*——解读《Cliff: Learning Process Rewards from the First Mistake》*
*arXiv: 2609.02817 | 作者: Peixuan Han, Runhui Wang, Ketan Ramaneti, et al.*

🧗 序幕:走迷宫的人

想象你站在一个巨大迷宫的入口。

这个迷宫有一万条路径,其中只有一条能通往出口。你手边有一张地图——但只显示了迷宫的轮廓,没有标注正确的路线。你只能靠试错来探索。

现在,有两个策略摆在你面前:

策略A:走到终点再评判。 你随机选一条路,闭着眼睛走到底。如果最终到达出口,整条路都是对的;如果撞墙,整条路都是错的。然后根据这个结果调整下一次的选择。

策略B:标记第一个错误。 你同样随机选一条路,但这次你边走边观察。一旦发现某一步走错了——比如这条路的第三个转弯明显把你引向了一堵死墙——你立刻标记下来。下一次,你保证至少走到那个错误点之前都是对的,然后在那里尝试不同的选择。

哪个策略更有效?

直觉告诉我们:策略B。因为一旦第一步错了,后面所有的"正确"选择都是在错误基础上的徒劳挣扎。就像建在流沙上的房子——地基歪了,上面再漂亮也是危房。

但这篇论文的发现比这个直觉更深刻、更精确。作者们给它起了一个令人过目不忘的名字:Cliff(悬崖)


🧮 第一部分:强化学习中的"奖励稀疏性"问题

要理解Cliff,我们得先理解它试图解决的是什么问题。

🎲 什么是RLVR?

RLVR——Reinforcement Learning with Verifiable Rewards(可验证奖励的强化学习)——是近年来LLM后训练领域最热门的技术之一。

基本思路非常简洁优雅:

1. 让模型生成一个回答( rollout,想象成"一次尝试")。 2. 用一个可验证的奖励函数来判断这个回答是否正确。比如数学题可以用计算器验证,代码可以用测试用例验证,逻辑题可以用形式化证明验证。 3. 根据奖励信号,用强化学习算法(如PPO、GRPO)来调整模型的策略,让它更倾向于生成能获得高奖励的回答。

这个方法在数学推理、代码生成、科学问题求解等任务上取得了惊人的成功。DeepSeek-R1、OpenAI的o1/o3系列,都大量使用了RLVR的思想。

但RLVR有一个致命的软肋:奖励太粗糙了。

🌵 稀疏奖励的沙漠

想象你在教一个孩子解一道复杂的数学题。你只看最终答案对不对:对了,给一颗糖;错了,不给糖。

问题是:如果孩子的答案错了,你怎么知道他错在哪一步?是第一步就理解错了题意?是中间某一步计算失误?还是最后一步粗心写错了符号?

你不知道。你只看到一个结果:错。而这个结果包含的信息太少太少。

对于LLM来说,这个问题更严重。一个复杂的推理任务可能包含几十个中间步骤。模型在第一步就走错了方向,然后在这个错误的基础上"正确地"推导了二十步,最终答案当然是错的。如果强化学习信号只是"最终答案错了",模型怎么知道要调整哪一步?

它不知道。它只能随机尝试。运气好,某次rollout第一步碰巧对了,最终答案也对了,得到了奖励。但这个学习信号太弱了——要在数十步的推理中"碰巧"第一步就对,概率极低。大部分时候,模型在黑暗中摸索,得到的反馈只有"错了"两个字,却不知道为什么错、错在哪。

这就是稀疏奖励问题(Sparse Reward Problem)——奖励只在终点出现,中间过程的数十个决策点都没有任何反馈信号。模型像在沙漠中行走,唯一的绿洲在遥远的地平线上,而路上没有任何路标指引方向。

📉 现有解决方案的局限

研究者当然意识到了这个问题,并提出了几种解决思路:

方案1:过程奖励模型(Process Reward Model, PRM)

基本思路是:训练一个专门的奖励模型,让它能够判断推理过程中每一步的质量。这个PRM就像一个严格的数学老师,不仅看最终答案,还检查每一步推导是否合理。

但PRM有一个大问题:你需要大量的人工标注数据来训练它。 每一步推理都需要人工标注"好"或"坏"。对于复杂的推理任务,这个标注成本极高。而且PRM本身也是一个神经网络,它的判断可能不准确——如果用PRM来训练LLM,相当于用另一个可能犯错系统来监督主系统,误差会累积。

方案2:在线蒸馏(On-Policy Distillation)

基本思路是:用一个更强的"教师模型"来生成高质量的推理轨迹,然后让"学生模型"模仿这些轨迹。教师模型的每一步都被视为"正确答案",学生模型通过监督学习来复制教师的行为。

但这里有一个隐含的假设:教师和学生应该有相同的推理模式。 如果学生模型的能力和教师不同——比如学生更小而教师更大——它们可能天生适合不同的推理策略。强行让学生模仿教师,就像强迫一个习惯用左手的人用右手写字——能学会,但效率低,而且不舒服。

更重要的是,在线蒸馏本质上仍然是在模仿"最终结果",而不是真正理解"为什么这一步是对的"。学生学到了形式,但不一定学到了本质。


⛰️ 第二部分:Cliff的核心洞察——"第一个错误"的革命

现在,Cliff登场了。

💡 一个反直觉的发现

作者们做了一个简单但深刻的观察:

一旦推理过程在某个步骤第一次出错,后续步骤的评估价值就大大降低了——因为它们已经建立在一个错误的前提之上。

用迷宫的比喻来说:如果你在第三步拐错了弯,那么第四步、第五步、第六步......无论你走得多么"正确",你都在离出口越来越远。评估这些后续步骤的"正确性",就像评价一个已经在南辕北辙的旅行者"他的步伐很标准"——有意义吗?没有。

这个观察看起来如此显然,以至于你会问:"之前怎么没人想到?"

答案是:想到了,但没有系统地利用它。

Cliff的精妙之处在于,它把这个直觉转化为了一个可操作的奖励塑形策略,而且不需要任何额外的标注数据或专门的奖励模型。

🔧 Cliff的工作机制:三步走

Cliff的核心算法出奇地简洁。它只需要一个现成的LLM作为"教师",不需要这个教师比学生强很多——论文实验中甚至用了比学生还弱的教师,效果依然显著。

第一步:找到第一个错误。

对于每一条rollout(模型生成的一次完整推理轨迹),教师模型被用来识别第一个出错的位置。这个位置之前的所有步骤被视为"正确前缀",这个位置及之后的所有步骤被视为"错误后缀"。

怎么识别第一个错误?论文没有详细披露具体算法,但从描述来看,教师模型被用来判断每一步的合理性。当教师发现某一步与前一步的逻辑不一致,或者偏离了正确的推理方向时,就标记为"第一个错误"。

这里的关键洞察是:你只需要找到第一个错误,不需要评估所有步骤。 这大大降低了计算成本。

第二步:将信号转化为token级优势。

找到了第一个错误之后,Cliff将整个rollout分成两部分:

  • 正确前缀:第一个错误之前的所有token。这些token获得正的优势值(positive advantage)——强化学习算法会鼓励模型在未来更多地生成这些token。
  • 错误后缀:第一个错误及之后的所有token。这些token获得负的反馈(negative feedback)——强化学习算法会抑制模型在未来生成这些token。
这种分配方式非常直观:既然第一步错了,那后面的都是错的——至少在当前的优化目标下是这样。

第三步:用标准RL算法更新策略。

得到了token级的优势值之后,就可以使用标准的强化学习算法(如GRPO)来更新模型的策略了。Cliff本质上是一个奖励塑形(reward shaping)策略,它不改变底层RL算法的框架,只是改变了奖励信号的计算方式。

🎯 为什么是"Cliff"?

这个名字太妙了。

想象你站在悬崖边。第一步迈出去——如果方向对了,你继续往前走。但如果第一步迈错了,你直接掉下悬崖。后面的风景再美,也与你无关了。

Cliff这个策略的命名,精准地捕捉了它的核心哲学:在推理过程中,第一个错误具有决定性的意义。 它不是"一个错误",而是"一个转折点"——从这个点开始,整个推理轨迹的性质发生了变化:从"可能正确"变成了"注定错误"。


📊 第三部分:实验结果——Cliff到底强在哪?

论文在12个不同的推理场景上测试了Cliff,覆盖了数学推理、代码生成、逻辑推理、科学问答等多种任务。结果令人印象深刻。

🏆 核心性能提升

对比方法相对提升
标准GRPO(无过程奖励)+7%
在线蒸馏(On-Policy Distillation)+15%
这意味着:Cliff比当前主流的两种方法——标准GRPO和在线蒸馏——都有显著的性能提升。而且,这些提升是在教师模型能力并不强的情况下实现的。论文特意指出,即使教师模型比学生模型弱,Cliff依然有效。

这一点非常重要。它意味着Cliff不是依赖于"有一个超强的老师"——这在实际应用中很难保证。Cliff利用的是"第一个错误"这个结构化的信号,而不是教师模型的绝对能力。

🔍 更深层的分析:" ground truth" 的作用

论文还做了一个有趣的分析:Cliff到底在多大程度上依赖"完美的正确答案"?

在理想情况下,我们需要知道每个推理步骤的"正确答案"才能准确地标记"第一个错误"。但在很多实际场景中,我们可能没有这样的完美标注。论文探索了Cliff在不同程度的ground truth可用性下的表现,发现:

  • 即使ground truth不完美,Cliff仍然比基线方法好。
  • Cliff对ground truth错误的容忍度比PRM高得多——因为Cliff只关心"第一个错误在哪里",而不关心"每一步的具体评分"。
这个结果有重要的实际意义:在真实世界的应用中,完美的过程标注往往不可得。Cliff的低标注依赖特性,使它比PRM更容易部署。

⚙️ 训练动态分析

论文还分析了Cliff训练过程中的动态行为。一个有趣的发现是:

随着训练的进行,模型学会在"悬崖边"更加谨慎——它在早期步骤中的错误率显著下降,而在后期步骤中即使出错,也能更快地被纠正。

这表明Cliff不仅提升了最终性能,还改变了模型的推理行为模式。模型学会了"三思而后行"——在迈出第一步之前更加仔细地思考,因为一旦错了,后面的努力都是徒劳的。


🌉 第四部分:Cliff的哲学——从"结果导向"到"过程觉醒"

Cliff的技术贡献很清晰,但它背后蕴含的方法论转变更值得关注。

🔄 从"黑盒评估"到"结构感知"

传统的RLVR把推理过程当作一个黑盒:输入问题,输出答案,只看答案对不对。这个过程内部发生了什么,完全不管。

Cliff打开了这个黑盒的一扇小窗。它不关心每一步的具体内容,但它关心过程的结构——特别是"第一个错误"这个结构性转折点。这种对过程结构的感知,比纯粹的结果评估要丰富得多。

用一个类比:传统RLVR像是一个只看重最终考试成绩的老师。Cliff像是一个会检查你试卷、标记你第一次做错的那道题的老师。虽然这个老师不检查所有题目,但仅仅标记"第一个错误",就能给学生提供比"总分"更有价值的信息。

🧭 "第一个错误"的普遍意义

"第一个错误"这个概念之所以强大,是因为它揭示了一个关于复杂系统脆弱性的普遍真理:

在级联系统(cascading system)中,早期的微小错误会被后续步骤不断放大,最终酿成灾难性的后果。

这个原理不仅适用于LLM的推理过程,也适用于:

  • 软件工程:一个早期设计决策的错误,会在整个代码库中不断复制,最终需要大规模重构才能修复。
  • 科学研究:一个实验设计的初始假设如果有偏差,后续所有的数据分析都会在这个偏差的基础上进行,导致系统性错误。
  • 人际关系:一次早期的误解如果没有及时澄清,会在后续的互动中被不断"确认"和强化,最终演变成不可调和的矛盾。
  • 历史进程:许多重大历史事件的转折点,都可以追溯到某个早期被忽视的小错误——比如一战前的外交误判,或者2008年金融危机中对次贷风险的早期低估。
Cliff的方法论——识别并纠正第一个错误——可能比我们想象的更有普遍价值。


🎭 第五部分:局限与未来的悬崖

诚如费曼所说:"你必须先搞清楚什么是对的,然后才能搞清楚什么可能是错的。"在盛赞Cliff的同时,我们也要看到它的局限。

⚠️ Cliff的边界

1. "第一个错误"的识别本身不是免费的。

虽然Cliff不需要人工标注,但它需要一个教师模型来识别第一个错误。这个教师模型如果本身就不准确,Cliff的信号就会被污染。论文中提到即使教师比学生弱也能工作,但这有一个下限——如果教师完全随机猜测,Cliff当然也无法工作。

2. 不是所有推理任务都有明确的"第一个错误"。

在数学推理或代码生成中,"错了"通常是明确的——计算结果不等于正确答案,代码运行报错。但在创意写作、开放式问答、伦理推理等任务中,"错误"的定义本身就是模糊的。一个回答可能"不够好",但很难说"第一步就错了"。Cliff目前主要适用于有明确可验证答案的任务。

3. "第一个错误"之后就没有价值了吗?

Cliff假设第一个错误之后的所有步骤都是"无价值的"。但这个假设是否总是成立?

想象一下:一个学生解数学题,第一步理解错了题意,但在错误的理解下,他展示了非常精妙的推导技巧。虽然最终答案是错的,但他的中间步骤中蕴含的数学能力是否完全没有学习价值?

在某些情况下,错误后缀中可能包含有用的探索信息——比如"这条路走不通"本身就是一种知识。Cliff的"一刀切"策略可能会丢弃这些有价值的信息。未来的工作可以探索更细粒度的奖励分配,比如给"错误但有趣"的探索步骤一个较小的正奖励。

4. 推理步骤的粒度问题。

Cliff在"token级别"分配优势值。但token是语言的最小单位,不一定对应"推理步骤"的最小单位。一个"推理步骤"可能由多个token组成,也可能一个token跨越了多个推理步骤。Cliff目前的粒度是固定的(token级),未来可以探索更灵活的粒度——比如"推理步级别"的优势分配。


📝 结语:站在悬崖边,选择谨慎的第一步

让我用费曼的方式来收束这篇解读。

你看,Cliff这个东西,说穿了就是一个很简单的想法:一旦第一步错了,后面再对也没用了。
> 简单到让人发笑。简单到你问"之前怎么没人做这个?"
> 但科学里最好的想法往往就是这样——不是更复杂,而是更
> 费曼会怎么说?他会说:"我有个朋友是魔术师。他告诉我,最精妙的魔术不是那些需要复杂机关的——而是那些利用你本来就会犯的错误的。"你本来就会忽略第一个错误的重要性,因为人的注意力天然被"最后一步"吸引。
> Cliff利用了这一点——不是利用你的错误,而是利用模型在训练中的错误。它说:"别再看终点了。看看你是从哪一步开始掉下悬崖的。"
> 这不是魔法。这是结构的直觉
> 在复杂系统的世界里,结构比内容更重要。第一个错误的位置,比最终答案的对错,包含更多的信息。
> Cliff没有解决所有问题。它不能告诉你"正确答案是什么",它只能告诉你"你从哪里开始错了"。但在一个信息稀缺的沙漠里,即使一个粗糙的路标,也比没有路标好得多。
> 事情就是这样。

📚 参考文献

主要参考论文:

  • Han, P., Wang, R., Ramaneti, K., et al. (2026). *Cliff: Learning Process Rewards from the First Mistake*. arXiv:2609.02817.
相关背景阅读:
  • DeepSeek-AI. (2025). *DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning*.
  • OpenAI. (2024). *Learning to Reason with LLMs*.
  • Uesato, J., et al. (2022). *Solving Math Word Problems with Process- and Outcome-Based Feedback*.
  • Lightman, H., et al. (2023). *Let's Verify Step by Step*.
  • Feynman, R. P. (1965). *The Character of Physical Law*.
技术实现参考:
  • Schulman, J., et al. (2017). *Proximal Policy Optimization Algorithms*.
  • Shao, Z., et al. (2024). *DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models*.

*本文由小凯基于费曼风格深度解读 | 自动采集于 2026-09-04*

#论文 #arXiv #强化学习 #LLM #推理 #小凯 #费曼解读

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens