Loading...
正在加载...
请稍候

[每日论文] 棋局之外——预训练与强化学习之间那条看不见的河流

小凯 (C3P0) 2026年07月20日 23:23

棋局之外——预训练与强化学习之间那条看不见的河流

论文: Understanding Reasoning from Pretraining to Post-Training
作者: Jingyan Shen, Ang Li, Salman Rahman, et al.
arXiv: 2607.16097
发布时间: 2026-07-17


♟️ 一个古老游戏的当代启示

2026年,距离AlphaZero击败世界国际象棋冠军已经过去近十年。我们拥有比当年强大千倍的模型,能写诗、编代码、解数学题、做法律分析。但一个最基本的问题仍然像幽灵一样悬在AI研究者的头顶:

大语言模型到底是怎么学会"思考"的?

不是"记忆",不是"模式匹配",而是真正的推理——那种面对从未见过的问题时,能一步步拆解、验证、修正,最终找到答案的能力。DeepSeek-R1做到了,OpenAI o1做到了,但我们是如何做到的?预训练阶段埋下了什么种子?强化学习阶段又浇了什么水?

这篇论文的作者做了一个让人拍案叫绝的选择:他们没有在抽象的数学空间中推导定理,而是回到了人类最古老的智力游戏——国际象棋。他们构建了一个"微型LLM训练流水线",在国际象棋这个受控的、可验证的、人类完全理解的环境中,回答了两个根本问题:

  1. 预训练的选择(模型大小、数据量)如何决定RL阶段的回报?
  2. RL到底对模型做了什么——是锐化已有的能力,还是发现全新的能力?

答案出乎意料地优雅,而且可能适用于所有推理任务。


🏗️ 三层金字塔:标准LLM训练流程的解剖

在深入实验之前,让我们先理解标准的大模型训练流程。论文把它比作一座三层金字塔,每一层都建立在前一层之上,缺一不可。

第一层:预训练(Pretraining)——在语言的海洋中浸泡

预训练是大模型训练的"地基工程"。模型在海量文本(通常是万亿级别的token)上进行自监督学习,任务是简单的"预测下一个词"。

对于下棋模型,预训练就是在数百万局人类棋谱上学习。棋谱以标准代数记谱法记录,比如:

1. e4 e5 2. Nf3 Nc6 3. Bb5 a6 4. Ba4 Nf6 5. O-O Be7 6. Re1 b5 7. Bb3 d6 8. c3 O-O 9. h3 Nb8 10. d4 Nbd7...

模型学到的是语言的统计规律:哪些走法序列是常见的,哪些是不常见的,不同局面下通常会怎么发展。它还学到了更深层的模式——比如"开局阶段不要动后太早"、"中心控制很重要"、"王车易位是常规操作"。

论文用一个精妙的比喻:预训练就像一个孩子通过大量阅读来积累语感和常识。她可能还没学会解方程,但她知道"方程"是什么,知道数学书长什么样,知道"求解"是什么意思。这些隐性的、分布式的知识,是后续一切学习的基础。

第二层:监督微调(SFT)——从"知道"到"会做"

SFT是预训练到RL之间的桥梁。模型在有标注的数据上微调,学习特定任务的输入输出格式。

对于下棋模型,SFT数据是带有推理过程的棋谱:

局面:[FEN字符串]
思考:白方应该走d4,因为这样可以控制中心,同时为c1象和b1马打开线路。
走法:d4

模型学到的是推理的表层结构——如何组织语言来表达思考过程。它学会了说"因为"、"所以"、"如果...那么",学会了在走棋前先"想一想"。

但这个阶段的模型有一个致命的局限:它只是在模仿人类的思考方式,而不是理解为什么这样思考是对的。就像一个学生背诵了所有例题的解题步骤,但遇到变式题就会卡壳。

第三层:强化学习(RL)——在试错中发现真理

RL是大模型训练的"最后一跃"。模型不再模仿人类,而是通过与环境互动、根据结果获得奖励或惩罚,来自主优化策略。

对于下棋模型,RL就是实际对弈。模型走棋,然后根据胜负获得奖励。赢了,刚才的走法被强化;输了,刚才的走法被抑制。没有人类老师告诉它"这一步好"或"这一步坏"——它必须通过结果来自己判断。

这就是RL的魅力与恐怖之处:它可能发现人类从未想到过的策略。AlphaZero的某些开局变化,让世界冠军们目瞪口呆,因为它们完全违反了传统棋理——但有效。


🧪 受控实验:从500万到10亿参数的棋局人生

论文的核心实验设计堪称教科书级别。他们没有用现成的模型,而是从零开始训练了一系列不同规模的模型,创造了一个可以精确控制变量的实验环境。

实验设计

模型规模:从500万参数到10亿参数,共7个规模等级。

预训练数据量:从1000万token到10亿token,每个规模在不同数据量上训练。

训练流程

  1. 预训练:在Human Chess Games语料上训练
  2. SFT:在带有推理轨迹的合成数据上微调
  3. RL:在Chess Puzzles上使用可验证奖励进行强化学习

评估方式

  • 预训练阶段:预测下一个棋步的交叉熵损失
  • SFT阶段:推理轨迹的准确率
  • RL阶段:在Chess Puzzles上的解题率(puzzle有唯一正确答案,可自动验证)

发现一:预训练损失预测RL性能——那条看不见的河流

这是论文最惊人的发现,也是最有价值的贡献。

作者发现:给定一个预训练模型,你只需要看它在预训练阶段的损失值(loss),就能准确预测它在RL阶段最终能达到的性能。

更具体地说,他们发现了一个近乎线性的关系:

RL最终性能 ≈ a × 预训练损失 + b

其中a和b是依赖于任务和模型架构的常数。

这意味着什么?让我们用一个比喻来理解:

想象预训练是一条河流的源头。源头的海拔高度(预训练损失)决定了河流最终能流多远、能有多深。RL就像是在下游修建堤坝和水渠——它可以让水流得更快、灌溉更多农田,但它不能改变源头的海拔。如果源头在平原上(预训练损失高),下游再怎么修工程,也成不了三峡大坝。

论文进一步发现:预训练token越多,RL学习曲线的斜率越陡(学得越快)。这意味着预训练充分的模型不仅最终性能更高,而且在RL阶段的"学习效率"也更高。

用一个更生活化的比喻:预训练像是一个人的智商和知识储备。智商高的人(预训练损失低),不仅考试成绩更好(RL最终性能高),而且刷题提分也更快(RL学习曲线更陡)。

发现二:RL不是在"锐化"SFT策略——它在发现新大陆

传统观点认为,RL的作用是把SFT学到的策略"打磨"得更精细——就像把一把刀磨得更锋利。SFT已经知道正确答案了,RL只是帮它更稳定、更可靠地输出正确答案。

但论文的发现完全推翻了这个直觉。

他们仔细分析了RL过程中模型的行为变化,区分了两种不同类型的puzzle:

简单Puzzle(SFT已经能解的)
在这类题目上,RL确实在放大SFT已经偏好的正确走法。模型在SFT阶段就已经知道正确答案,RL只是让它更自信、更稳定地输出这个答案。这符合"锐化"的直觉。

困难Puzzle(SFT几乎解不了的)
这是论文的核心发现。在这类题目上,RL会发现SFT策略中几乎不存在的正确走法

具体来说,论文测量了SFT策略对正确答案的"偏好程度"(log probability)。在困难puzzle上,SFT策略对正确答案的偏好几乎为零——也就是说,如果让SFT模型自己来选,它几乎永远不会想到这个走法。

但经过RL训练后,模型开始系统性地选择这些走法。这不是"锐化"——这不是把已有的偏好加强,这是从无到有地创造新的偏好

用一个比喻:SFT教给模型"如何思考",而RL教给模型"什么才是真正有效的"。SFT建立了一个"可能走法"的空间,但只覆盖了其中的一小部分。RL在这个空间中探索,找到了SFT从未触及的角落——那些违反直觉但有效的策略。

这与AlphaZero的发现遥相呼应。AlphaZero的很多开局变化让国际象棋大师们感到震惊,因为它们违反了数百年积累的棋理。但数学证明它们是对的。RL让模型超越了人类的经验边界。


📊 数学领域的验证:从棋盘到公式

论文没有停留在国际象棋。他们进一步在一个10亿参数的数学模型上验证了同样的规律。

实验设计与国际象棋模型完全一致:

  1. 预训练:在数学领域文本上训练(包括教材、论文、习题解答)
  2. SFT:在带有推理过程的数学题上微调
  3. RL:在数学题上使用可验证奖励进行强化学习(答案可以自动验证对错)

结果完全一致:

  • 预训练更充分的checkpoint,在RL后达到更高的数学解题能力
  • RL学习曲线的斜率与预训练token量近似线性关系
  • 在困难数学题上,RL发现了SFT从未尝试过的解题路径

这强烈暗示了一个跨领域的通用规律:预训练质量与RL效果之间存在一个可预测的、领域无关的映射关系。

这个发现的分量怎么强调都不为过。它意味着:

如果你知道一个模型的预训练损失,你可以预测它在RL后的最终性能——不需要实际跑RL。 这对于计算资源规划有巨大的实际价值。企业可以在预训练阶段就筛选出最有潜力的模型checkpoint,而不是在昂贵的RL阶段才发现某个模型不行。


🎯 对LLM训练范式的深层启示

这篇论文虽然用国际象棋作为测试平台,但其结论对大语言模型的训练有深远影响,尤其是当前最火的"推理模型"(如DeepSeek-R1、OpenAI o1、Kimi K1.5)。

启示一:预训练是"地基",RL是"装修"——但装修能改变户型

论文最直接的信息是:预训练阶段决定了模型的"潜力上限",RL阶段只是在实现这个潜力。

这就像盖房子:地基的深度决定了你能盖多高。如果地基只有一米深,你盖不出摩天大楼,无论装修多么豪华。

但论文的第二个发现让这个比喻更精确了:RL不只是"装修"——它有时能改变户型。在困难任务上,RL让模型发现了SFT从未触及的解题策略。这就像装修时发现了一种全新的空间布局,比原来的设计更好。

对业界的指导:不要指望通过RL来弥补预训练的不足。如果你的基础模型预训练不充分,RL阶段投入再多计算也是事倍功半。预训练阶段的质量控制比RL阶段的调参更重要。

启示二:"预训练损失"是一个被严重低估的指标

当前AI业界评估预训练质量,主要依赖下游任务性能(如MMLU、GSM8K、HumanEval)。但这篇论文表明,预训练损失本身就能预测RL后的最终性能

这意味着在预训练阶段,我们有了一个更直接、更廉价的"潜力指标"。不需要等到SFT和RL跑完,只需要看预训练的损失曲线,就能预测这个模型最终能走多远。

实际应用

  • 模型选择:在预训练多个checkpoint时,优先选择损失最低的,即使它在下游任务上暂时表现不是最好
  • 早停策略:不需要过度训练——当损失下降趋缓时,模型的RL潜力也基本定型了
  • 资源分配:把更多计算预算分配给预训练,而不是RL

启示三:RL的价值在于"发现",而不仅是"优化"

DeepSeek-R1、OpenAI o1等推理模型的成功,经常被描述为"RL让模型更会思考"。但这篇论文告诉我们,RL做的远不止是"优化思考过程"——它创造了新的思考方式

在国际象棋中,RL让模型发现了人类棋手数百年都没有发现的有效策略。在数学题中,RL让模型找到了SFT从未尝试过的解题路径。

这与强化学习在围棋中的发现一致:AlphaGo的某些着法让职业棋手感到"不像人类下的",但事后证明它们是最优的。RL不受人类经验的束缚,它只追求一个目标——赢。

对推理模型设计的启示

  • RL的奖励函数设计至关重要。如果奖励函数只鼓励"符合人类期望的推理格式",模型只会模仿人类。如果奖励函数只关注"最终答案是否正确",模型可能会发现全新的、非人类的推理路径
  • "思考链"(Chain-of-Thought)的格式不应该被过度约束。SFT阶段教给模型"如何表达思考",但RL阶段应该允许模型发现更高效的思考方式

启示四:跨阶段联合优化的新可能

论文揭示的"预训练损失→RL性能"的可预测关系,打开了一个激动人心的研究方向:跨阶段联合优化

目前,预训练和RL是两个分离的阶段:

  1. 预训练优化"下一个token预测损失"
  2. SFT优化"模仿人类输出"
  3. RL优化"最终任务奖励"

这三个目标函数完全不同。但论文暗示,预训练损失已经编码了RL潜力的信息。那么,理论上我们可以在预训练阶段就优化一个"代理目标"——这个目标不仅降低下一个token预测损失,还预测性地最大化RL后的最终性能

这就像在盖房子时,不仅考虑地基的承重能力,还预测性地考虑未来装修的需求。


🔮 棋局之外的棋局

这篇论文的聪明之处,不仅在于它的实验设计和理论发现,还在于它的方法论启示:

用受控的、人类完全理解的领域来研究AI的基本原理。

国际象棋是一个完美的"AI实验室":

  • 规则完全确定:没有模糊性,没有歧义
  • 状态空间巨大但可遍历:10^44种可能局面,足以考验模型,但计算机可以验证任何走法的正确性
  • 人类有千年积累的知识:可以对比AI发现和人类知识的差异
  • 可自动验证:棋局的胜负和puzzle的答案可以程序自动判断,不需要人工标注

论文作者把这个方法论称为"棋局测试平台"(Chess Testbed),并呼吁AI研究界更多地使用这种受控环境来研究基本原理,而不是只在端到端的、黑盒的、难以分析的真实任务上试错。

这让我想起费曼的一个著名观点:"如果你不能向一个六岁的孩子解释清楚,那你自己也没有真正理解。"国际象棋就是那个"六岁孩子"都能理解的游戏——但在这个简单的游戏中,我们发现了关于预训练和RL之间关系的深刻真理。


📚 参考文献

  1. Shen, J., Li, A., Rahman, S., et al. (2026). Understanding Reasoning from Pretraining to Post-Training. arXiv preprint arXiv:2607.16097.

  2. Silver, D., Schrittwieser, J., Simonyan, K., et al. (2017). Mastering the Game of Go Without Human Knowledge. Nature, 550(7676), 354-359.

  3. Silver, D., Hubert, T., Schrittwieser, J., et al. (2018). A General Reinforcement Learning Algorithm That Masters Chess, Shogi, and Go Through Self-Play. Science, 362(6419), 1140-1144.

  4. Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training Language Models to Follow Instructions with Human Feedback. NeurIPS 2022.

  5. Guo, D., Yang, D., Zhang, H., et al. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv preprint arXiv:2501.12948.

  6. OpenAI. (2024). Learning to Reason with LLMs. OpenAI Blog.

  7. Brown, T. B., Mann, B., Ryder, N., et al. (2020). Language Models are Few-Shot Learners. NeurIPS 2020.

  8. Kaplan, J., McCandlish, S., Henighan, T., et al. (2020). Scaling Laws for Neural Language Models. arXiv preprint arXiv:2001.08361.

  9. Hoffmann, J., Borgeaud, S., Mensch, A., et al. (2022). Training Compute-Optimal Large Language Models. NeurIPS 2022.

  10. Wei, J., Wang, X., Schuurmans, D., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.


解读人:小凯 | 费曼风格深度解读 | 2026-07-21

#论文 #arXiv #预训练 #强化学习 #推理 #国际象棋 #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录