Q 函数预训练的悖论:为什么"更充分的准备"反而帮倒忙
一个反直觉的发现
想象你在准备一场马拉松。教练说:"比赛前先跑 10 次半马作为热身。"你照做了。但比赛当天,你的成绩反而比那些没做半马热身的人差。
这听起来荒谬,但 2026 年 7 月 29 日,Stanford 的 Perry Dong、Ron Polonsky、Dorsa Sadigh 和 Chelsea Finn 在 arXiv 发表的论文《Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?》报告了一个类似的发现:
在基于价值的强化学习中,预训练 Q 函数不仅没有帮助,有时反而有害。
这个发现之所以令人震惊,是因为它违背了当前 RL 领域的"常识"。预训练+微调已经成为学习高性能策略的主流方法——在语言建模、机器人控制、游戏 AI 中都是如此。既然策略可以预训练,Q 函数为什么不能?
背景:预训练+微调的 RL 配方
先理清基本概念。在基于价值的强化学习中,有两个核心组件:
- 策略 $\pi$:给定状态,输出动作。可以理解为"行为准则"。
- Q 函数 $Q^\pi(s,a)$:在状态 $s$ 下采取动作 $a$,之后按策略 $\pi$ 行动的预期累计回报。可以理解为"动作评估器"。
第 2 步中预训练 Q 函数的直觉是:既然策略都预训练了,Q 函数也应该预训练——这样在线 RL 就不用从零开始学习价值估计。
但近期的相关工作(Dong et al., 2026a 的 EXPO)发现了一个意外现象:不预训练 Q 函数,直接随机初始化,在线 RL 也能获得高性能且可靠的策略。
这促使论文作者系统性地问:Q 函数预训练到底有没有用?
根本不匹配:$Q^{\pi_{\text{base}}} \neq Q^{\pi^*_{\text{RL}}}$
论文的核心发现可以用一个不等式概括:
$$Q^{\pi_{\text{base}}} \neq Q^{\pi^*_{\text{RL}}}$$
读作:**预训练策略 $\pi_{\text{base}}$ 对应的 Q 函数,不等于在线 RL 收敛后最优策略 $\pi^*_{\text{RL}}$ 对应的 Q 函数。
这个不匹配是根本性的,不是"数据不够多"或"训练不够久"的问题。原因在于:
预训练阶段的 Q 函数学的是"在 $\pi_{\text{base}}$ 策略下,哪些动作好"。但在线微调的目标是改变策略**——从 $\pi_{\text{base}}$ 变成 $\pi^*_{\text{RL}}$。一旦策略变了,"好动作"的定义就变了。在 $\pi_{\text{base}}$ 下好的动作,在 $\pi^*_{\text{RL}}$ 下未必好。
更具体地说,预训练 Q 函数学到的价值估计是针对 $\pi_{\text{base}}$ 的轨迹分布的。但在线 RL 探索的是不同的轨迹分布——它要尝试 $\pi_{\text{base}}$ 不会采取的动作,才能发现更好的策略。这些"偏离分布"的动作在预训练 Q 函数中的价值估计是盲区。
> "The Q-function learned during pretraining targets the pretrained policy's Q-function, not the Q-function that online fine-tuning converges to, and this gap persists even after offline value maximization."
关键短语是"this gap persists"——即使你在离线阶段做了价值最大化,这个差距依然存在。因为离线价值最大化仍然是在 $\pi_{\text{base}}$ 的支持分布内做的,无法覆盖在线 RL 会探索的新区域。
单策略的窄动作覆盖
论文进一步发现了问题的根源:单个预训练策略产生的动作分布太窄。
一个策略 $\pi_{\text{base}}$ 在状态 $s$ 下倾向于选择某些动作,形成了一个"窄峰"分布。预训练 Q 函数在这个窄峰覆盖的区域内估计是准确的,但在这个区域之外——在线 RL 需要探索的区域——估计是盲目的。
这就像你只在北京市地图上训练了一个导航系统,然后让它导航上海。不是地图精度不够,是覆盖区域根本不对。
论文通过实验验证了这一点:在多个任务上,单个预训练策略的动作分布确实只覆盖了整个动作空间的一小部分。这意味着预训练 Q 函数在大部分动作空间上的估计都是外推的——而外推是价值函数最不可靠的地方。
IPE:策略集成初始化
基于这个诊断,论文提出了一个简单但巧妙的解决方案——IPE(Initialization via Policy Ensemble):
1. 训练 $N$ 个多样化的策略 $\{\pi_1, \pi_2, \ldots, \pi_N\}$(不只是单个 $\pi_{\text{base}}$) 2. 从每个策略收集 rollout 轨迹 3. 把所有 rollout 汇总起来作为 Q 函数预训练的数据 4. 用这个汇总数据预训练 Q 函数
核心思想是:多个策略的并集覆盖更广的动作空间。如果策略 1 覆盖了动作空间的 A 区域,策略 2 覆盖了 B 区域,策略 3 覆盖了 C 区域,那么三个策略的汇总数据就覆盖了 A∪B∪C——比任何单个策略都广。
这和集成方法的精神一致——不追求一个更强的模型,而是用多个弱模型的组合覆盖更广的空间。但 IPE 的独特之处是:集成不是用于预测,而是用于预训练数据生成。最终的 Q 函数仍然是单个函数,不是集成。
实验:26% 的平均提升
论文在多个环境上验证了 IPE:
- D4RL 机器人任务:标准离线 RL 基准
- Vision-Locomotion:视觉运动控制
- EXPO-ft 基准:作者之前工作的环境
| 方法 | 平均相对性能 |
|---|---|
| 随机初始化 Q 函数 | 基线 |
| 朴素 Q 函数预训练 | ≈ 基线(几乎无优势) |
| IPE(N=5 策略) | +26% |
为什么"更充分的准备"帮倒忙?
回到开头的马拉松比喻。为什么预训练 Q 函数像"跑了 10 次半马反而拖累全马成绩"?
论文的诊断指向一个深层原因:预训练阶段学到的能力,和在线微调阶段需要的能力,不是同一种能力。
预训练 Q 函数学的是"评估 $\pi_{\text{base}}$ 的动作好坏"——这要求在 $\pi_{\text{base}}$ 的分布内做精确的价值估计。
在线微调需要的是"评估偏离 $\pi_{\text{base}}$ 的动作好坏"——这要求在 $\pi_{\text{base}}$ 的分布外做价值估计。
这两者不是同一件事。更糟的是,预训练可能让 Q 函数在 $\pi_{\text{base}}$ 分布内"过度自信"——对它见过的动作给出精确估计,对没见过的动作给出不可靠的外推。这种过度自信可能误导在线 RL 的探索方向。
IPE 的解法是:不试图让预训练更精确,而是让预训练覆盖更广。与其让 Q 函数在一个窄分布内做到 99% 精度,不如让它在 5 个分布内都做到 80% 精度——后者对在线 RL 更有用,因为在线 RL 会探索所有这些区域。
和"分工比统一更有效"原理的连接
这个发现和"分工比统一更有效"原理有深层连接。
当前 RL 的主流做法是:一个策略 + 一个 Q 函数,两者通过 RL 同时训练。这追求的是"统一"——一个模型搞定一切。
IPE 揭示的是:预训练阶段和在线微调阶段应该有不同的策略覆盖。预训练需要广覆盖(多个策略),在线微调需要精优化(单个策略)。把这两个阶段用同一个策略覆盖,是颗粒度错配。
这和 ACE 工作流的 RPI 分工、Rebucca 的小模型+大模型复核、Euclid-MCP 的 LLM+Prolog 分工,都是同一个原理的不同实例:让专门工具做专门的事,不追求一个模型做所有事。
对 Agentic RL 的启示
这个发现对当前火热的 Agentic RL 领域有重要启示。
当前很多 Agent 系统用预训练+微调的配方:先在大量离线轨迹上预训练,再在线 RL 微调。论文的发现提醒我们:
1. 预训练的 Q 函数可能误导在线 RL——如果预训练数据只覆盖窄分布 2. 多样性比精确性更重要——预训练阶段应该追求覆盖广,而非拟合精 3. 随机初始化不是次优选择——在某些场景下,它可能比预训练更好
这对步子哥关注的 Agentic RL 系统效率问题有直接启示:如果 Agent 的价值函数预训练只用了单一任务/单一策略的数据,在线微调时可能遇到类似的"窄覆盖"问题。解法是:在预训练阶段就引入多样性——多任务、多策略、多环境的数据。
评测盲区定律的再一例
这篇论文也印证了"评测盲区定律"。如果只看"预训练 Q 函数在离线数据上的拟合精度",预训练看起来是成功的——Q 值估计很准。但这个指标掩盖了关键失败模式:在线 RL 阶段的探索-利用平衡。
正确的评测应该看:
- 预训练 Q 函数在分布外的价值估计精度(而非分布内)
- 在线 RL 微调后的最终策略性能(而非预训练阶段的 Q 值精度)
- 不同随机种子下的方差(而非单次最佳结果)
结语:准备的艺术
Pangram 4 的检测器在研究"AI 写作的特征",IPE 在研究"预训练的特征"。两者都指向一个共同的洞察:准备不是越多越好,而是越对路越好。
预训练 Q 函数的问题不是"准备不充分",而是"准备错了方向"。它准备了"在 $\pi_{\text{base}}$ 分布内做精确评估"的能力,但在线 RL 需要的是"在 $\pi_{\text{base}}$ 分布外做可靠评估"的能力。这两种能力不仅不同,可能还互相矛盾——越精确的分布内拟合,越可能在分布外过度自信。
IPE 的解法是:与其追求单个策略的精确,不如追求多个策略的覆盖。这和人类学习的经验一致——准备一场考试,做 10 套不同风格的模拟题,比把同一套题做 10 遍更有用。
也许"换层面解决问题"概念谱系的下一个成员,就是 IPE 揭示的这个原理:在准备阶段,覆盖比精度重要。这个原理不仅适用于 RL,也适用于任何"准备-执行"分离的系统——从考试复习到军事训练到产品 MVP。
---
论文信息:
- 标题:Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
- 作者:Perry Dong, Ron Polonsky, Dorsa Sadigh, Chelsea Finn
- 机构:Stanford University
- arXiv:2607.27203
- 发布时间:2026-07-29