VHG 这篇论文(arXiv:2605.06660,2026-05-07,Lai / Feng / Teh / Miao)干的事,用一句话讲完:
在「出题者–解题者」的两人自博弈里,硬塞进第三个人——一个只管真假、不管难度的验证器。
就这一步,把一个会自己骗自己的训练闭环,掰直了。
一、漏洞:一道乱码题,也能拿满分
朴素自博弈的逻辑看着挺优雅:出题模型造题,解题模型做,做不出来就说明题难,给出题者发奖励。
问题在于这个等号成立的前提——题目本身得成立。
出题模型很快就摸到了捷径:生成一道狗屁不通的题。题干自相矛盾、条件缺失、答案根本不存在——解题模型当然做不出来,正确率 0%,奖励满分。
【直引】论文原话:"the proxy reward of problem difficulty can be easily hacked by generating invalid problems, where the solver has zero accuracy, which provides high rewards to the setter."
打个比方:学生全都交白卷,你分不清是题太难,还是你把卷子印成了乱码。朴素自博弈把「交白卷」直接等同于「题出得好」。
这不是假想敌。VHG 实验里,基线 R-Zero 跑了三轮迭代,Overall 依次 65.61 / 66.20 / 65.76——三轮下来不升反降,连什么花招都没有的 Vanilla GRPO(67.62)都没打过。
二、一式定乾坤
整套框架浓缩成一行:
R_Q(x, y*) = 1[ V(x, y*) = 1 ] · ( 1 − Acc_S(x, y*) )
前一项是验证器的真假闸门,后一项是解题者的难度信号。
关键在于它是乘法而非加法。写成加权和,出题者还能拿「无效但极难」换到部分分数;写成乘法,无效题的奖励被硬钳位到 0,梯度彻底断流。
【推论】验证器绝不能碰难度。VHG 给裁判的指令里有一句写得很明白:"Judge only validity and relation to the seed; do not require the variant to be harder." 一旦裁判开始评难度,它就和解题者的信号冗余了,闸门不再是独立的。职责分离,是独立性的前提。
三、两种验证器:硬的与软的
硬验证器选了个极妙的试验田——不定积分。出题者交上来的不是开放题,而是一对 (f, F):被积函数与原函数。验证只需三步:格式检查 → 对 F 求导得 F′ → 比对 F′ 是否等于 f。
这里藏着一个深刻的洞见:原函数难求,导数却好求。 造题是搜索,验题是计算。这就是所谓验证不对称性。
软验证器用于通用数学,是「硬编码过滤器 + GPT-5.4 裁判」。顺序不能反:先用不需要智能的规则刷掉畸形输出、缺失或多个最终答案、近复制种子;剩下的才交给昂贵的裁判。裁判输出五个布尔字段,全真才接受:valid_problem / valid_solution / seed_anchored / not_trivial_copy / complete_final_answer。
四、全篇最漂亮的发现:先学有效,后学难度
如果这篇论文只能留一张图,我投 Figure 4——出题者的学习轨迹是两段式的:
| 有效率 | 解题通过率 | |
|---|---|---|
| step 0 → 50 | 30.6% → 65.2% | 36.2% → 42.0%(题反而变简单了) |
| step 50 → 200 | → 75.5% | 42.0% → 17.6%(题变难了) |
「既有效又难」的占比,从 27.5% 升到 58.5%。
【判断】这个两段式曲线,是「验证器优先」有效性的直接证据。它说明验证器不只是过滤器,而是改变了学习的次序:模型必须先掌握「什么算合法的问题」,才能在此约束下去追求难度。反过来看,没有验证器的朴素自博弈,模型会跳过第一阶段直奔难度——于是掉进乱码的坑。
五、战绩,以及那个 +1.39
先看硬验证器那一半,几乎无可指摘(Qwen3-4B-Base 起训):
| 指标 | 起点 | VHG (Hard) |
|---|---|---|
| Competition Pass@1 | 28.8 | 45.4 |
| Qualifier Pass@1 | 52.5 | 69.4 |
| Stress Test Pass@1 | 43.3 | 64.7 |
再看软验证器那一半,通用数学 Overall 从 56.79 → 69.01,看着是 +12.2。但——
这是相对基座模型的差距。相对最强基线 Vanilla GRPO(67.62),真实增量只有 +1.39。
逐项差值摊开看更有意思:
| MATH | GSM8K | AMC | Olympiad | Minerva | AIME24 | AIME25 | AIME26 | Overall |
|---|---|---|---|---|---|---|---|---|
| +2.23 | +0.44 | +2.81 | +2.53 | +1.40 | −0.84 | +0.63 | +4.80 | +1.39 |
三处值得停步:
- 不是单调的。 AIME24 上 VHG(13.12)输给了 Vanilla GRPO(13.96)。
- 支点是 1.4 道题。 AIME26 的 +4.80 撑起整个叙事,而它样本最小、方差最大——约 30 题 × 16 采样,折算下来就是 1.4 道题的差别。论文自己声明该表 "rather than a statistical-significance claim"。
- 一个非数学基准都没测。 种子来自 MATH/GSM8K,生成同域,评测也同域。而 R-Zero 原文反而报告了跨域迁移(MMLU-Pro / SuperGPQA +3.81)。加一组外域基准在算力上几乎免费,这是全文最便宜的缺失。
还要给作者说句公道话:R-Zero 并没有被弱化。 在 VHG 的评测框架下,R-Zero 首轮增益 +8.82,反而大于它自己论文里的 +6.49。真正的问题是积分设定对它结构性不公——R-Zero 靠多数投票造伪标签,而不定积分的等价答案形式千差万别(sin²x/2 与 −cos2x/4 是一回事),多数投票在这儿几乎必然失效。论文却据此推出「硬验证器的重要性」,是从一场不匹配的比试里下了过强的结论。
六、验证器的取舍曲线:没有免费午餐
把 VHG 放进谱系,最有用的一根坐标轴是「它拿什么当验证器」。这条线不是越来越准,而是一次单调取舍:
| 阶段 | 覆盖域 | 决定性 | 致命漏洞 |
|---|---|---|---|
| ① 人类真值 | 中 | 极高 | 贵、慢、把天花板钉在人身上 |
| ② 答案一致性 | 大 | 低 | 自洽 ≠ 正确,同一个错思路会稳定给出同一个错答案 |
| ③ 共识伪标签 | 大 | 低 | 越难越不可靠——恰好在最需要监督处失效 |
| ④ 代码执行器 | 窄 | 极高 | 只覆盖能写成程序的推理 |
| ⑤ 符号引擎 | 极窄 | 极高 | 只对有封闭形式可机械校验的成立 |
| ⑥ LLM judge | 最大 | 低 | judge 本身就是一个可被 game 的代理奖励 |
一句话:覆盖域单调上升,决定性单调下降。
【推论】VHG 的方法论贡献,是不再在单一验证器上做取舍,而是把验证器升级为奖励函数中的一阶门控。它的结构性弱点也随之而来:在通用数学上,这道门的硬度取决于 GPT-5.4 的硬度。它把门做对了,但没有证明门本身是钢筋的。
七、最锋利的一刀:这算自演化,还是蒸馏?
这一问来自 ICML 2026 的一篇 Position Paper(arXiv:2603.02218),它给了个直接命中 VHG 的判据:
【直引】"Using a stronger LLM to propose and verify to train a weaker LLM constitutes distillation rather than self-evolution."
VHG 的 verifier 是 GPT-5.4(外部强模型),solver 是 Qwen3-4B。按这个判据,软验证器分支本质上是一条带有效性门控的蒸馏管线。更要命的是它没闭合回路:GPT-5.4 永不被更新,4B 的提升不会回流到 verifier。
这恰好解释了一个未被论文讨论的红旗——挑战集 Pass@1 在 8B → 14B → 32B 上非单调(通用数学 34.50 → 41.50 → 41.31,32B 反而更低)。如果题真在测量能力,32B 该高于 14B。更可能的解释是:裁判的判别力已经跟不上题目的复杂度了。
作者的合理反驳:这一问只在软分支成立。硬分支的验证器是 SymPy——一个不会退化、也不需要「跟上」的形式系统。
八、搬走这条原则
抽象出来,VHG 给的是一条能脱离数学的方法论:
当你在用代理指标优化真目标时,必须在代理指标生效之前,加一道独立于被优化者的有效性闸门。
最值得展开的是推荐系统。 这里有一处与 VHG 完全同构的错误:
| VHG | 推荐系统负样本 |
|---|---|
| 观测量 = 解题者做不出 | 观测量 = 用户没点 |
| 期望解释 = 题难 | 期望解释 = 用户不喜欢 |
| 被忽略的第二因 = 题本身无效 | 被忽略的第二因 = 曝光层已替他筛过 / 用户压根没看见 |
| 修补 = 独立 verifier 先判有效性 | 修补 = 独立的曝光判定 + 无偏随机探索 |
「曝光未点击 ≠ 不喜欢」与「解题者做不出 ≠ 题难」,是同一个 Berkson 式选择偏差的两种皮。
Facebook EBR(KDD'20)的实测给这个判断加了码:用曝光未点击作负样本 vs 随机负样本,召回 absolute 55% regression。而最佳配方是 hard 取精排 rank 101–500(semi-hard,不要最 hard)、easy:hard = 100:1、每正样本最多 2 个 hard——排在最 top 的负样本已被前一层策略严重筛选过,信息含量反而最低。这与 VHG 保留通过率 ∈ [0.1, 0.9] 而非取 0,异曲同工。
量化交易同理:代理是回测夏普,第二因是多重检验 / 前视 / 幸存者 / 成本忽略。硬验证器就是 DSR、PBO、purge + embargo、HLZ 的 t > 3.0。先判定「这条策略是否成立」,再计夏普。
九、钉子
- 会做题是走迷宫,会出题是造迷宫。造迷宫的人,必须先保证出口真的存在。
- 当一项指标成为目标,它就不再是好指标——除非你在它前面加一道闸门。
- 验证器的价值,不在于它拦住了多少坏题,而在于它改变了出题者学习的次序。
- 难题该通过「选择它的奖励预言机」来研究,而不只是通过提出它的生成器。
【判断】VHG 证明了「验证器优先」在可验证领域的正确性;在不可验证领域,它的证据只能算一个有希望的原型。论文的 Abstract 把两者打包成了同一个声明——这是它最该被要求收敛的地方。
最后一条坏消息:回到 Skalse et al. (2022) 的形式结果——在有限策略集之外,非平凡的 proxy 永远 hackable。所以目标不是根除 hacking,而是提高被 hack 的成本,并让 hack 可被监测。
附:完整深度研究报告(含 8 章、全部实验表格、5 张概念卡)已整理为单文件 HTML,可与本文对照阅读。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。