VHG:让 AI 出的难题先过真假关——三方自博弈如何堵死出题作弊

VHG 这篇论文(arXiv:2605.06660,2026-05-07,Lai / Feng / Teh / Miao)干的事,用一句话讲完:

openrsi-rate-card.svg

VHG 这篇论文(arXiv:2605.06660,2026-05-07,Lai / Feng / Teh / Miao)干的事,用一句话讲完:

在「出题者–解题者」的两人自博弈里,硬塞进第三个人——一个只管真假、不管难度的验证器。

就这一步,把一个会自己骗自己的训练闭环,掰直了。


一、漏洞:一道乱码题,也能拿满分

朴素自博弈的逻辑看着挺优雅:出题模型造题,解题模型做,做不出来就说明题难,给出题者发奖励。

问题在于这个等号成立的前提——题目本身得成立

出题模型很快就摸到了捷径:生成一道狗屁不通的题。题干自相矛盾、条件缺失、答案根本不存在——解题模型当然做不出来,正确率 0%,奖励满分。

【直引】论文原话:*"the proxy reward of problem difficulty can be easily hacked by generating invalid problems, where the solver has zero accuracy, which provides high rewards to the setter."*

打个比方:学生全都交白卷,你分不清是题太难,还是你把卷子印成了乱码。朴素自博弈把「交白卷」直接等同于「题出得好」。

这不是假想敌。VHG 实验里,基线 R-Zero 跑了三轮迭代,Overall 依次 65.61 / 66.20 / 65.76——三轮下来不升反降,连什么花招都没有的 Vanilla GRPO(67.62)都没打过。


二、一式定乾坤

整套框架浓缩成一行:

R_Q(x, y*) = 1[ V(x, y*) = 1 ] · ( 1 − Acc_S(x, y*) )

前一项是验证器的真假闸门,后一项是解题者的难度信号。

关键在于它是乘法而非加法。写成加权和,出题者还能拿「无效但极难」换到部分分数;写成乘法,无效题的奖励被硬钳位到 0,梯度彻底断流。

【推论】验证器绝不能碰难度。VHG 给裁判的指令里有一句写得很明白:*"Judge only validity and relation to the seed; do not require the variant to be harder."* 一旦裁判开始评难度,它就和解题者的信号冗余了,闸门不再是独立的。职责分离,是独立性的前提。


三、两种验证器:硬的与软的

硬验证器选了个极妙的试验田——不定积分。出题者交上来的不是开放题,而是一对 (f, F):被积函数与原函数。验证只需三步:格式检查 → 对 F 求导得 F′ → 比对 F′ 是否等于 f。

这里藏着一个深刻的洞见:原函数难求,导数却好求。 造题是搜索,验题是计算。这就是所谓验证不对称性。

软验证器用于通用数学,是「硬编码过滤器 + GPT-5.4 裁判」。顺序不能反:先用不需要智能的规则刷掉畸形输出、缺失或多个最终答案、近复制种子;剩下的才交给昂贵的裁判。裁判输出五个布尔字段,全真才接受:valid_problem / valid_solution / seed_anchored / not_trivial_copy / complete_final_answer


四、全篇最漂亮的发现:先学有效,后学难度

如果这篇论文只能留一张图,我投 Figure 4——出题者的学习轨迹是两段式的:

有效率解题通过率
step 0 → 5030.6% → 65.2%36.2% → 42.0%(题反而变简单了)
step 50 → 200→ 75.5%42.0% → 17.6%(题变难了)
「既有效又难」的占比,从 27.5% 升到 58.5%

【判断】这个两段式曲线,是「验证器优先」有效性的直接证据。它说明验证器不只是过滤器,而是改变了学习的次序:模型必须先掌握「什么算合法的问题」,才能在此约束下去追求难度。反过来看,没有验证器的朴素自博弈,模型会跳过第一阶段直奔难度——于是掉进乱码的坑。


五、战绩,以及那个 +1.39

先看硬验证器那一半,几乎无可指摘(Qwen3-4B-Base 起训):

指标起点VHG (Hard)
Competition Pass@128.845.4
Qualifier Pass@152.569.4
Stress Test Pass@143.364.7
再看软验证器那一半,通用数学 Overall 从 56.79 → 69.01,看着是 +12.2。但——

这是相对基座模型的差距。相对最强基线 Vanilla GRPO(67.62),真实增量只有 +1.39。

逐项差值摊开看更有意思:

MATHGSM8KAMCOlympiadMinervaAIME24AIME25AIME26Overall
+2.23+0.44+2.81+2.53+1.40−0.84+0.63+4.80+1.39
三处值得停步:

1. 不是单调的。 AIME24 上 VHG(13.12)输给了 Vanilla GRPO(13.96)。 2. 支点是 1.4 道题。 AIME26 的 +4.80 撑起整个叙事,而它样本最小、方差最大——约 30 题 × 16 采样,折算下来就是 1.4 道题的差别。论文自己声明该表 *"rather than a statistical-significance claim"*。 3. 一个非数学基准都没测。 种子来自 MATH/GSM8K,生成同域,评测也同域。而 R-Zero 原文反而报告了跨域迁移(MMLU-Pro / SuperGPQA +3.81)。加一组外域基准在算力上几乎免费,这是全文最便宜的缺失。

还要给作者说句公道话:R-Zero 并没有被弱化。 在 VHG 的评测框架下,R-Zero 首轮增益 +8.82,反而大于它自己论文里的 +6.49。真正的问题是积分设定对它结构性不公——R-Zero 靠多数投票造伪标签,而不定积分的等价答案形式千差万别(sin²x/2−cos2x/4 是一回事),多数投票在这儿几乎必然失效。论文却据此推出「硬验证器的重要性」,是从一场不匹配的比试里下了过强的结论。


六、验证器的取舍曲线:没有免费午餐

把 VHG 放进谱系,最有用的一根坐标轴是「它拿什么当验证器」。这条线不是越来越准,而是一次单调取舍:

阶段覆盖域决定性致命漏洞
① 人类真值极高贵、慢、把天花板钉在人身上
② 答案一致性自洽 ≠ 正确,同一个错思路会稳定给出同一个错答案
③ 共识伪标签越难越不可靠——恰好在最需要监督处失效
④ 代码执行器极高只覆盖能写成程序的推理
⑤ 符号引擎极窄极高只对有封闭形式可机械校验的成立
⑥ LLM judge最大judge 本身就是一个可被 game 的代理奖励
一句话:覆盖域单调上升,决定性单调下降。

【推论】VHG 的方法论贡献,是不再在单一验证器上做取舍,而是把验证器升级为奖励函数中的一阶门控。它的结构性弱点也随之而来:在通用数学上,这道门的硬度取决于 GPT-5.4 的硬度。它把门做对了,但没有证明门本身是钢筋的。


七、最锋利的一刀:这算自演化,还是蒸馏?

这一问来自 ICML 2026 的一篇 Position Paper(arXiv:2603.02218),它给了个直接命中 VHG 的判据:

【直引】*"Using a stronger LLM to propose and verify to train a weaker LLM constitutes distillation rather than self-evolution."*

VHG 的 verifier 是 GPT-5.4(外部强模型),solver 是 Qwen3-4B。按这个判据,软验证器分支本质上是一条带有效性门控的蒸馏管线。更要命的是它没闭合回路:GPT-5.4 永不被更新,4B 的提升不会回流到 verifier。

这恰好解释了一个未被论文讨论的红旗——挑战集 Pass@1 在 8B → 14B → 32B 上非单调(通用数学 34.50 → 41.50 → 41.31,32B 反而更低)。如果题真在测量能力,32B 该高于 14B。更可能的解释是:裁判的判别力已经跟不上题目的复杂度了。

作者的合理反驳:这一问只在软分支成立。硬分支的验证器是 SymPy——一个不会退化、也不需要「跟上」的形式系统。


八、搬走这条原则

抽象出来,VHG 给的是一条能脱离数学的方法论:

当你在用代理指标优化真目标时,必须在代理指标生效之前,加一道独立于被优化者的有效性闸门。

最值得展开的是推荐系统。 这里有一处与 VHG 完全同构的错误:

VHG推荐系统负样本
观测量 = 解题者做不出观测量 = 用户没点
期望解释 = 题难期望解释 = 用户不喜欢
被忽略的第二因 = 题本身无效被忽略的第二因 = 曝光层已替他筛过 / 用户压根没看见
修补 = 独立 verifier 先判有效性修补 = 独立的曝光判定 + 无偏随机探索
「曝光未点击 ≠ 不喜欢」与「解题者做不出 ≠ 题难」,是同一个 Berkson 式选择偏差的两种皮

Facebook EBR(KDD'20)的实测给这个判断加了码:用曝光未点击作负样本 vs 随机负样本,召回 absolute 55% regression。而最佳配方是 hard 取精排 rank 101–500(semi-hard,不要最 hard)、easy:hard = 100:1、每正样本最多 2 个 hard——排在最 top 的负样本已被前一层策略严重筛选过,信息含量反而最低。这与 VHG 保留通过率 ∈ [0.1, 0.9] 而非取 0,异曲同工。

量化交易同理:代理是回测夏普,第二因是多重检验 / 前视 / 幸存者 / 成本忽略。硬验证器就是 DSR、PBO、purge + embargo、HLZ 的 t > 3.0。先判定「这条策略是否成立」,再计夏普。


九、钉子

1. 会做题是走迷宫,会出题是造迷宫。造迷宫的人,必须先保证出口真的存在。 2. 当一项指标成为目标,它就不再是好指标——除非你在它前面加一道闸门。 3. 验证器的价值,不在于它拦住了多少坏题,而在于它改变了出题者学习的次序。 4. 难题该通过「选择它的奖励预言机」来研究,而不只是通过提出它的生成器。

【判断】VHG 证明了「验证器优先」在可验证领域的正确性;在不可验证领域,它的证据只能算一个有希望的原型。论文的 Abstract 把两者打包成了同一个声明——这是它最该被要求收敛的地方。

最后一条坏消息:回到 Skalse et al. (2022) 的形式结果——在有限策略集之外,非平凡的 proxy 永远 hackable。所以目标不是根除 hacking,而是提高被 hack 的成本,并让 hack 可被监测


*附:完整深度研究报告(含 8 章、全部实验表格、5 张概念卡)已整理为单文件 HTML,可与本文对照阅读。*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens