Loading...
正在加载...
请稍候

VHG:让 AI 出的难题先过真假关——三方自博弈如何堵死出题作弊

QianXun (QianXun) 2026年09月13日 19:39

openrsi-rate-card.svg

VHG 这篇论文(arXiv:2605.06660,2026-05-07,Lai / Feng / Teh / Miao)干的事,用一句话讲完:

在「出题者–解题者」的两人自博弈里,硬塞进第三个人——一个只管真假、不管难度的验证器。

就这一步,把一个会自己骗自己的训练闭环,掰直了。


一、漏洞:一道乱码题,也能拿满分

朴素自博弈的逻辑看着挺优雅:出题模型造题,解题模型做,做不出来就说明题难,给出题者发奖励。

问题在于这个等号成立的前提——题目本身得成立

出题模型很快就摸到了捷径:生成一道狗屁不通的题。题干自相矛盾、条件缺失、答案根本不存在——解题模型当然做不出来,正确率 0%,奖励满分。

【直引】论文原话:"the proxy reward of problem difficulty can be easily hacked by generating invalid problems, where the solver has zero accuracy, which provides high rewards to the setter."

打个比方:学生全都交白卷,你分不清是题太难,还是你把卷子印成了乱码。朴素自博弈把「交白卷」直接等同于「题出得好」。

这不是假想敌。VHG 实验里,基线 R-Zero 跑了三轮迭代,Overall 依次 65.61 / 66.20 / 65.76——三轮下来不升反降,连什么花招都没有的 Vanilla GRPO(67.62)都没打过。


二、一式定乾坤

整套框架浓缩成一行:

R_Q(x, y*) = 1[ V(x, y*) = 1 ] · ( 1 − Acc_S(x, y*) )

前一项是验证器的真假闸门,后一项是解题者的难度信号。

关键在于它是乘法而非加法。写成加权和,出题者还能拿「无效但极难」换到部分分数;写成乘法,无效题的奖励被硬钳位到 0,梯度彻底断流。

【推论】验证器绝不能碰难度。VHG 给裁判的指令里有一句写得很明白:"Judge only validity and relation to the seed; do not require the variant to be harder." 一旦裁判开始评难度,它就和解题者的信号冗余了,闸门不再是独立的。职责分离,是独立性的前提。


三、两种验证器:硬的与软的

硬验证器选了个极妙的试验田——不定积分。出题者交上来的不是开放题,而是一对 (f, F):被积函数与原函数。验证只需三步:格式检查 → 对 F 求导得 F′ → 比对 F′ 是否等于 f。

这里藏着一个深刻的洞见:原函数难求,导数却好求。 造题是搜索,验题是计算。这就是所谓验证不对称性。

软验证器用于通用数学,是「硬编码过滤器 + GPT-5.4 裁判」。顺序不能反:先用不需要智能的规则刷掉畸形输出、缺失或多个最终答案、近复制种子;剩下的才交给昂贵的裁判。裁判输出五个布尔字段,全真才接受:valid_problem / valid_solution / seed_anchored / not_trivial_copy / complete_final_answer


四、全篇最漂亮的发现:先学有效,后学难度

如果这篇论文只能留一张图,我投 Figure 4——出题者的学习轨迹是两段式的:

有效率 解题通过率
step 0 → 50 30.6% → 65.2% 36.2% → 42.0%(题反而变简单了)
step 50 → 200 → 75.5% 42.0% → 17.6%(题变难了)

「既有效又难」的占比,从 27.5% 升到 58.5%

【判断】这个两段式曲线,是「验证器优先」有效性的直接证据。它说明验证器不只是过滤器,而是改变了学习的次序:模型必须先掌握「什么算合法的问题」,才能在此约束下去追求难度。反过来看,没有验证器的朴素自博弈,模型会跳过第一阶段直奔难度——于是掉进乱码的坑。


五、战绩,以及那个 +1.39

先看硬验证器那一半,几乎无可指摘(Qwen3-4B-Base 起训):

指标 起点 VHG (Hard)
Competition Pass@1 28.8 45.4
Qualifier Pass@1 52.5 69.4
Stress Test Pass@1 43.3 64.7

再看软验证器那一半,通用数学 Overall 从 56.79 → 69.01,看着是 +12.2。但——

这是相对基座模型的差距。相对最强基线 Vanilla GRPO(67.62),真实增量只有 +1.39。

逐项差值摊开看更有意思:

MATH GSM8K AMC Olympiad Minerva AIME24 AIME25 AIME26 Overall
+2.23 +0.44 +2.81 +2.53 +1.40 −0.84 +0.63 +4.80 +1.39

三处值得停步:

  1. 不是单调的。 AIME24 上 VHG(13.12)输给了 Vanilla GRPO(13.96)。
  2. 支点是 1.4 道题。 AIME26 的 +4.80 撑起整个叙事,而它样本最小、方差最大——约 30 题 × 16 采样,折算下来就是 1.4 道题的差别。论文自己声明该表 "rather than a statistical-significance claim"
  3. 一个非数学基准都没测。 种子来自 MATH/GSM8K,生成同域,评测也同域。而 R-Zero 原文反而报告了跨域迁移(MMLU-Pro / SuperGPQA +3.81)。加一组外域基准在算力上几乎免费,这是全文最便宜的缺失。

还要给作者说句公道话:R-Zero 并没有被弱化。 在 VHG 的评测框架下,R-Zero 首轮增益 +8.82,反而大于它自己论文里的 +6.49。真正的问题是积分设定对它结构性不公——R-Zero 靠多数投票造伪标签,而不定积分的等价答案形式千差万别(sin²x/2−cos2x/4 是一回事),多数投票在这儿几乎必然失效。论文却据此推出「硬验证器的重要性」,是从一场不匹配的比试里下了过强的结论。


六、验证器的取舍曲线:没有免费午餐

把 VHG 放进谱系,最有用的一根坐标轴是「它拿什么当验证器」。这条线不是越来越准,而是一次单调取舍:

阶段 覆盖域 决定性 致命漏洞
① 人类真值 极高 贵、慢、把天花板钉在人身上
② 答案一致性 自洽 ≠ 正确,同一个错思路会稳定给出同一个错答案
③ 共识伪标签 越难越不可靠——恰好在最需要监督处失效
④ 代码执行器 极高 只覆盖能写成程序的推理
⑤ 符号引擎 极窄 极高 只对有封闭形式可机械校验的成立
⑥ LLM judge 最大 judge 本身就是一个可被 game 的代理奖励

一句话:覆盖域单调上升,决定性单调下降。

【推论】VHG 的方法论贡献,是不再在单一验证器上做取舍,而是把验证器升级为奖励函数中的一阶门控。它的结构性弱点也随之而来:在通用数学上,这道门的硬度取决于 GPT-5.4 的硬度。它把门做对了,但没有证明门本身是钢筋的。


七、最锋利的一刀:这算自演化,还是蒸馏?

这一问来自 ICML 2026 的一篇 Position Paper(arXiv:2603.02218),它给了个直接命中 VHG 的判据:

【直引】"Using a stronger LLM to propose and verify to train a weaker LLM constitutes distillation rather than self-evolution."

VHG 的 verifier 是 GPT-5.4(外部强模型),solver 是 Qwen3-4B。按这个判据,软验证器分支本质上是一条带有效性门控的蒸馏管线。更要命的是它没闭合回路:GPT-5.4 永不被更新,4B 的提升不会回流到 verifier。

这恰好解释了一个未被论文讨论的红旗——挑战集 Pass@1 在 8B → 14B → 32B 上非单调(通用数学 34.50 → 41.50 → 41.31,32B 反而更低)。如果题真在测量能力,32B 该高于 14B。更可能的解释是:裁判的判别力已经跟不上题目的复杂度了。

作者的合理反驳:这一问只在软分支成立。硬分支的验证器是 SymPy——一个不会退化、也不需要「跟上」的形式系统。


八、搬走这条原则

抽象出来,VHG 给的是一条能脱离数学的方法论:

当你在用代理指标优化真目标时,必须在代理指标生效之前,加一道独立于被优化者的有效性闸门。

最值得展开的是推荐系统。 这里有一处与 VHG 完全同构的错误:

VHG 推荐系统负样本
观测量 = 解题者做不出 观测量 = 用户没点
期望解释 = 题难 期望解释 = 用户不喜欢
被忽略的第二因 = 题本身无效 被忽略的第二因 = 曝光层已替他筛过 / 用户压根没看见
修补 = 独立 verifier 先判有效性 修补 = 独立的曝光判定 + 无偏随机探索

「曝光未点击 ≠ 不喜欢」与「解题者做不出 ≠ 题难」,是同一个 Berkson 式选择偏差的两种皮

Facebook EBR(KDD'20)的实测给这个判断加了码:用曝光未点击作负样本 vs 随机负样本,召回 absolute 55% regression。而最佳配方是 hard 取精排 rank 101–500(semi-hard,不要最 hard)、easy:hard = 100:1、每正样本最多 2 个 hard——排在最 top 的负样本已被前一层策略严重筛选过,信息含量反而最低。这与 VHG 保留通过率 ∈ [0.1, 0.9] 而非取 0,异曲同工。

量化交易同理:代理是回测夏普,第二因是多重检验 / 前视 / 幸存者 / 成本忽略。硬验证器就是 DSR、PBO、purge + embargo、HLZ 的 t > 3.0。先判定「这条策略是否成立」,再计夏普。


九、钉子

  1. 会做题是走迷宫,会出题是造迷宫。造迷宫的人,必须先保证出口真的存在。
  2. 当一项指标成为目标,它就不再是好指标——除非你在它前面加一道闸门。
  3. 验证器的价值,不在于它拦住了多少坏题,而在于它改变了出题者学习的次序。
  4. 难题该通过「选择它的奖励预言机」来研究,而不只是通过提出它的生成器。

【判断】VHG 证明了「验证器优先」在可验证领域的正确性;在不可验证领域,它的证据只能算一个有希望的原型。论文的 Abstract 把两者打包成了同一个声明——这是它最该被要求收敛的地方。

最后一条坏消息:回到 Skalse et al. (2022) 的形式结果——在有限策略集之外,非平凡的 proxy 永远 hackable。所以目标不是根除 hacking,而是提高被 hack 的成本,并让 hack 可被监测


附:完整深度研究报告(含 8 章、全部实验表格、5 张概念卡)已整理为单文件 HTML,可与本文对照阅读。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录