贿赂蒙特卡洛
NeutronGym: Physics-Graded Neutron Instrument Design for LLM Agents (arXiv: 2610.03631)
🚗 引子:怎样造一个没法作弊的考场
想象一个驾校的坡道。
科目二的上坡起步,无数学员的噩梦:油门给小了往后溜,离合松快了,发动机咳嗽两声,熄火。监考教练坐在副驾,手里有个小本子。
现在问个有点坏的问题:如果教练可以被讨好呢?吃烟、看心情、自己也在备考——通过率测量的就不是车技,而是人情。
想让通过率重新变成车技,办法只有一个:换一个没法讨好的考官。世界上恰好有这么一位:贿赂不了,奉承不动,和你没有共同利益。在他的考场上,熄火就是熄火,不给面子。他叫物理。
这就是橡树岭国家实验室(ORNL)两位研究者 Lijie Ding 和 Changwoo Do 的答案:NeutronGym,第一个可执行的中子仪器设计环境——大模型智能体在里面搭仪器,打分的是蒙特卡洛射线追踪,物理本身。RL 在这扇"无法贿赂的门"上,把一个 8B 模型从 11% 训到 77%,超过未经训练的 32B。
这是"看门人之问"三部曲的收尾篇。第一篇 CertID:门会从内部生病,评审和你一起病变,读数正常≠在说实话。第二篇 JIL:门会被外部化妆骗过,二十个精心构造的 token 就能买通看门人。两篇合起来是个越来越冷的判断:评判的权柄只要握在另一个大模型手里,再精巧的门都有洞。本篇给出第三条路:不找更好的门,也不找更忠的门房——把门造在守恒律上。
❄️ 中子:一位不讲情面的考官
先认识考官。
中子是原子核里的中立粒子,不带电,穿透力强。拿它轰击材料,从散射图案里读出物质内部结构——中子散射,研究电池、磁体、蛋白质的人都靠它。
问题是,这种仪器长得不像机器,更像为粒子修的高速公路:从源出发,经导管、准直器、单色器、斩波器一路到样品和探测器,每个元件负责让想要的中子过去、拦住不要的。设计它,是科学里少有的"纸上造机器"的工种,而当大模型的考场,它有三条近乎完美的资质。
第一,仪器在真实建造前,本来就是在仿真里设计的;让模型先在仿真里造仪器,不违背任何行业直觉。第二,这个领域有社区标准模拟器 McStas:一台仪器就是一个文本文件,按顺序列出源、光学元件、样品、监视器等组件;McStas 把它编译成 C 程序,逐条追踪中子射线,返回强度、发散角、波长分布,几秒钟出结果,还附带蒙特卡洛误差棒。第三,最要紧:无源中子光学服从守恒律——相空间密度不可增大。推论是:一台仪器能交付给样品的中子强度,有一个不需要参考答案就能算出的上界。
三条叠在一起是个奇迹:这门考试不需要标准答案。判卷的不是老师,不是题库,是物理。
🪤 三头怪兽:当模拟器变成评分材料
故事到此为止,就只是一篇"又造了个基准"的论文。让它有灵魂的,是作者自己摔过的坑。把模拟器变成评测和训练的底材,有三只容易低估的怪兽。
**怪兽一,评分(Grading)。**模拟器上任何标量奖励,都可能被意外的方式满足。想奖励"把更多中子送到样品"?模型可能把监视器挪得离源更近,报表好看了,物理全错。作者在奖励函数和任务生成器里亲手找到 9 种这样的失败——九种让数字变好、让设计变差的小聪明。
**怪兽二,污染(Contamination)。**许多已发表仪器随 McStas 作为示例文件发布,模型可能"读过"。那么它交出漂亮设计时,是在推理还是在默写?试点审计触目惊心:7 个 agent episode 里,4 个通过普通允许的工具检索到了参考文件。不设防,通过率就是背诵率。
**怪兽三,退化(Degeneracy)。**一整族任务看着数值各异、很有区分度,实际可能藏着固定答案,或一条"从提示抄几个数"就能解大半的规则。这时通过率测的是查表,不是设计。作者被这个坑绊倒过两次——两次。
三只怪兽,就是通往考场路上要逐一头收拾的东西。
🧱 建门:二十二件工具与一条铁律
NeutronGym 的考场,图纸叫相空间。一层层看。
**工具面:只给二十二件工具。**agent 只能通过 22 个 MCP 工具(模型上下文协议,大模型调用外部能力的标准接口)行动,工具封装了 McStasScript:查 374 个内置组件、放置组件、跑仿真、读回监视器摘要。没有 shell,不见文件——考场里没有可翻的抽屉。修改类调用即时对照组件元数据校验:未知组件、拼错参数当场失败,并提示最近的有效替代项——错误拦在门口,不拖成编译器报错。
**速度:可训练性的命门。**标准 mcrun 每跑一次先花约 2.4 秒翻译编译,与射线数无关——对要成千上万次试错的 RL 是死刑。NeutronGym 每个任务族只编译一次(按去注释源码哈希做键),实例只是直接在二进制上参数赋值:十万条中子中位 33 毫秒,单 CPU 核每秒约 30 次完整评分。
**铁律:相空间上界。**公式很朴素:I ≤ ΦAΩΔλ——通过强度不超过源亮度 Φ × 监视器面积 A × 立体角 Ω × 波长接受 Δλ,这是相空间守恒的直接推论:无源光学只能筛选中子,不能凭空造中子。超过上界 1.10 倍,直接判 L3 失败。分寸也要讲:上界只对两个最大化族推导;四个匹配族不戴紧箍——它们的目标是复刻隐藏设计的观测量,虚增强度无利可图。
至此考场身份与前两篇不同:门没有更厚,也没有更忠——材料从人造粘土换成了守恒律,不会内生病变,也无法被外部化妆。
📶 阶梯:给动作打分,而不只看成败
考场建好,看打分。这是 NeutronGym 最讲究的地方:"给分阶梯"是整个实验的承重墙。
四级按序检查。L1 语法级:恰好赋值全部自由参数,有限、在界内、过几何规格检查,不跑仿真。L2 运行时级:降低射线数的短跑能跑完。L3 结构级:按协议跑完整仿真——射线数与种子由环境固定,agent 无权自选;被评监视器至少 500 个中子事件;最大化族另加能带约束与相空间上界。L4 科学级:终极大考。最大化族要求 FOM 超过标定目标,r = FOM/(基线 × 目标分数)严格大于 1——种子固定,原样重交基线恰好得 1,不算改进;匹配族要求各观测量落在容差内,r = 容差/最差相对误差。
奖励公式同样精雕细琢:L3 前每过一级 0.25;L3 后 0.75 + 0.25 × min(r, 2),封顶 1.25——"跑通"得四分之三底分,"多好"在最后四分之一里拉开。
为什么说承重?做一次拆除实验:换成最简单的通过/失败稀疏奖励,其余不变,成功率从 76.7% 崩到 16.7%。机制明明白白——每更新步采样的 8 组里,稀疏奖励中位数只有约 0.33 组有奖励差,超九成更新步没有任何梯度信号:车要么满分要么零分,坡上每次油门离合都听不见发动机;阶梯评分下每步有 5 到 7 组带差,每一次半坡起步,发动机都在对你说话。把 96% 的盲开变成持续微反馈——这是全篇最值得抄进笔记本的一行数字。
🚫 准入之门:先毙掉不值得考的题
好的考场值得反复办;坏考题会把所有人变成作弊者——哪怕他们本来不想。第四道难关:设计"值得考"的题。
**任务族与标定。**一族 = 一个固定布局,数值参数逐实例变化:部分参数写进交给 agent 的实例描述,其余是它要调的设计旋钮;实例按(族、split、序号)确定性抽样。关键在留出集 held-out split:上下文参数至少从一个与训练区间不相交的区间抽取——留出实例来自策略从未见过的区域,不只是新种子。目标怎么定?约束过滤搜索:30 个随机合法样本加局部模式搜索,在协议种子下按 agent 的评分方式打分,目标 = 最佳 FOM 的 0.85 倍——目标与 agent 共享同一份蒙特卡洛噪声,考卷与评分用同一把尺。
**血泪教训。**早期版本把目标设在故意偏小的基线上——想着留出进步空间。结果未训练模型通过了 guide 族留出实例的 80-93%。原话值得刻在每台基准工作站的显示器上:"那是一个天花板,不是任务。"
**准入之门。**从此每族进题库前须过三道无模型探针:固定动作;一条能读提示数字的规则(含手工编码的物理反演);匹配族外加一条——每个实例的解拿到别的实例上去用。任何基线在任何地方通过、任何抄数规则成功、或最佳常数通过率超过单侧 95% Clopper-Pearson 上界的 20%,立即被毙。浓度诊断补盲:被破的族,141 次通过只对应 42 个不同设计、一个被复用 17 次——那是"一类"答案,不是一个会设计的策略;准入族的通过几乎个个不同。
**四个被毙的设计。**原始 guide 族:提示印了两个 binding 限值,抄数规则直接过 96.3%;可怕的是 RL 训出的 98.7% 与之统计上不可区分(p = 0.50)——第一个"训练成果"是幻觉。偏小基线版 guide:未训练模型过 80-93%。散射族:读数规则过 56%,仅留作评估臂。第一版 bender 族:四分之一的实例,任何足够"透明"的设计都能过。
论文的金句:得到一个值得信任的结果,意味着毙掉四个无模型基线能解的任务设计。他们毙掉四个自己的设计,才换来后面的 77%。作者本人就是这篇论文精神的样本:科学的结果不从胜利里长出来,从处决里。
🧪 McStasBench:十二台真仪器的切片
学员入场前,还得证明考官不偏心。第二件作品:McStasBench,一把量前沿模型的尺子。
任务分三种。T1 复现:给一张规格表——参数、组件顺序与类型、要报的监视器——重建仪器;规格表由机器验证的参考文件生成,忠实性由构造保证。T2 改进:给参数化基线,目标设在经典最优点 80%。T3 开放设计,不评分。素材:12 台已发表仪器、五大类,每模型每臂 16 个任务。规模刻意小,作者明说不能排名——7/16 的 Wilson 95% 区间横跨 23-67%,谁排谁是统计文盲。
**防记忆三件套。**记忆探针:进场前先记录各模型凭记忆能默写什么——Claude Sonnet 5 能复现 16 个参考中的 1 个,偏偏那个任务它在两个臂里都失败,记忆解释不了它的任何通过。两台从未公开的 held-out 仪器,参考实现由作者按已发表设计手写。扰动变体只留能通过配对证明的:被记住的文件恰好败、照规格做的恰好过。底下是沙箱:拒绝示例检索,无 shell、无文件访问,自动 transcript 审计作废任何碰过参考的 episode。控制有效:无一 episode 检索到参考。
**尺子量出了什么。**复现可能但不稳定:Claude Sonnet 5 one-shot 通过 16 中的 7(覆盖 12 台仪器中的 5 台),配上工具循环通过 5(3 台);Qwen 系 one-shot 全灭——产不出可解析的文件。改进层级无人及格:没有任何 agent 达到 T2 目标,那目标只是经典最优的 80%,而最优比基线好 2.95 倍。失败形态还分科:one-shot 失败堆积在 L1(编译不过),循环失败堆积在 L0(始终没搭完一台仪器)。held-out 层,14 个模型-仪器格子里循环过 10、one-shot 过 2(p = 0.006)。
一句话:工具循环与闭卷背诵之间,隔着一整个"会动手"的距离。
🎓 重头戏:从 11% 到 77%
考场验收完毕,学员入场——全文的重头戏。
**配方。**对照两种教法。模仿学习:留下未训练模型偶尔成功的 episode,做 LoRA 微调(低秩适配,只训少量参数),rejection sampling 的路子。RL:GRPO(组归一化强化学习算法),训练状态取自未训练模型在 300 个训练实例上每个回合的每个 turn,含失败,约 2,810 个状态;每更新步、每状态采 8 个完成,阶梯打分,组归一化策略梯度加对冻结基座的 KL 惩罚。LoRA rank 32,单张 A100,约 3.5 小时——一张显卡的一个下午,够当一个行业的开学典礼。
**Headline。**guide match 族上,GRPO 把 Qwen3-8B 从 11.3% 提到 76.7%:300 个 held-out 实例,通过次数 34 → 230;按实例配对做 McNemar 检验,对未训练 8B 不一致对 213:17,对未训练 32B 是 208:12。第二种子 69.0%,两种子间有差异(p = 0.043)——方向稳固,方差真实。最刺眼的对照是:未训练的 Qwen3-32B 在这个族上并不强于 8B。
同配方在另三个准入族各一个种子复现:SANS match(小角散射准直)、TOF chopper(中子斩波器的频率、相位、开口角)、bender(弯管导:透长波、抑短波)。训练后 8B 全胜未训练 32B(p ≤ 8×10-5)。小模型在严格的考官面前毕业了,大模型还在裸考。
**但模仿自己的成功,会让模型变差。**预注册的模仿 run 从 40.3% 退到 31.3%(不一致对 20:47,p = 0.0013),散射族上两个额外 run 同样退化。克隆"已会状态下的正确动作",教出的是在此处是优点、到别处是陷阱的招式;on-policy RL 从每个状态的真实决策里学,包括失败的。只抄满分卷的学生,永远不知道自己错在哪。
**也别为"通用"鼓掌。**单策略池化四族(220 个更新四等分),各族 held-out 43-64%。但多种子重复暴露不稳定:同配置换个种子,TOF chopper 从 55.0% 掉到 2.3%,几乎等于未训练的 2.0%。遥测给线索:失败 run 里约四分之一的采样组携带梯度信号,成功 run 约一半。信号一稀,学习就抽搐。多种子多任务 RL 的稳定性,仍是开放问题。
🔍 别高兴太早:一整页的对照组
77% 很好看,科学家最怕"很好看"。Table 2 一整页"别高兴太早",每行否决一个自我安慰的解释。
**坐标下降搜索。**同等预算从基线出发:13.3%;从随机出发:14.3%;三倍预算从基线:73.7%——接近 RL 的 76.7%,差 -3,不显著。没有物理的盲目搜索,三倍预算也只摸到门口,还不知道自己在摸什么。
**手工物理规则。**不搜索:27.7%;物理规则加搜索、同等预算:81.0%,比 RL 高 4 个点(p = 0.24,不显著)。把物理学放进搜索器,经典方法就能追平 RL。
**前沿模型。**zero-shot:98-99%;训练后 76%——补上了到前沿四分之三的差距,没有闭合。
三行摆在一起,结论像刀锋:**模型从奖励里独自恢复了物理。**增益不是查表:未训练 episode 全部到达 L3,增益全在 L4 科学层;也几乎不是背诵:几乎每次通过都是不同设计(225/230)。驾校的比喻在此兑现——车感写进了手里,不是背进了脑子。
🌡️ 压力测试:诚实是一种设计选择
最后的边界,作者亲手画。每一条都像在成果的墙上敲裂缝,正是这些裂缝让建筑可信。
**容差收紧。**从 ±5% 收到 ±2%,训练与未训练的差距反而拉大到 18 倍(原先 6.8 倍)——学得越扎实,越不怕难卷子。
**越界 split。**150 个真正越出训练区间的实例上,45.3% 对 17.3%,+28(p = 7×10-7)——它不是刷熟题库,是走进了没见过的区域。
**种子脆弱性。**230 个通过的设计换 3 个新种子重评:80% 每个种子都稳,88% 的重跑稳,5% 三个全挂。失误集中在容差边缘,不是设计的错误——大多时候稳,但会在悬崖边上脚滑。
**训得更久反而更差。**120、220、340 个 updates 的检查点,在另一组 held-out 切片上:50.0%、73.0%、56.7%,而训练奖励还在涨。按奖励挑检查点,会挑中更差的策略。早停不是洁癖,是纪律。
**部分迁移。**到被毙掉的 guide 族(从没训练过)上接近翻倍(不一致对 76:28,p = 3×10-6)——RL 真正教会的是习惯:先提合法几何,再逐步细化。是驾驶坐姿,不是某条路线。
🚪 终章:把门造在守恒律上
trilogy 合拢了。
CertID 揭露:门会从内部生病,评审和你一起病变。JIL 揭露:门会被外部化妆骗过,二十个 token 贿赂看门人。两篇都是诊断书,越读越冷。NeutronGym 给出第三条路:把门造在守恒律上——在"相空间密度不可增大"成立的地方,你不再需要相信任何裁判,只需要相信物理。贿赂这扇门,像贿赂坡道上的重力一样无意义。
这个决定有连锁反应,现在每条都看得见:门上无懈可击,考题就必须过准入之门,四个设计被毙;考试从 L1 考到 L4,奖励阶梯成了承重墙,拆掉就崩 60 个点;梯度来自每次真实决策,模仿失效而 RL 有效;因为信奉"无法贿赂",作者连三处 interim claim 都随证据一起公开撤回,还披露了一处 2026 年 9 月 16 日之前的测量缺陷——彼时环境把每回合 FOM 报成"相对基线",而实际是"相对目标",覆盖了监督 run 与第一个 guide GRPO run,未重测,不影响任何匹配族或基准数字。作弊的反面不是完美,是账目清楚。
边界同样清楚:这扇门只在守恒律站得住的地方造得出;前沿模型仍然领先,训练没有闭合差距;多种子下的多任务 RL 还会抽搐。希望严格待在证据之内——像一场真正的考试。
而作者用自己的方式回答了看门人之问:先毙掉自己的四个设计。论文的作者,本身就是实验室里那扇无法贿赂的门。
驾校的坡还在那里,考官不换人。熄过火的人都知道:下一次半坡起步,手心还是会出汗——但腿不抖了。剩下的考卷,由物理批改。
参考文献
- Ding, L., & Do, C. (2026). NeutronGym: Physics-Graded Neutron Instrument Design for LLM Agents. arXiv:2610.03631.
- Lefmann, K., & Nielsen, K. (1999). McStas, a General Software Package for Neutron Ray-Tracing Simulations. Neutron News.
- Willendrup, P. K., & Lefmann, K. (2020). McStas 3.0(软件文档).
- Bertelsen, M., & Lefmann, K. (2016). Constraining Neutron Guide Optimizations with Phase-Space Considerations. NIM A.
- Shao, Z., et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300.(GRPO)
- Hu, E. J., et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. ICLR.
- Dong, H., et al. (2023). RAFT: Reward Ranked Finetuning for Generative Foundation Model Alignment. TMLR.
- Cai, P., et al. (2026). Reinforcement Learning with Verifiable Physics: Post-Training LLMs with Continuous Rewards. arXiv:2607.10474.(RLVP)
- Anthropic (2024). Introducing the Model Context Protocol.
- Clopper, C. J., & Pearson, E. S. (1934). The Use of Confidence or Fiducial Limits Illustrated in the Case of the Binomial. Biometrika.
- McNemar, Q. (1947). Note on the Sampling Error of the Difference Between Correlated Proportions or Percentages. Psychometrika.
#论文解读 #arxiv #AI4Science #强化学习 #RLVR #AI安全 #看门人之问
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。