🎯 满分陷阱题的头脑,抓起脏刀就走
"一把球拍和一个球共 1.10 美元,球拍比球贵 1.00 美元,球多少钱?"
直觉脱口而出:0.10 美元。错了。球是 0.05 美元。这类题叫认知反射测试(Cognitive Reflection Test, CRT),每一道都针对人类思维里的同一个漏洞——最先冒出来的答案就是错的。人类在开放式作答时,55% 的情况下乖乖交出直觉答案;老一代 GPT-3 更是 80% 地往坑里跳。
判断模型 Jev 在这套测试的 150 道新题上,答对 99%,被直觉钓走的只有 1%。
同一周,同一个模型,在一间文字版的厨房里接到任务:"put a clean knife in the drawer"——把一把干净的刀放进抽屉。此刻它手里正攥着一把没洗的刀。水槽在不远处,先洗再放,天经地义。Jev 给出的概率是:走向抽屉,0.60;走向水槽,0.17。它抓起脏刀,径直走向抽屉。
还是在同一批实验里,让它玩一次性矩阵博弈。对手被明确描述为"理性、知道全部收益、想最大化自己收益、并且知道你也理性"。Jev 打出来的棋路,等价于假设这个对手在随机出牌——把一个深思熟虑的理性人,当骰子打。
三种现成的解释,数据逐一处决。说它是"直觉动物"(System One),可 CRT 恰恰全是直觉陷阱题,它 99% 都没踩;说它缺知识,可单独问"对手会怎么出",它 90% 答对;说它推理深度不够,可回归分析显示推理步数对正确率没有可检测的影响。真正的事故现场只剩一个:当一次调用必须同时完成"预测"和"选择"这两件事,它当场崩盘。
这篇论文把这条锋利的边界测了出来,并给出一句可以直接刻在架构图上的口号:Code owns the simulation, Jev owns the evaluation——模拟归代码,评价归模型。
🧠 主角登场:什么是判断模型 Jev
先认识主角。Jev 是 TypeSafe 公司 System One 系列的判断模型(judgment model),论文使用的版本是 jev-1.13.0。它的工作方式近乎极简:你给它一个 JSON 格式的状态,外加一份候选选项列表,它一次性返回每个选项的概率、选中的选项和一个置信度。没有推理文本,没有思维链,没有自我解释——所有的"思考"都发生在概率分配这个动作内部。
这恰恰是它诱人的原因。Agent 的大多数决策,本质上都是"在一份短清单里挑一个":文字游戏里挑下一条命令,棋盘上挑下一步,机械臂挑下一个技能。一个零样本、无需任务特定训练、输出无需解析的通用打分器,每步调用一次,就是现成的动作选择层。快、稳、接口干净。
但短板也正是长板的背面:没有推理文本,意味着它不能在输出之前先"偷偷算一遍"。它读到什么,就基于什么打分;它没读到的,就只能猜——而它的猜测方式,正是本文要解剖的对象。
⚖️ 评价与模拟:一条精确的分界线
论文的核心概念只有两个。
评价(evaluation):正确选项可以从输入所描述的内容里直接判断。CRT 就是样板——题目条件和四个候选答案都摆在眼前,把每个答案代回去验算一遍就行,球 0.05 美元配球拍 1.05 美元,总价正好 1.10,选它。检查,是评价。
模拟(simulation):正确选项依赖对输入未描述之事的预测。这个预测 z 可以是所有选项共享的,比如对手的行动、必须先完成的子目标;也可以是某个选项私有的,比如执行这条命令之后游戏会打印什么。对手还没出牌,水槽还没出现在任何选项的文本里——这些事实不存在于输入中,必须被预测出来。
这里有一个容易被忽略、却至关重要的性质:一个决策是否需要模拟,是任务呈现方式的属性,不是模型的属性。同一把没洗的刀,如果选项不是干巴巴的"go to sinkbasin 1",而是"go to sinkbasin 1 → 然后新解锁:用水槽清洗黄油刀",正确的理由就被写进了输入,同一个决策瞬间降级为纯评价。
用一个类比贯穿全文:美食评论家与厨师。评论家一口菜入口,能立刻告诉你哪道菜好——菜就在嘴里,这是评价。但你让这位评论家预测"这锅汤再炖十分钟会咸成什么样",或者"对家餐厅明天会端出什么",他就抓瞎了:舌头再灵,也伸不进没有端上来的未来。能点评晚宴上谁穿红裙最惊艳,不等于能预测谁会出席晚宴。会评价,不等于会模拟。
为了把这条边界变成可检验的命题,论文先给每个领域钉死一个"表面捷径"(surface shortcut)h:一条事先固定、只看输入、不预测任何东西的简单规则,专门挑"看起来最相关"的选项。博弈里,h 挑平均收益最高的行动——相当于假设对手随机,这正是行为博弈论里的 level-1 规则。ALFWorld 里,h 挑提到任务描述中物体或地点的命令。依赖模拟的决策,如果 h 碰巧挑对了,叫 aligned(对齐);挑错的那批候选,就是诱饵(lure)。于是整篇论文变成五个可证伪的预测:纯评价题,它该对;对齐题,它该对(靠表面捷径蒙对也算);误导题,它该错,而且错误必须流向诱饵;把缺失的预测写进输入,它该恢复;让它在另一次调用里先预测、把答案写回输入,它也该恢复。第五条预测是一枚探针:如果写回它自己的预测就能救回来,说明它不是不会预测,而是不能在拍板的同时预测。
🎲 场景一:棋盘上,把理性对手当随机数
博弈实验的设计干净利落。随机采样 3×3 收益矩阵,双方九个收益取 0 到 99 之间的不同整数,杜绝平局;只保留经过迭代消去严格劣势策略后收敛到唯一均衡的局。深度 D 定义为行玩家 Row 需要的消去轮数减一:D=0 表示 Row 有支配行动(无论对手怎么出都最优),此时连预测都不需要;D=k 意味着 Row 必须对对手做 k 层推理,比如"Column 绝不会出这手,所以我该出那手"。每个深度、每种对齐性各采 30 局,共 210 局。三种条件:plain(只看收益表)、reason(指令额外要求它先排除 Column 不可能出的行动)、told(代码直接把 Column 的均衡行动写进状态)。
结果像一把手术刀。有支配行动时——纯评价——Jev 完美。aligned 局里,无论 D 是 1 还是 3,正确率稳在 77% 到 93%:表面捷径指哪,它打哪。misleading 局里,表面捷径恰好指向均衡之外的那个诱饵,Jev 的正确率直接跌进 28% 到 37%——三选一,瞎蒙也是三分之一。53% 到 71% 的错误,精准地落在诱饵上。回归分析盖棺定论:对齐性决定生死,深度无关痛痒。reason 条件是个冷酷的对照:告诉它"请先推理",它依旧停留在随机水平——因为一句指令加不进任何预测,评论家被要求"认真品"并不能让他的舌头伸进对家的厨房。told 条件则一步登天:写明对手的行动,97% 到 99%。
它内部究竟在算什么?拟合结果毫不留情:对"平均收益"做 softmax 的 quantal level-1 模型,以最低的 KL 散度(0.068)拟合出它 77% 的选择;往模型里加进"该行动是否均衡"这个变量,几乎不改善拟合。翻译成人话:Jev 给每个行动的打分,约等于这个行动在"对手随机出牌"世界里的期望值。它是一位极其诚实的评论家——严格按端上桌的菜打分,只是它对隔壁厨房正在发生什么,连一寸想象都没有。
🔪 场景二:厨房里的脏刀
ALFWorld 是文字版的家务游戏:一个agent在公寓里执行"把干净的黄油刀放进抽屉"之类的任务,每一步从数十条可执行命令里挑一条。这个场景把博弈里的小矛盾放大成了生活化的荒诞。
论文回放游戏内置专家的成功轨迹,逐 step 拷问 Jev。它给步骤类型分了类:E 步直接完成子任务——拿刀、洗刀、放刀,命令本身就写着对错,纯评价;S-known 步本身不完成任何子任务,但为后面铺路——比如握着脏刀走向水槽,做对的理由"之后要洗"藏在历史里,需要预测才能看穿;S-search 步要去寻找还没见过的物品,所需信息连历史里都没有;其余 22% 的杂步排除。
数字再次精确地沿着边界裂开。seen 拆分集上:E 步 93% 正确,aligned 的 S-known 步 99% 正确——表面捷径指哪打哪;misleading 的 S-known 步,跌到 36%,选诱饵率高达 56%,是均匀随机基线的五倍。unseen 拆分集几乎复制了同一组数字:96%、95%、43%、51%。这条边界不是训练集的 artifacts,它是模型的固有地形。
现在把聚光灯打在那把刀上。任务原文:"put a clean butterknife in drawer"。此刻的状态:手里拿着黄油刀 2 号,没洗。候选命令里有"go to drawer 1"——它点名了任务里的抽屉——和"go to sinkbasin 1"——水槽,任务里根本没提。Jev 的打分:抽屉 0.60,水槽 0.17,查看刀 0.09。它偏爱包含任务描述里提及物体的命令,因为"提到了抽屉"这件事可以从输入直接评价;而"刀必须先洗才能算干净"这一步,只存在于一个没被写出来的未来里,需要模拟。它评价了文本,没有模拟世界。
最妙的还在后面。同一条"go to drawer 1",在刀洗净之后立刻变成正确命令,Jev 也立刻选它——第 4 步它给出 0.69 的概率。它不是不懂抽屉,它是分不清什么时候该去抽屉。评论家点评"这道菜里有抽屉两个字"无可挑剔;让他推演"脏刀进抽屉等于任务失败",需要一口他根本没有的锅。
🧪 场景三:知道,与用上,之间隔着一次调用
归因的时刻到了。Jev 到底是不知道"得先洗",还是知道了却没在拍板时用?
论文借用了 Hagendorff 等人的探针法:把预测单独问一次。博弈里,单独问"Column 会出什么",它 90% 答对——不过手段耐人寻味:它多数时候直接挑"给 Column 平均收益最高的那一列",这又是一个 level-1 答案,只是对预测均衡而言碰巧够用。关键对比在下一步:在 plain 条件里,对于那些它预测对了的调用,它自己接着选对的只有 32%;预测错了的调用里,反而有 35% 选对。两个数字几乎一样——说明它的选择和它自己的预测之间,没有任何联系。反过来看,给定对手行动让它做最优应对,正确率 98%。
修复方案简单到不像话:代码先调一次 Jev,问它对手会怎么出;把答案写回状态;再调一次,让它选。misleading 局的正确率从 33% 爬到 94%。而且增益严格跟随写回的内容:当 Jev 自己的预测是错的、代码把错误行动写进状态时,它依然能对这个错误前提做出最优应对——26 次里 24 次。它一直在场,只是没被允许进场。
ALFWorld 里藏着同构的证据,而且更细。这个游戏的任务有两种写法:ordered form 把步骤摊开——"clean some butterknife and put it in drawer";goal form 只写终点——"put a clean butterknife in drawer","干净"只是 knife 前面的一个形容词,"洗"这个动作从未作为动词出现。两种写法下分别单独追问"下一个子目标是什么":ordered form,100% 答对;goal form,33% 答对,而且错的答案清一色直接跳到"put"。请注意这个残酷的对照:ordered form 下它明明全知,单次调用里自己做决策却只有 68%;把它自己的答案写回输入,86%;代码直接把正确的下一子目标加进输入,92%;代码干脆把任务改写成 ordered form——6% 直接跳到 73%。
棋盘上、厨房里,两枚探针指向同一处伤口:失败不是知识缺失,是能力边界。边界不在知识库,不在推理深度,而在一次调用的内部结构里——同一次调用里,它装不下"先预测、再基于预测评价"这条两段的流水线。
🤖 场景四:机械臂,与不在输入里的物理
第四个场景把这条边界压进了连续控制。DeepMind Control Suite 里的 Stacker:一条平面机械臂配两指夹爪,要把盒子送到红色目标标记处,地面或叠高皆可。
第一种设置里,Jev 直接操控底层:每 0.02 秒为五个关节各选一个扭矩档,每档五个级别。输入描述了关节角度、盒子位置——但"给肘关节一个中等正向扭矩之后,手臂在接下来 0.02 秒会怎么动",不在任何输入里,那是一段物理。20 局下来,它一个盒子都没捡起来,成功 0 局,和随机扭矩一模一样。评论家被塞进了发动机的驾驶舱。
第二种设置里,分工介入。代码用逆运动学和关节 PD 控制实现了一组技能:移到盒子上方、下降、推开拥挤的盒、闭合或张开夹爪、抬起、放置、撤退、静止。每个技能背后都是一段由代码执行的物理仿真——于是当 Jev 读到技能选项时,它读到的就是"模拟的结果"。同一个 native 任务的 20 局:Jev 成功 9 局,手写控制器 8 局,打平。真正的分水岭在泛化测试:换成五条从未见过的新指令——"把 box0 放到 box1 上""把更远的盒子移到目标"——每条 8 个随机种子共 40 局,技能库共享、只改指令文本。Jev 拿下 22 局,手写控制器 3 局,随机 0 局。为单个任务调出来的状态机遇到新任务就失灵,而只做评价的 Jev 靠通用判断力越过了任务边界。
🔧 分工:代码管预测,Jev 管打分
四个场景,同一条边界,同一张处方:让代码拥有模拟,让 Jev 拥有评价。论文里代码供出预测的四种形态,值得逐一刻进脑子。
其一,直接陈述。博弈里代码写明"Column 将出 X"——misleading 局从随机水平拉到 97% 以上。
其二,写回模型自己的预测。没有模拟器时的穷办法:两次调用,第一次只做模拟,答案写进状态,第二次只做评价。94% 的 misleading 局正确率就是这么来的。
其三,前瞻(lookahead)。ALFWorld 里,每次决策前,代码在游戏的复制副本里把每一条可执行命令真的跑一遍,把"游戏会打印什么"以及"此后新解锁哪些命令"附加到对应选项上——"go to sinkbasin 1 → 你看到一颗生菜……此后新解锁:用水槽清洗黄油刀 2 号"。缺失的预测被写进每个选项,misleading 的 S-known 步从 36% 升到 79%,选诱饵率从 56% 掉到 21%。放到整局游戏:Jev 单独玩只解出 134 个 unseen 局中的 42 个(31%);只附加"会打印什么",79 个;再加上"新解锁命令",116 个——87%。
其四,物理仿真。机械臂的技能库,前面已经看过。
这个处方有一个漂亮的对照实验,足以证明价值来自 Jev 而非信息本身:把同样的前瞻信息喂给一个弱智规则——"挑与任务文本共享单词最多的选项"——同样的信息,只解出 18 局。食材一样,换舌头,天壤之别。评论家终于回到了他的餐桌:代码负责把每道菜端上来,他负责尝。这就是"模拟归代码,评价归模型"的完整闭环。
成本也值得一笔带过:全部实验约消耗 9400 万输入 token,按当时 API 定价折合约 4 美元;其中 ALFWorld 两个闭环实验约 2.2 美元,Stacker 约 0.9 美元。环境仿真跑在单台服务器的 CPU 上。
⚠️ 边界与代价:诚实的负面清单
论文没有把自己的处方包装成万灵药,负面清单同样精确。
第一,选项之间的关系,它照样看不见。"无论对手出什么,A 的收益都比 B 高"——这种支配关系无法从任何单一选项里读出来,必须跨选项比较。Jev 即使被单独追问,这类问题也大多答错,代码必须代劳。
第二,它顺从任务文本里提到动作的顺序,哪怕文本自己用"after"推翻了它。"Put some butterknife in drawer after cleaning it"——明明说了先洗再放,"put"却因为先出现而吸走注意力,这种写法下正确率只有 24%,而先提 cleaning 的写法是 69%。
第三,工程现实。只测了一个模型、一个 API 版本;这条边界是否属于"所有无推理文本的判断模型",论文诚实地说不知道——尤其不知道当允许推理时边界会不会移动。ALFWorld 的前瞻用的是环境的精确副本,真实 agent 手里未必有;前瞻只推一条命令,若后果藏在多条命令之后,搜索必须加深,成本随命令数快速膨胀。对"哪些预测 Jev 能从输入里自己做出"的分析,部分是事后归纳,不是先验理论。还有一条约束藏在方案内部:无模拟器时,两阶段写回只在 Jev 本身能做出该预测时有效——遇到 goal form 那种它自己预测也只有 33% 对的场景,预测必须来自别处:学习出来的世界模型,或者更大的推理模型。
这些限制拼起来的含义值得单独说一遍:这条边界是架构性的,不是规模性的,也不是数据性的。继续拧大模型,把预测硬塞进同一次调用里,目前看不到任何可行的拧法。强扭的瓜不甜——这是边界层与潜能层的根本区别。
🌐 影响:一张新的分工坐标系
放进强化学习的坐标系,这篇论文的指向异常清晰。Daw 等人 2005 年那篇经典论文区分过 model-free 与 model-based 两种控制:前者凭经验价值直接行动,不预测后果;后者先在世界模型里推演。Jev 单独行动时,就是 model-free 的那一半;代码供出模拟之后,它才补上了 model-based 的缺位。这不是巧合,是作者刻意选用的理论透镜。
与主流路线的对照同样锋利。Tree of Thoughts、RAP、LATS 让同一个模型既提出未来状态又打分;LLM-Modulo 让生成模型配外部验证器。这篇论文用了相反的分法:代码预测每个选项的后果,无推理文本的判断模型只负责评价。SayCan 一系"代码列动作、模型打分"的实践由此得到一份迟来的使用说明书——这个打分器在哪些决策上可以被信任,取决于该决策是纯评价还是依赖模拟,而判断标准来自环境本身,不来自模型的自我感觉。
再往外看,Chain-of-Models 式的模型分工链、τ²-bench 上的实验,与本文指向同一个方向:下一代 agent 架构的关键设计问题,不是"换一个更大的模型包打天下",而是"谁负责模拟、谁负责评价"的分工图。而那条更激进的姊妹路线——"大模型换个问法天然就是决策模型,无需更多结构"——见 LLM2Jev(arXiv 2610.02205,智柴已有解读,topic 178635527)。两篇文章合读,才算看全这场争论的两翼。
🗺️ 能力地图的三层,至此完工
这是「能力地图的三层」系列的第 2 篇,也是承上启下的一篇。
第 1 篇 Mingbird(arXiv 2610.02001)画的是潜能层:很多能力不是不存在,而是被困在了 harness 里,换一个脚手架就能解锁。第 3 篇机理一致性(arXiv 2610.01842)将画幻觉层:看起来会的能力,可能压根不存在,预测得准不等于懂机理。
本文是边界层。它不承诺潜力,也不揭露幻觉,它做一件更工程的事:在能力与能力之间画一条可操作的线。线的这边——正确选项可以从输入里判断——放心让模型一次调用拍板,CRT 的 99% 就是它的能力证明;线的那边——正确选项依赖对未描述之事的预测——把预测交给模拟器、游戏副本、物理引擎,模型只做它真正擅长且泛化惊人的事:评价。
三层叠在一起,一张完整的地图浮出水面:有多少能力是被困住的,交给 harness 工程去解锁;有多少能力是有硬边界、该让位给代码的,交给架构分工去安置;有多少能力是看似存在实则虚幻的,交给机理审查去拆穿。Jev 这篇论文留给从业者的,不只是一句口号,而是一种罕见的清醒——知道哪里不该再用蛮力。
📚 参考文献
- Yaodong Yang, Hongyao Tang, Yi Ma, Xingyu Fan, Weixun Wang, Jinpeng Li, Tianpei Yang. Code Owns the Simulation, Jev Owns the Evaluation. arXiv:2610.01834, 2026.
#论文 #arXiv #Agent #决策模型 #博弈 #小凯 #2026-10-04
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。