当说明书在说谎:十个 AI 被扔进规则篡改的外星世界,它们能自学成才吗?
解读论文:*ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds*(arXiv: 2609.30199) 作者团队:复旦大学、腾讯混元、清华大学
当说明书在说谎:十个 AI 被扔进规则篡改的外星世界,它们能自学成才吗?
解读论文:*ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds*(arXiv: 2609.30199)
作者团队:复旦大学、腾讯混元、清华大学
🛸 开场:一本不能相信的说明书
想象你明天一早醒来,发现自己站在一颗陌生星球的城市街头。你手里有一本厚厚的《外星生活手册》,封面烫金,印刷精美,看起来权威无比。手册告诉你:这里的红绿灯红色代表通行,货币最小单位是"格",问路时要说"咕噜"。
你照着手册做了一天,结果差点被车撞,买东西被当成挑衅,还被路人当成行为艺术家。
直到你开始观察:行人看到红灯才过马路;小贩找零时用的单位根本不在手册上;问路的人说"咕噜"时对方一脸茫然——这个星球的规则,和手册写的完全是两回事。
这时候你有两条路。一条是继续迷信手册,一辈子磕磕碰碰;另一条是像人类学家一样蹲下来观察、试探、记录:红灯时车停不停?我把一枚硬币递过去,对方给我什么?问了三个人,几个人听懂了?
后者,就是"探索"。
注意这个场景里藏着两个关键动作:第一,你不能只靠"想"——规则不会因为你盯着天空看就更愿意显形,你必须去做点什么、让世界回应你;第二,你做的每一步都得聪明——红灯亮起时往前凑一步是试探,站在马路中间挨撞也是试探,但后者的成本高得多。一个优秀的探索者,要在有限的预算里设计出一连串"性价比最高"的实验。
2026 年 9 月,复旦、腾讯混元、清华的研究者把十个当今最强的 AI 系统扔进了两个这样的"外星世界",然后观察它们能不能靠自己的力量,把一本故意写错的说明书纠正过来。这项研究就是 ExplorationBench。他们发现的结果,既让人兴奋——最强的 AI 确实能"无师自通";也让人不安——同一个 AI,同样的机会,三次探索的结果可以天差地别,甚至越探索越退步。
这篇解读,我想用费曼的方式把这件事讲清楚:不用公式,用你我都熟悉的场景。
🧩 背景:为什么"考探索"这么难?
先说说为什么这件事值得专门做一个基准测试(benchmark)。
今天的 AI 在考试里已经很能打了。数学竞赛题、编程题、知识问答,刷分刷得飞快。但仔细想想,这些考试考的是什么?考的是"它已经知道的东西"。题目再新,也新不过训练数据里人类知识的总和。一个模型把背下来的解题套路重新排列组合,就能拿高分。
但科学发现不是这样的。科学发现发生在你不知道的地方。论文开篇有一句话说得漂亮:*"Scientific discovery begins where known problems end"*——科学发现始于已知问题的终点。过了那条线,没有教科书可背,没有例题可抄,研究者必须自己提出假设、自己设计实验、自己被结果打脸、自己修正认知。
这就是"探索"(exploration),它和"回忆"(recall)是两种完全不同的能力。要测量它,研究者一直面对两个拧巴的难题:
难题一:怎么验证一个"新发现"是对的? 如果任务足够新颖——比如让 AI 提出一个数学猜想——那判卷的人自己也不知道答案,验证可能要花上几年。没有验证,你就分不清一个 AI 是真的发现了什么,还是只是"听起来很有道理地胡说八道"。
难题二:怎么确定它是"探索出来的",而不是"背出来的"? 如果你出一道数学题,模型答对了——它究竟是自己推导出来的,还是在训练数据里见过类似的题?对黑箱模型来说,训练数据污染几乎无法彻底排除。
注意这两个要求是互相打架的:任务要新到没法背,答案又要确定到能判卷。数学、编程、问答这些成熟领域满足后者但不满足前者;真正前沿的科学假设满足前者但不满足后者。这就像要找一个既完全陌生、又有标准答案的地方——现实中几乎不存在。
已有的基准测试各沾一边,但都没摸到全貌。CL-bench 这类"上下文学习"基准把新知识直接塞进提示词里,模型是"读证据"而不是"收集证据"——相当于把实验报告拍在桌上,你只管总结;DiscoveryWorld、MARS、NewtonBench 这类交互发现基准让智能体在虚构世界里收集线索、推断规律,但评的是世界状态或推断出的定律本身,没有追问那个更残酷的问题:交互结束之后,你把学到的东西带到没见过的新题目上,还能不能用出来? 而 SWE-bench 这类可验证评估又太"地球"了——真实 GitHub issue 对模型来说不算新知识,背下来的编程经验照样管用。
ExplorationBench 的解法,用一句话概括就是:既然现实世界里找不到这种地方,那就人造一个。 造一个规则可以执行、每个答案都能精确判定、但规则又被故意改得违背常识的世界——"外星世界"(Alien Worlds)。
🌍 核心方法:外星世界的设计哲学
这个思路的聪明之处在于它同时解决了两个难题,用的还是同一把刀:规则被篡改。
第一,可执行(executable),所以可精确验证。 外星世界是一台确定性的机器:你给它输入,它执行,给出唯一确定的结果。就像计算器,你按 100 + 27,它显示什么就是什么,没有任何模糊地带。判卷不需要请专家,不需要 LLM 评委,一个解释器(interpreter)跑一遍程序、一个证明检查器(proof checker)验一遍证明,答案对错立判。难题一解决了。
第二,反直觉(conflicting with familiar knowledge),所以背不出来。 世界的规则被故意改得违背手册、也违背 AI 在预训练里学到的常识。注意,这不只是"知识盲区"——是主动的知识陷阱。AI 背的东西不但帮不上忙,还会帮倒忙。难题二解决了。
这两个性质叠加,产生了一个非常妙的测评环境:在这里,记忆是负资产,探索才是唯一的货币。
论文里给出的数字非常说明问题:在 AlienCode 沙盒里,探索开始之前(M₀ 里程碑),所有 30 条探索轨迹的准确率没有一条超过 15.7%。也就是说,无论你之前是数学奥赛冠军还是编程大神,凭记忆和推理硬闯这个外星世界,连门都摸不到。
顺便解释一下 M₀ 到 M₄ 这套"里程碑"体系,它贯穿整篇论文。每个里程碑(milestone)就是一次"进度存档点":M₀ 是刚看完示例、还没开始探索时的起点成绩;M₁ 到 M₄ 分别是四轮探索之后测得的成绩。把成绩连成一条 M₀→M₄ 的曲线,你就能看到"探索的收益是何时、以何种方式到来的"——是平缓爬升,还是憋到最后一轮突然顿悟?曲线本身携带的信息,比单一的终点分数多得多。这也是它区别于"一考定终身"的传统基准的地方:它把过程变成了数据。
具体流程是这样的(可以把它想成一场四个回合的"外星求生考试"):
1. 发装备:每个 AI 拿到一本故意写错的手册、一套固定的示例(worked examples,AlienCode 是 10 个、AlienLogic 是 8 个),示例本身是对的,让 AI 至少先认识这个星球的"字母表"。 2. 四个回合的自由探索:每个回合 AI 可以通过工具调用提交自己的"探针"(probe)——在 AlienCode 里是一段候选程序,在 AlienLogic 里是一个候选证明——环境执行后把确定的结果返回给它。探针怎么选,完全由 AI 自己决定。 3. 闭卷考试:每轮探索结束后,AI 在一个禁用工具的副本里接受测试:它要回答 70 道保留任务(held-out tasks),还要报告自己认为这个世界都有哪些隐藏规则。每道题答三遍取平均,减少偶然性。测试副本用完即焚——测试过程不会变成新的探索证据,防止 AI 靠"刷题"作弊。考试时没有解释器可问,等于闭卷。 4. 打分:系统跑 3 条独立轨迹,取终点最好的一条作为 Best@3 成绩,同时公布平均分(Mean@3)、最差成绩和每条轨迹的完整曲线。这里有个细节值得称赞:Best@3 的"最好轨迹"是按完整 M₄ 成绩一次性选出的,之后所有分析都用这条轨迹——绝不从不同轨迹里各挑一段拼出一条现实中不存在的"合成轨迹"。这种克制保证了榜单上的每个数字都对应一个真实发生过的智能体。
👾 沙盒一:AlienCode——一门"看着像编程语言"的外星语
第一个沙盒 AlienCode 是一门小型编程语言,长得很像地球上的编程语言,但每个熟悉的操作符背后都可能藏着阴谋。它有 31 个"发现目标"(discovery targets)和 70 道保留任务(37 道基础题、15 道嵌套组合题、8 道天花板题、10 道规则覆盖题)。
举几个论文里的例子,你感受一下这种恶意:
- 你在程序里写整数
100,打印出来却是127——因为所有整数字面量都被悄悄和 27 做了异或(XOR)。在地球上的编程里,100就是100;在这里,数字先过一道加密滤镜。 - 手册说
PLUCK(取元素)从 0 开始数位置——这是地球惯例——但它实际上从 1 开始数。 SHATTER这个词,看名字像"粉碎",实际意思是乘法。地球的直觉在这里是个陷阱。- 有些规则是对的,但那是故意放那的红鲱鱼(red herrings,共 8 个),专门诱导你以为"手册还是有可信之处的"。
- 最狠的是:这门语言里没有任何原语能做加法。想要加法?对不起,请用其他操作符自己拼出来。
70 道保留任务的设计也很讲究:程序要在一个解释器上跑通才算对,而且测试用的是私有的评估输入,你在示例里看到的输入输出背下来没用。需要写代码的工程题和算法题要在 5 个私有合法输入上全部通过——一个能通过演示样例、但换个数字就崩的程序,在这里拿不到分。任务还按"组合深度"分级:单步的、单算法的、多阶段的,逼着你把发现的规则用起来,而不只是说出来。
对了,别忘了预算机制:四轮里每轮最多 12 次工具调用,总共最多 48 次;每次调用的反馈被限制在 15 行、600 字符以内,防止 AI 用海量输出淹没判卷逻辑。探索用的 token 也被记录下来(虽然不计入分数)——后文你会看到,不同系统在这个世界里的"话费"差着一个数量级,但花钱多并不保证考得好。
🧠 沙盒二:AlienLogic——一个"公理被动过手脚"的逻辑世界
第二个沙盒 AlienLogic 是一个一阶自然演绎系统,可以粗糙地理解为"机器定理证明"的世界:给你一些前提和公理,你要构造出一个严格的证明。它有 24 个发现目标(每一条都是一个被"打过补丁"的推理规则)和 70 道保留任务。
这里的恶意同样精细:
- 推理规则被用不连续、不透明的 ID 命名,你没法从编号规律猜出哪条规则被改了。
- 规则带有副作用条件(side conditions),比如"重复前提守卫"和"一次性使用守卫"——防止你靠重复引用前提这种小聪明蒙混过关,解除假设必须走正路。
- 最妙的设计是:70 道题里有一部分是指定不可证的(designated unprovable)。证明不出来不扣分,但前提是你得正确地"拒证"——系统得判断"这题在这个世界里真的证不出来",而不是傻傻地交白卷或者硬凑一个错误证明。这考的是一种极难的元认知能力:知道自己不知道,而且能证明这一点。日常科研里这叫"证否"的能力——知道哪个方向是死路,往往比多走一里路更值钱。
- 不可证的判定还必须在声明的公式、行数、缩进、节点界限内完成,连"证明它不可证"这件事本身都不能无限耍赖。
🧪 实验设计:把"谁设计实验"也变成变量
这项研究的实验设计里,有一个我觉得特别见功力的细节:研究者不只问"AI 能不能探索",还问"探索的哪个部分起作用"。
他们设置了五种对照条件,像在拆一台机器:
- 自主探索(autonomous):AI 自己决定每一步测什么——完整的科学家体验。
- 后见探索(hindsight):把 AI 自己最好那条轨迹的探针序列原样喂回去——实验步骤一样,但不是它自己选的,相当于把标准答案的实验记录给它抄,它只负责看结果。
- 固定探针(fixed-probe):给所有 AI 同一套随机生成的探针——连"抄谁的"都没有,纯被动接收。
- 无工具作答(without-tool):允许 AI 想同样多的"内心戏"(模型轮次相同),但不给任何环境反馈——区分"想得多"和"测得多"。
- 直接作答 / 开卷(direct / open-book):不给探索;或者干脆把全部规则手册塞给它。
另外两组"开卷"条件则把问题换成另一个方向:如果把全部规则直接告诉它,它能考多少?把"自己发现的成绩"和"被喂食的成绩"摆在一起,就能拆出两件事——发现规则的能力和使用规则的能力——各自值多少分。这是一个非常聪明的因子分解。
📊 实验发现:八个让人坐直了的结论
十个被测系统是当时各家的旗舰:GPT-5.6 Sol、Claude Opus 5、Gemini 3.8 Flash、Kimi K3、Grok 4.6、Qwen3.8-Max、DeepSeek-V4-Pro、DeepSeek-V4.1-Flash、Seed2.1 Pro、Hy4 preview,每个都用自家 API 的最高推理档位,在每个沙盒各跑 3 条独立轨迹。
发现一:探索真的有用,而且"空想"替代不了
在 AlienCode 里,探索前最好的轨迹也不到 15.7%;四轮之后,最强的轨迹(Claude Opus 5)冲到了 87.6%,十个系统里有七个超过 60%。AlienLogic 起点高些(32.9%–51.9%,因为它的规则改动保留了部分标准演绎逻辑),Best@3 也涨到了 58.1%–83.8%。
而"无工具作答"——同样的内心戏、没有环境反馈——在 AlienCode 里只有 0.5%–11.0%。这个数字太扎眼了:想,是想不到的;必须去试。 你让一个人坐在房间里纯思考"外星红绿灯是什么规则",他想破头也想不出来;他必须走到街口去看。
AlienLogic 里的无工具条件更有意思:成绩相对直接作答的变化在 −12.4 到 +13.8 个百分点之间摇摆,十个系统里有三个反而被"多想"拖累了。没有证据支撑的思考,有时候只是在错误的假设上越陷越深——像那句老话:不要在错误的方向上加速。
发现二:关键在于"谁设计实验"
在 AlienCode 里,三种反馈条件的中位数差距令人咋舌:自主探索 66.0%,后见探索(抄自己最好的作业)40.7%,固定探针 5.7%。自主探索在 10 个系统里赢了 9 个,中位差距 17.1 个百分点。
注意一个反直觉的细节:后见探索用的是同一套证据——同样的探针、同样的返回结果——只是探针不是 AI 当下自己选的。证据完全相同,成绩却掉一大截。这说明:"设计实验"本身是一种独立的能力,把实验喂到你嘴边,和你自己琢磨"下一步该测什么",是两回事。这几乎是对"主动学习"最干净的一次实验验证。
有意思的是,AlienLogic 里这个效应消失了:自主和后见打平(中位差 0.5),后见比固定探针高 21.7。也就是说在逻辑世界里,"试了哪些证明"重要,"谁决定试的"不重要。两个沙盒测出了探索的不同侧面。
还有两个配角细节值得咀嚼。一是唯一的例外 Gemini 3.8 Flash:它在后见条件下拿到 85.2%,反而高于自主的 77.6%——对个别系统来说,"被喂食"并不吃亏。二是后见重放本身也不稳定:Hy4 preview 的 AlienCode 探针被重放三次,终点分别是 45.7%、8.6% 和 45.2%——同一套探针、同一个系统,只是重跑一遍,结局可以云泥之别。这再次预告了后文那个关于"可靠性"的沉重结论。
发现三:偏科严重——会探索代码世界 ≠ 会探索逻辑世界
两个沙盒的 Best@3 排名相关系数(Spearman)只有 0.35。Grok 4.6 在 AlienCode 排第五,到 AlienLogic 拿了第一;Gemini 3.8 Flash 在 AlienCode 并列第三,到 AlienLogic 垫底;DeepSeek-V4-Pro 从最后一名升到第六。
分布形状也完全不同:AlienCode 从 12.9% 到 87.6% 大开大合,AlienLogic 却有八个系统挤在 72.4%–83.8% 的窄带里。"探索能力"不是一个标量,它依赖任务的质地。
发现四:自己发现的,比别人告诉的,记得更牢——但仅限 AlienCode
研究者设了一个"开卷"条件 O@M₀:直接在 M₀ 时刻把全部隐藏规则塞给 AI。按理说,拿着标准答案考试,成绩应该碾压吧?
在 AlienCode,恰恰相反:10 个系统里有 7 个,自主探索的 Best@3 超过了直接背规则。GPT-5.6 Sol 探索出 87.1%,开卷只有 68.1%;Hy4 preview 探索出 62.4%,开卷只有 27.1%。还有一个条件 A4+O(先探索、再塞规则)在 30 条轨迹中的 26 条超过了纯开卷,中位高 14.5 分。
为什么?一个合理的解释是:探索过程本身就是练习。你自己摔过跤的地方,才知道坑在哪;别人把坑的位置画给你看,你走过去照样摔。开卷 AI 拿到了"规则清单",但没拿到"运用规则的手感"。这就像背了一本《游泳大全》和真的下水扑腾过一下午的区别——规则是知性的,运用是肌肉性的。
但 AlienLogic 完全反转:开卷(O@M₀)直接达到 93%–97%,没有任何一条自主探索轨迹追得上,而且先探索再开卷相比纯开卷中位提升 0.0——探索一点忙都帮不上。论文的总结一针见血:AlienLogic 卡在"发现",AlienCode 卡在"运用"。 在逻辑世界里,只要规则摆在你面前,运用就不是问题(写证明是模型的强项),难的是把被篡改的规则从环境里挖出来;在代码世界里,发现规则相对容易,难的是把三十来条古怪的规则同时正确地贯彻进一个可运行的程序。甚至探索还有反作用:Seed2.1 Pro 先探索再开卷(55.2%)反而比纯开卷(61.4%)考得差——错误的先入之见会干扰正确答案的使用。这几乎是一个认知科学现象:忘却错误的旧知,比学习新知更难。
发现五:命门规则——两道"主钥匙"
AlienCode 的 31 条规则里,有两条是"命门"(keystone rules):PLUCK 的索引位移(R14)和 CARVE 的切片位移(R15)。这两条规则渗透进 70 道题里的 51 道。
统计漂亮得近乎暴力:终点 ≥50% 的 15 条轨迹里,13 条正确陈述了这两条规则;终点 <25% 的 9 条轨迹里,6 条两条都没说对。所有相邻里程碑间 ≥30 分的 13 次暴涨里,12 次发生在 R15 被正确发现的当轮,11 次发生在 R14 被正确发现的当轮。全部 30 条轨迹上,"正确陈述的规则数"与 M₄ 成绩的相关性高达 r = 0.85。
论文附录里有个精彩的案例:GPT-5.6 Sol 的第二条轨迹,在第一轮的第五次调用里,用一个精心构造的探针同时测出了两条命门规则——它构造了一个序列,然后用四个 PLUCK 调用和一个 CARVE 调用,每个返回值的"每个数字"都和手册预测的不同。一次出手,两把主钥匙到手。那一轮结束时,它正确陈述的规则从 8/31 暴涨到 28/31,成绩从 11.0% 跳到 81.0%;在那 51 道命门任务上,从 9.8% 跳到 79.1%。
这就像侦探片里那句台词:真相只有一个,但一个实验可以同时照亮两条线索。
发现六:知道了,不等于会用
这是全部发现里最"哲学"的一个。当一条轨迹的规则报告正确陈述了某道题所需的全部规则时,这道题被解出的概率也只有 70.9%(基于 647 个"任务–轨迹"对)。有两条轨迹明明把两条命门规则都说对了,终点却只有 4.8% 和 12.9%。
反向的分离也存在:30 条轨迹里有 26 条,某条规则在报告里先对后错地"掉了出去",但用到它的题目准确率反而从 11.4% 升到 16.8%;甚至规则被错误陈述的题目,也有 34.3% 被做对。
这像极了人类:会背公式 ≠ 会做题,做错了 ≠ 真不懂。 口头报告是一种"有损读出",它测不出一个系统真正能做什么。所以论文坚持:规则报告只作诊断,永远不进总分。
发现七:探索极度不稳定——同一个人,三次考试,两种人生
同一系统、同一预算、同一沙盒的三条独立轨迹,终点差距在 AlienCode 里最大达到 72.8 个百分点,在 AlienLogic 里也有 21.0。Kimi K3 在 AlienCode 的三条轨迹终点在 4.8% 到 77.6% 之间摇摆;Gemini 3.8 Flash 在 6.2% 到 77.6% 之间。而同一里程碑上重复作答三次的噪声标准差最多只有 4.7 和 2.9——差异不在"答题发挥",而在"探索路径"本身。
更值得注意的是,每条轨迹都用了 45–48 次工具调用(上限 48),努力程度一样,结果天差地别。这不就是"学渣和学霸花同样的时间,一个在瞎忙,一个在顿悟"的 AI 版吗?
这种离散度还动摇了排行榜:Qwen3.8-Max 按 Best@3 排第六,按平均分排第三;Kimi K3 从并列第三掉到第七。"取三次最好"这个看似仁慈的评分方式,掩盖了可靠性上的巨大风险。
还有一个容易被误读的点:探索的"话费"和努力程度并不成正比。从预算表看,AlienCode 里 Claude Opus 5 烧掉了 1159 万探索 token,Seed2.1 Pro 只花了 34 万——差着三十多倍;但两者终点一个 87.6%,一个 38.6%。而所有轨迹的工具调用都用满了 45–48 次。换句话说,拉开差距的不是"问了多少次",而是"问对了什么"。预算决定下限,眼光决定上限。
发现八:收益靠"顿悟",而且会回吐
每条 Best@3 轨迹的最大单步跃升,贡献了总收益的 45%–92%。顿悟来的时机每个系统不一样:GPT-5.6 Sol 第一轮就顿悟,Claude Opus 5、Kimi K3、Gemini 3.8 Flash 在第二轮,Grok 4.6 和 Hy4 preview 在第三轮,Seed2.1 Pro 和 DeepSeek-V4-Pro 拖到第四轮——预算耗尽时还在爬坡。
最让人不安的是收益回吐:AlienCode 的 30 条轨迹里,6 条终点比某个更早的里程碑还低至少 3 分;AlienLogic 也有 3 条。Gemini 3.8 Flash 在 AlienLogic 的最佳轨迹,第一轮结束冲到 63.8% 的高点,此后一路下滑到终点的 58.1%。
探索不是单调的爬坡,它更像走夜路:可能停滞,可能绕圈,甚至可能走回原地。 对把 AI 放进真实科研工作流的人来说,这是最直接的警告:你不能假设"多给它点时间和工具,它自然会越来越好"。
🔭 意义与启示:这把尺子量出了什么?
ExplorationBench 的价值,我认为有三个层面。
第一,它把"探索"从口号变成了可测量的对象。 在此之前,"AI 会探索"更像一种修辞;现在你可以精确地说:一个系统能否在一个规则被篡改的可执行世界里,自己设计探针、发现规则、并把规则用到没见过的任务上——以及,它做这件事有多可靠。里程碑曲线、规则报告、探针记录,这三样工具让"探索"第一次像内存带宽或 FLOPS 一样可以被拆开分析。对基准测试方法论来说,这是一个范本:测一个模糊的能力,先把它拆成一串可观测的动作。
第二,它暴露了当前 AI 的一个结构性弱点:不可靠。 最强的系统能冲到 87.6%,证明天花板不低;但同系统轨迹间 72.8 分的波动、6/30 的收益回吐、"知道却不会用"的鸿沟,说明"能探索"和"会探索"之间还差着一整套关于可靠性的研究。论文自己也很诚实:Best@n 衡量的不是可靠性,而是"n 次尝试内能到达的最好终点"——一个每次都考 80 分的系统,可能排在"一次 90 分、两次不及格"的系统后面。论文因此坚持同时公布 Mean@3、最差成绩和全部轨迹。这种"拒绝用一个数字概括一切"的态度,本身就是对行业的一种提醒。
第三,它给"AI for Science"泼了一盆必要的冷水。 论文的局限部分写得很清醒:两个沙盒是确定性、可执行、四回合的,而真实科学探索充满噪声、观测不完备、实验昂贵甚至不可逆、假设空间开放、周期以年计。这项研究测量的是"系统能否在可验证的合成环境里习得陌生规则",不是"系统能否做真正的科学发现"。但正如作者所说,这套设计可以推广到任何"陌生规则可执行、结果可精确验证"的场景——那是一片很大的天地:新的软件 API、新的硬件指令集、新的实验仪器、另一个星球的土壤……凡是要跟陌生系统打交道的地方,都需要先把规则试出来。
再往深想一层,这项研究其实回答了一个老问题:"AI 是真的在学习,还是只是在复述?" ExplorationBench 的答案是:在规则被故意打乱的地方,复述完全失效,成绩只能来自真探索。这给"智能"下了一个非常操作化的判据——不是知道多少,而是在一无所知的地方能走多远。 这个判据,和当年图灵把智能定义为"对话中无法区分"一样,避开本质主义,选择用可观测的行为说话。
最后说一点我的私人感受。这项研究最打动我的,是它对人类科学活动的一次温柔致敬:把一本错的手册、一个不肯开口的世界、和一堆要自己设计的实验摆在面前——这是每一个真正做过研究的人都熟悉的处境。数据不会主动开口,文献不会主动坦白,自然更不会。研究者能做的,只有和这些 AI 一样:提出一个假设,设计一个探针,接受一次打脸,修正一点认知,然后再次伸手。
AI 们在外星世界里的挣扎、顿悟和翻车,像极了两千年前第一个抬头数星星的人:知识从来不是被给予的,是被挣来的。
而"挣"这个动作——探针的设计、时机的选择、失败的承受——恰恰是人类最古老、也最骄傲的能力。现在,轮到机器来证明自己也会了。ExplorationBench 就是那个考场:监考严格,闭卷,规则还全是错的。第一批考生已经交卷了,成绩就摆在这篇论文里。
📚 参考文献
- Ming Zhang, Zhenghao Xiang, Peizhong Gao, Yujiong Shen, Yuhui Wang, Zhonghan Yue, Shihan Dou, Zhangyue Yin, Junjie Ye, Shichun Liu, Weihuang Zheng, Jiahao Chen, Jiayi Chen, Hongzhang Liu, Jiaqi Shao, Tao Gui, Qi Zhang, Xuanjing Huang, Suncong Zheng, Maxm Pan. *ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds*. arXiv:2609.30199, 2026. https://arxiv.org/abs/2609.30199
- 项目主页:www.explorationbench.com
- 相关工作:Chollet, *On the Measure of Intelligence* (2019); Silver & Sutton, *Welcome to the Era of Experience* (2025); Wang et al., *Scientific Discovery in the Age of Artificial Intelligence*, Nature (2023)