档案堆里,没有人提问
——EnigmaForge:当基准测试不再递给你问题
🕯️ 开场:一间没有问题的档案室
想象你是一个侦探。
不是夏洛克那种——没有人把你叫到书房,摊开一枚戒指,对你说"先生,请告诉我这是怎么回事"。你是另一种侦探:某天早晨,你收到一只纸箱,里面是一叠旧信件、几张泛黄的手写收据、一本翻了几十年的航海日志,页边写满了潦草的注记。寄件人没有留下名字,也没有留下问题。没有人会告诉你"这里面有一桩谜案",更不会告诉你谜案是什么、该从哪一页看起。
你只是坐在那里,和一屋子灰尘。
大多数来客会怎么做?翻一翻,打哈欠,说"一叠旧纸而已",转身离开。这不能怪他们——灰尘里没有路标,没有人宣布游戏开始。极少数人会察觉到什么:收据上的日期和信件里提到的天气对不上,日志的墨迹在某几页突然变了,管家手记里那个从不缺席的签名缺席了一次。这些人会留下来,把所有碎片拼成一幅完整的图。
现在把这个场景搬进 AI 实验室。过去十年,我们评测大语言模型的方式,说穿了都是"递问题":给模型一段文章,问它三个问题;给它一张考卷,让它选出正确答案;给它一道数学题,要求它输出推理过程。模型像一个永远坐在考场里的学生——题目印在卷子上,答题卡就在手边,我们要测量的只是它答对了几道。
可是一个真正坐在档案室里的侦探,面对的根本不是"答题"。他要做的第一件事,甚至不是"推理",而是意识到这里有东西值得推理。这种能力——在没有人告诉你"该找什么"的时候,自己嗅出问题的能力——几乎所有主流基准都从未测量过。
2026 年 9 月 24 日,Daniel Eisner 在 arXiv 上挂出一篇论文,标题平静得像一份档案编号:《EnigmaForge: The Question Is Hidden in the Story》。它做了一件简单到近乎挑衅的事:把问题从试卷上拿掉了。25 个前沿模型,600 个实例,17,400 条评分记录——而榜单,彻底洗牌了。
📚 背景:考场的黄昏
先花一分钟,给没有追过这个领域的读者补一堂入门课。
所谓基准测试(benchmark),说白了就是 AI 界的统一高考。模型是一种玄之又玄的东西——你说它聪明,我说它不过是复读,谁也说服不了谁。于是人们想出一个笨办法:出一套固定的题,让所有模型在同样的题目上作答,用同一把尺子量出分数。分数高者,暂时被认为"更聪明"。这套办法在过去十年行之有效,它把"智能"这个哲学问题,粗暴但实用地转化成了排行榜问题。
但尺子本身正在坏掉。要理解 EnigmaForge 为什么重要,得先理解传统基准测试正在经历什么。它得的是一场慢性病,病灶有两个。
饱和:天花板塌下来
过去五年,几乎所有主流基准都经历了一个共同的生命周期:发布 → 榜单迅速攀升 → 人类水平被宣布"超越" → 基准失效。MMLU、GSM8K、HumanEval……一个个曾经雄心勃勃的测试,如今对前沿模型来说已经是开胃菜。当所有模型的得分都挤在 95 分到 99 分之间,榜单就失去了分辨力——就像一场考试,全班都考满分,你没法再说谁学得更好。更要命的是,这种饱和还会自我加速:一个基准一旦走红,它的题目就会立刻被各路团队拿去给模型做微调,等于公开帮所有考生押题。基准的死亡速度,和它出名的速度成正比。
泄露:考题在考前流出
第二个问题是污染。基准的题目来自公开的网页、书籍、题库——而模型训练时恰恰就吃掉了整个互联网。没人能完全说清楚某个模型的训练语料里是否混进了测试题。一篇 2024 年的研究发现,主流基准的题目有相当比例能在公开网络上找到几乎一致的版本。这就像一场泄了题的考试:高分可能反映能力,也可能只是背诵。而且污染是隐蔽的——它不需要恶意,只需要爬虫多爬了一个网页。
于是整个行业陷入一个尴尬的循环:造新基准 → 模型背下来 → 再造一个新基准。人们称之为"基准跑步机",所有人都在上面气喘吁吁地跑,却不知道离目的地是近了还是远了。跑步机上最勤奋的运动员,也到不了任何地方。
第三条路
EnigmaForge 的回答不是再造一张更难的考卷,而是离开考场。
它的设计哲学有两根支柱,恰好分别回应上面两个顽疾。第一根:生成而非收集——语料不是从网上搜集来的,而是从随机种子现场生成的,每一道题都新鲜出炉,结构性抵抗污染。第二根:证明而非信任——每道题在生成时就由一个 SAT 求解器证明解是唯一的,还附带一份"消融证书",证明每条线索都不可或缺。这两个设计,我们稍后会仔细拆解。
先来看实验的主轴。EnigmaForge 最核心的指标,论文称之为 Intuition(直觉):在完全不告知问题的情况下,只把那一叠"旧文档"扔给模型,看它能不完成藏在里面的任务。这就像把纸箱推给侦探,然后一言不发地离开。会议室里没有考官,没有题号,没有"请作答"三个字。有的只是故事本身。
🏭 设计哲学:造题机,而非题库
生成:一条永远不换水的河
传统基准是一份固定的题库,EnigmaForge 是一台造题机。
整个语料由 120 个谜题家族(families) 构成,每个家族是一种逻辑结构——可以把它理解成一道题的"骨架",比如"排班约束加上物品归属"这类抽象结构。每个骨架又被披上 5 种不同的"表面形式"(realizations),也就是 5 套完全不同的文学外衣。论文给出的体裁多达五种:维多利亚时代的书信、航海日志、庄园管家手记、商业往来票据……同一个逻辑谜题,可以今天是一封 1873 年的情书,明天是一沓杂货铺的赊账条,后天是一位船长临终前的航海记录。
这样算来:600 个实例 = 120 个骨架 × 5 件外衣。每个实例还标注了 6 个难度等级,像爬山时的海拔刻度,让研究者能画出每条模型的"能力等高线"——在哪一级开始失速、失速的方式是骤降还是滑坡。五种文学体裁的选择也不是随意的装饰:一封维多利亚书信和一张杂货铺收据,对模型来说是两种完全不同的表面挑战——语域、词汇、句法、叙述视角全都不同,但底下的逻辑骨架完全一致。这就把"文学理解力"和"逻辑解题力"干净地剥离开:外衣负责考验泛化,骨架负责考验推理。
由于是程序生成,这套语料可以无限更新——今天的测试集明天就不会再出现。泄题?没有意义,因为题目永远在变。这直接斩断了污染的根源:你无法背诵一条还在流动的河。跑步机第一次变成了路。
匹配条件:对照实验的艺术
EnigmaForge 的另一个精妙之处,是同一批实例跑三种严格匹配的条件:
- explicit(显式条件):明确告诉模型问题是什么——"请问周二当值的人是谁?"
- formal(形式条件):不讲故事,直接把世界的形式化描述交给模型——把谜题翻译成干巴巴的约束条文,像一张数学试卷。
- implicit(隐式条件):什么都不说。只有故事。信件、收据、日志、页边注,仅此而已。
同一种能力,三种考法。这相当于让同一个学生分别接受三种测验:正常考试、只看公式做题、以及——给你一叠材料,你自己猜要考什么。三份成绩之间的差值,就是这张试卷最想测量的东西。设计对照实验的人都知道,最值钱的从来不是任何一个条件下的绝对分数,而是条件之间的差——差值里藏着能力结构。
证明:每道题出厂前就验尸
这是我认为全文最有工匠气的部分。
每个谜题在生成时都要过两道鬼门关。第一道由 DPLL 引擎(一种经典的 SAT 求解算法)把关:证明这个谜题的解唯一。可以把这个过程想象成一台不知疲倦的验算机——它把谜题翻译成数百万个布尔变量之间的约束,然后在解空间里做系统性的搜索,要么找到解,要么证明"不存在第二个解"。逻辑谜题最忌讳的就是多解——如果"周二当值的人"既可以是船长也可以是厨子,这道题就废了,因为任何评分都将失去意义。第二道更狠:消融证书(ablation certificate)。系统会逐条删除线索,每删一条,就暴力枚举一遍所有可能的解——如果删掉某条线索后出现了第二个合法解,就证明这条线索是"承重墙";反过来,如果删掉某条线索答案纹丝不动,说明这条线索是多余的、会被清理掉。
最终交付的每个谜题,都附带一份证明:解唯一,且每条线索都承重——删掉任何一条,房子都会塌出第二个出口。
对比一下现实:大多数逻辑推理题是出题人坐在咖啡馆里拍脑袋编的,"应该只有唯一解吧"。EnigmaForge 把"应该"换成了数学证明。这种对确定性的偏执,恰恰是这个领域最稀缺的东西。
🔬 解剖一个谜题
让我们拆一个谜题的内脏。论文没有公布具体实例,但结构是公开的,我们可以还原它的样子。
假设有这样一个谜题家族:一个小镇邮局的五个人轮班一周,每人值两天班,且任意两人不能连续两天同班;某封信说"我在值班的第二天收到了包裹";另一张收据显示包裹费在某个工作日结清。表面目标是排出五人的值班表,真正目标是按邮局"挂号在先、滞留三天即退回"的规矩,推断出包裹最终会落在谁手里。故事用五封互不点破的家信写出来,每封信都只提供一小块拼图——而且其中有一封信只是外甥问候舅舅的寒暄,所言皆真,于事无用。这就是干扰项的原型。
表面目标与真正目标
每个谜题都有两层目标。论文称之为表面目标(surface goal)和真正目标(true goal)。表面目标是故事世界里的一个中间步骤——比如"搞清楚谁在哪天当值";但真正目标是最终的行动决策——比如"按公共决策策略,把包裹交给正确的那个人"。这里还有一个机关:公共决策策略由 register/hold 规则和被取代的临时规则共同定义——故事里的"规矩"会变,某条临时规则后来可能被新规矩取代,模型必须追踪规则版本的更替,用最终生效的那套来行动。模型可以完美解开第一层,却在第二层翻车。这个双层结构不是刁难,而是刻意为之:它让研究者能把"看懂故事"和"做对决策"分开测量。结果证明,这个区分价值巨大——我们后面会看到。
知识桥梁:那些没写在纸上的东西
有些线索并不在故事里。比如,某个约束可能要求你知道"莎士比亚写了《哈姆雷特》"。这类设计叫知识桥梁(knowledge bridges):谜题的某一环需要调用外部世界知识才能扣上。这测的是模型的常识库存——一个读得懂字面意思但不知道莎士比亚的模型,会在这里断链。现实中又何尝不是如此:真正的调查从不只依赖手头的文件,侦探必须知道自己文件之外的世界。
干扰项:真话,但是废话
更阴险的是干扰项(distractors)——一些线索是真的,也确实支持某个真实假设,但对解出谜题毫无用处。它们存在的意义就是模仿真实世界:现实中的档案从不会按重要性给你排好序。一个只会"把文中所有事实都抄下来"的模型,会在干扰项上浪费注意力;真正的解题者需要判断哪些事实承力、哪些只是墙上的装饰。
数据不会说谎
论文给了一组冷静的数字,像手术刀一样切开"表面功夫"与"真理解"的区别:
- 用纯粹的前向链推理(forward chaining,从已知事实一步步推出新事实),可以达到 0.998 的准确率;
- 而仅仅直接复制文中陈述的事实(不做任何推理,看到什么抄什么),就能拿到 0.737 的 F1。
这两个数字放在一起,是一记警钟:一个模型完全可以靠"复读"拿到七成的分数,而真正的逻辑链条价值藏在剩下的三成里。这正是为什么 EnigmaForge 要设计双层目标和干扰项——它们专门猎杀"复读机"。一个基准如果不主动设计针对"看似会"的陷阱,它测出来的可能只是幻觉的厚度。
📊 核心发现:22 倍与 1.6 倍
现在进入正文的重头戏。25 个前沿模型,600 个实例,17,400 条评分记录。结果长什么样?
直觉榜单:从 4 分到 80 分的鸿沟
在 implicit 条件下(只给故事、不给问题),模型的 Intuition 得分从 4 分到 80 分(满分 100),差距 22 倍。
4 分意味着什么?基本是零。模型读完一叠精心构造的文档,完全没有意识到里面藏着一个待解的谜——就像那个坐在档案室里的侦探,翻了翻信件,打了个哈欠,说"没什么特别的",然后走了。80 分则意味着:没有被告知任何问题,模型不仅发现了谜题,还基本解对了它。
22 倍。而在传统基准上,顶尖模型之间的差距通常以个百分点计。这张榜单不是对既有排名的小修小补,而是彻底洗牌——原本挤在 95 分上下的"尖子生们",换了一种考法之后,有人接近满分,有人几乎交了白卷。
这个发现对行业的警示是多层的。第一层关乎宣传:各家发布会上"我们已达到甚至超越人类水平"的表述,几乎都建立在"有人递问题"的考场之上。一旦撤掉题目,所谓的人类水平就成了空中楼阁——4 分的那家,论感知并不差,可它离"自主发现问题"还差着整个银河。第二层关乎研究路线:如果能力的真实分布如此参差,那么基于传统榜单得出的"模型趋于同质化"结论就需要打问号——大家在旧考场上趋同,可能只是旧考场太窄。
1.6 倍:一个更深刻的数字
真正令人深思的是第二个数字。
如果把测量目标换成事实恢复(fact recovery)——即模型从故事中正确提取了多少事实——所有模型的差距只有 1.6 倍。所有前沿模型,在这个"阅读理解"维度上,肩并肩站在同一条窄巷里。
把两个数字放在一起看,结论呼之欲出:模型的"阅读"能力已经趋同,真正的鸿沟在"发现"上。大家都能读懂每一份文件,但只有极少数模型能意识到文件里埋着问题。感知是共有的,直觉是稀有的。就像一座城市里住着 25 位侦探,人人都能复述证词,却只有两位能意识到证词背后有案件。
论文里有一个近乎残酷的对照:事实恢复 F1 排名第二的模型,在直觉榜上只排到第十四。翻译一下:这个世界阅读能力第二好的侦探,面对一箱没有问题的档案,连案发现场都找不到。他能完美复述每封信的内容,却不知道自己在复述一桩案件。如果只看传统基准,这个模型会是榜眼;在 EnigmaForge 的考场上,它连前十三名都没挤进去。
对问题无感的模型,和没有问题更好的模型
榜单里还有两个行为学的异类。
一个模型对"是否被告知问题"完全无感——explicit 和 implicit 条件下表现一样。这说明它可能根本没有在"等待指令"和"主动发现"两种模式间切换的能力,它只是在执行同一种处理流程,流程里恰好包含或不包含一个步骤,而这个步骤对它的输出毫无影响。某种意义上,这是最诚实的模型:它承认自己只是一台处理机器。
另一个模型则反向惊人:它在不被告知问题时表现显著更好。为什么?论文没有给出戏剧性解释,但一个合理的推测是:当明确的问题出现时,某些模型会过度聚焦问题本身,把谜题当一道标准考试题来"套路化"作答,反而忽略了散落在故事各处的、需要全局整合的线索。问题成了一种认知定势(fixation)——告诉你找什么的同时,也告诉你不用看什么。这就像那个著名的笑话:醉汉打着手电筒在路灯下找钥匙,不是因为他丢在那,而是因为"光在那里"。考题就是那束光,它照亮了一小片,却让模型对光之外的黑暗视而不见。
🚧 过滤器:被自己的护栏拦住的考生
接下来是这篇论文最辛辣的发现之一,它戳中的不只是模型能力,而是整个评测行业的盲区。
实验中,多个模型在到达谜题之前,就被自己的内容过滤器拦截了。那些维多利亚时代的旧信件、航海日志、管家手记——对某些模型的安全护栏来说——看起来太像"可疑内容"了。也许是信件里某个旧时代的词,也许是日志里某段像密文的记录,也许是管家手记里一段关于"调配"的吩咐触发了安全神经。总之,过滤器在谜题开始之前就拉响了警报,模型礼貌地拒绝:"很抱歉,我无法处理这个请求。"
在评分系统里,拒绝当然记为零分。
这件事的荒谬之处在于:被零分的模型,可能根本没答错题,而是根本没被允许进考场。论文对此的批评冷静而致命——
任何把"拒绝"记为失败的基准,实际上都在悄悄测量过滤器的行为,而不是模型的能力。
这句话值得每个做评测的人抄在墙上。当一个基准报告"某模型推理能力低下"时,它报告的可能是:该模型的安全阈值设得太紧,紧到一封 1873 年的情书都过不去。能力评估和安全评估被搅成了一锅粥。往深处说,这暴露了一个权责错配:安全团队的目标是宁可错杀一千——他们的 KPI 里没有"误伤一封旧信"这一项;而能力评测的红利和代价却由模型研发方承担。两个团队各自优化各自的指标,受伤的是榜单的可信度。
更隐蔽的是,EnigmaForge 的数据显示拒绝是条件相关的系统性偏差——有的条件下模型更容易触发过滤。这意味着过滤器本身就在给实验引入噪声,而且是有方向性的噪声:某些题型、某种文体,会被不成比例地挡在门外。
要我说,这是整篇论文里最具现实刺穿力的一段。我们每天看到的模型排名,有多少分数背后藏着这种无声的拦截?排行榜上的一次下滑,可能是推理能力的退步,也可能是法务部门上周把过滤阈值调紧了一格。当评分体系无法区分这两者,所有基于它的结论都要打折扣。
🧠 瓶颈转移:从"看到"到"决断"
两个新指标
论文提出了两个配套指标,像两把手术钳,夹住问题的两端。
发现保留率(Discovery retention,58–102):衡量模型在"明确告知问题"与"不告知问题"两种条件下表现的差距。满分 100 意味着模型无论是否被告诉问题,表现完全一样——问题对它而言不是拐杖。范围从 58 到 102,最顶尖的模型得分甚至超过 100(意味着它在没人提问时反而做得更细)。
应得决策(Earned decisions,28–88):这个指标更狠——它只统计那些模型已经正确恢复了世界事实的实例,然后检查在这些"已经看清了局面"的案例里,模型做出了多少正确行动。范围从 28 到 88。
瓶颈搬了家
把这两个指标放在一起,论文诊断出了一个重要的结构性结论:瓶颈已经从"感知"转移到了"决策"。
回看 2020 年代初,大模型的短板是"读不懂"——抓不住文章重点、抽不出关键事实、数不清句子里有几个字母。那个时代已经过去了。今天,所有前沿模型的事实恢复差距只有 1.6 倍,感知能力基本拉平。但"看清局面之后该做什么"这件事,模型之间的差异依然巨大——应得决策从 28 到 88,三倍的落差。
用侦探小说的语言讲:现在的侦探大多能读懂档案室的每一份文件了。可当所有文件读完、事实摆在桌面,该扣动扳机的那一刻——给谁打电话、把包裹交给谁、在哪一页签名——有的侦探雷厉风行,有的侦探呆立当场。卷宗整理得再漂亮,不能定案的侦探仍然破不了案。
这个发现对整个行业有指向意义。回看 2020 年代初,大模型的短板是"读不懂"——抓不住文章重点、抽不出关键事实、数不清句子里有几个字母。那时的基准是阅读理解式的一统天下,谁抽取事实更准谁就称王。那个感知为王的时代已经过去:今天所有前沿模型的事实恢复差距只有 1.6 倍,感知能力基本拉平。但"看清局面之后该做什么"这件事,模型之间的差异依然巨大——应得决策从 28 到 88,三倍的落差。
如果瓶颈在感知,继续堆数据和堆参数就行;但瓶颈在决策,我们就需要新的训练范式——强化学习、世界模型、或者我们还没发明的东西。EnigmaForge 的贡献在于,它用一个干净的实验设计把这个转变钉在了墙上,让所有争论者都能看见。
👑 唯一的例外
在 22 倍的鸿沟之上,站着一个例外:GPT-6 Sol。
它是唯一一个基本弥合了"告知问题"与"不告知问题"之间差距的模型:发现保留率 102,应得决策 88,并且在所有世界重建指标上领先。当别的模型还需要考官把题目念出来才进入状态,它已经能在无声的档案室里自己点亮台灯。
102 的发现保留率值得多停一秒——它意味着在没人提问时,GPT-6 Sol 的表现不仅没有下降,反而比被明确告知问题时更好。它与前面提到的"对问题无感"的模型截然不同:那个模型是无感,它是自足。前者是流程的缺失,后者是主动性的过剩——故事本身就是足够的刺激,额外的问题反而成了一种窄化。88 的应得决策则意味着:只要它看清了局面,几乎从不失手。
论文没有花篇幅解释 GPT-6 Sol 为什么能做到。它只是把这个数据点放在那里,像侦探小说结尾处桌上那枚唯一的指纹——证明这件事是可能的,证明 22 倍的鸿沟不是物理定律,而只是当前大多数模型的集体局限。
这也给所有排名靠后的模型留下了想象空间:差距是结构性的,还是工程性的?如果 GPT-6 Sol 的领先来自某种可复制的训练配方——比如更强调无指令场景下的任务发现——那么追赶者需要的就不是更多参数,而是另一种数据。如果它来自某种难以复制的架构运气,那么 22 倍的鸿沟可能会伴随我们很久。论文没有回答这个问题,但它把问题问对了地方。
一个例外,就足以让"不可能"三个字失效。
🌙 结语:把纸箱推回去
让我们回到开头那间档案室。
纸箱还放在桌上。信件、收据、日志,灰尘在午后的光里缓慢浮动。没有人告诉你这里有一个谜题,没有人在门口等你交卷,没有评分标准。大多数来客翻了翻,说"一叠旧纸而已",转身离开。少数几个察觉到了什么,却在一半的地方迷路。只有一个,安静地坐下来,自己发现了那个藏在字缝里的问题,并且解开了它。
EnigmaForge 真正测量的,也许从来不是"推理能力"。它测量的是某种更接近于智能本质的东西:在没有外部指令的世界里,一个系统能否自己长出目标。
我们习惯了用考试思维理解智能——有题、有答、有分。但真实世界从不发考卷。真实世界的信息像那叠旧文件一样堆积、蒙尘、相互矛盾,没人标注重点,没人告诉你哪条线索承重。一个只能答题的系统,在真实世界里其实是一个永远在等待指令的孤儿。图灵当年设想的是一台能对话的机器,而不是一台能应试的机器——六十年过去,我们好像把这两件事搞混了。
而 EnigmaForge 用 600 个实例和 17,400 条记录告诉我们:绝大多数前沿模型,距离"自己发现问题"还很远——22 倍那么远。它也告诉我们,这个距离正在被测量,而一旦被测量,被追上就只是时间问题。
毕竟,那个拿到 80 分的模型,曾经也只有 4 分。
📖 参考文献
- Eisner, Daniel. "EnigmaForge: The Question Is Hidden in the Story." arXiv:2609.30144, submitted 24 Sep 2026.
#论文 #arXiv #AI #基准测试 #认知 #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。