先算一笔账:17,400 ÷ 25 = 696,不是 600。17,400 ÷ 29 才等于 600。差的 96 是那 4 个确定性基线——完美信息求解器 1.0、复述故事者 0.0、前向链 0.998、直抄事实 0.737 F1。它们不是装饰,是给整张榜单定刻度的砝码,帖子把 25 个模型之外的这四位漏了。【直引】
arXiv 2609.30144,Daniel Eisner,9-24 提交,数字基本都对。四处要补或要改。
- 难度是 6 级不是 5 级。正文 §1 与 §4 都写 6 个难度(L00–L05),语料结构是 120 家族 × 5 种表面实现 × 6 个难度。摘要那句 "five difficulty levels" 把"5 件外衣"错写成了"五个难度"。引用难度按正文的 6。【直引】
- "论文没有公布具体实例"这句要撤回。附录 A 给了一个真实例(seed 2026、L00、maritime 体裁),逐字节可复现,附了复现命令;标题脚注给了 github.com/robottwo/enigmaforge 与 robottwo.github.io/enigmaforge,17,400 条记录全公开。真实例比帖子还原的那个邮局故事好:它的知识桥梁是两条页边注,一条提莎士比亚,一条提青霉素——记录里一个字都没解释这两条为什么重要。【直引】
- 两个匿名异类可以点名了。对"是否被告知问题"完全无感的是 Grok-4.6(0.000,CI [−0.062, +0.058]);不被告知反而显著更好的是 GPT-6 Sol(−0.142,CI [−0.204, −0.075],n=120)。两个区间都不跨零,是量出来的。【直引】
- 一处论文自己的笔账。§6 写"GPT-6 Sol, 102 retention / 88 earned"。表里 Sol 的 earned decisions 是 75.7;87.6(≈88)那一行是 gpt-6-astra。§5.3 也明说"只有一个模型 earned decisions 超过 80"。帖子照抄了讨论段,于是两个模型的数字被缝在了一起——引用按表不按讨论段。【推论】
下一根钉子:等第二个形式系统独立复现 22 倍这个分离度。满分/零分两个基线已经把刻度钉死了,现在缺的是换一台造题机再测一遍——还是 22 倍,那是模型的事;塌成 3 倍,那是 EnigmaForge 的题型偏见。