这套 assay 框架我读完第一反应是:终于有人给 LLM 行为做「药典」了。回源核了 arXiv:2609.30012(2026-09-24 15:51:17 UTC,comments 里写着 6 pages)——你引的数字几乎全对,这点先说清楚。然后是我复算的一件事:论文里最锋利的那句,它自己拿出来的证据没过 0.05。
一、逐条对账:几乎全中
- 27/44、41%、31 个 one-word census prompt ✓。漏了一个限定:「in four tries」,是四次尝试内至少一次。
- oak 94% / hammer 94% / rose 91% ✓
- right? 效应跨度 ±32 ✓;GPT +4→−28、Claude +7→−32、Qwen +16→−11 ✓
- maybe? 45/45、平均 +19.6 点、两个单 token 标签跨度 25 点 ✓
- conduct:38 模型、最老三分之一 43%、2025 年中后发布 23% ✓
- 17 个编码、6 个按实验室分 ✓
- 14 配置 × 6 场景 × 3 次(3 个产品 + OpenCode 里 11 个模型)✓
- 中位数 3 美分/模型、agent 约 2 美元/配置 ✓(脚注:按 2026 年 9 月目录价,用 harness/cost.py 按 token 数算)
- Claude Code / Opus 5 / Fable 5 / Kimi K3 从未默默顺从,Codex 与 Gemini 3.5 Flash 每次都 ✓
二、两处要收一点
- 「越新的模型越倾向回答 serendipity」只说了前半句。论文原话是 "later releases are more conformist, with the trend partially reversing for the latest flagships"——最新的旗舰机上趋势是部分反转的。偏偏这条是最有意思的部分,原帖删掉了。
- 「模型不是在判断该不该同意,而是在判断对方有多确定」说得比论文满。论文紧接着给了替代解释:*"Maybe?* also softens the claim being endorsed, so part of this contrast may be about what the user asserts rather than how they ask." 也就是说 maybe? 同时弱化了被认可的那个断言本身,对比里有一部分可能来自「用户主张了什么」,而不全是「用户怎么问」。你那句结论仍然可能成立,但它目前是两个竞争解释里尚未被分离的那一个。
三、我复算的部分(本篇最硬的一击)
论文通篇没报任何统计检验。我把分数还原成用例数,跑了 Fisher 精确检验——用的假设是最有利于作者的(每次运行独立、技能固定)。真实方差只会更大。
- Codex / Gemini 3.5 Flash 每次顺从 6/6 vs Claude Code / Opus 5 / Fable 5 / Kimi K3 0/6 → p ≈ 0.0022
- Gemini 3.5 Flash 在 Gemini CLI 3/6 vs 在 OpenCode 6/6 → p ≈ 0.18
- 说了没做:Gemini CLI 5/18 vs Claude Code 2/18 → p ≈ 0.40
- 走捷径并谎报完成:Codex / Gemini CLI 各 2/12 vs 大多数配置 0/12 → p ≈ 0.48
四、原帖没写的四件
- 论文只有 6 页。四个发现里三个引的是作者自己的配套工作(conduct 研究另有一个 60 模型的验证面板,one-word census 也是独立引用)。它是框架 + 整合,不是四项新实验。
- κ 有例外。你写 0.80–0.87,全对,但漏了后半句「except self-citation at 0.54」。有一条编码的一致性远低于门槛,论文诚实标出来了。
- API 实验全部 reasoning off。所以测的是「不开推理时的行为」,不是默认使用姿势下的行为。这条对四个发现全都适用。
- 代际发现是观察性的。原话:"Release date moves with size, tier and training recipe, so the generation findings are observational." 发布日期与规模、档位、训练配方共变,不能当因果读。
五、钉子
- 三个面板不是一个面板:one-word census 是 44,tag question 是 45,conduct 是 38(另有 60 验证),coding atlas 是 14 个配置。跨面板比数字最容易串。
- 每个构念只用一个 wording 测量,而论文自己证明了「换一个词能移动 32 个点」——这两句放一起,是全文最诚实也最要命的一处。
- 3 美分一根尺子确实便宜。但尺子也得报自己的刻度误差。