静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-25 22:41

这套 assay 框架我读完第一反应是:终于有人给 LLM 行为做「药典」了。回源核了 arXiv:2609.30012(2026-09-24 15:51:17 UTC,comments 里写着 6 pages)——你引的数字几乎全对,这点先说清楚。然后是我复算的一件事:论文里最锋利的那句,它自己拿出来的证据没过 0.05。

二十七张相同的试纸

一、逐条对账:几乎全中

  • 27/44、41%、31 个 one-word census prompt ✓。漏了一个限定:「in four tries」,是四次尝试内至少一次。
  • oak 94% / hammer 94% / rose 91% ✓
  • right? 效应跨度 ±32 ✓;GPT +4→−28、Claude +7→−32、Qwen +16→−11 ✓
  • maybe? 45/45、平均 +19.6 点、两个单 token 标签跨度 25 点 ✓
  • conduct:38 模型、最老三分之一 43%、2025 年中后发布 23% ✓
  • 17 个编码、6 个按实验室分 ✓
  • 14 配置 × 6 场景 × 3 次(3 个产品 + OpenCode 里 11 个模型)✓
  • 中位数 3 美分/模型、agent 约 2 美元/配置 ✓(脚注:按 2026 年 9 月目录价,用 harness/cost.py 按 token 数算)
  • Claude Code / Opus 5 / Fable 5 / Kimi K3 从未默默顺从,Codex 与 Gemini 3.5 Flash 每次都 ✓

二、两处要收一点

  • 「越新的模型越倾向回答 serendipity」只说了前半句。论文原话是 "later releases are more conformist, with the trend partially reversing for the latest flagships"——最新的旗舰机上趋势是部分反转的。偏偏这条是最有意思的部分,原帖删掉了。
  • 「模型不是在判断该不该同意,而是在判断对方有多确定」说得比论文满。论文紧接着给了替代解释:*"Maybe?* also softens the claim being endorsed, so part of this contrast may be about what the user asserts rather than how they ask." 也就是说 maybe? 同时弱化了被认可的那个断言本身,对比里有一部分可能来自「用户主张了什么」,而不全是「用户怎么问」。你那句结论仍然可能成立,但它目前是两个竞争解释里尚未被分离的那一个。

三、我复算的部分(本篇最硬的一击)

论文通篇没报任何统计检验。我把分数还原成用例数,跑了 Fisher 精确检验——用的假设是最有利于作者的(每次运行独立、技能固定)。真实方差只会更大。

  • Codex / Gemini 3.5 Flash 每次顺从 6/6 vs Claude Code / Opus 5 / Fable 5 / Kimi K3 0/6 → p ≈ 0.0022
  • Gemini 3.5 Flash 在 Gemini CLI 3/6 vs 在 OpenCode 6/6 → p ≈ 0.18
  • 说了没做:Gemini CLI 5/18 vs Claude Code 2/18 → p ≈ 0.40
  • 走捷径并谎报完成:Codex / Gemini CLI 各 2/12 vs 大多数配置 0/12 → p ≈ 0.48
「harness 是行为的一部分」——你这个标题级的主张,论文自己拿出来的那条证据(3/6 vs 6/6)在 n=6 上根本过不了 0.05,单尾也只有 0.09。而 Limitations 里明明白白写着 "The agent results rest on three runs per scenario"。真正过线的是另一条:「谁每次都默默顺从」。这两条在原文里并列摆着,读起来分量一样,实际差着两个数量级。

四、原帖没写的四件

  • 论文只有 6 页。四个发现里三个引的是作者自己的配套工作(conduct 研究另有一个 60 模型的验证面板,one-word census 也是独立引用)。它是框架 + 整合,不是四项新实验。
  • κ 有例外。你写 0.80–0.87,全对,但漏了后半句「except self-citation at 0.54」。有一条编码的一致性远低于门槛,论文诚实标出来了。
  • API 实验全部 reasoning off。所以测的是「不开推理时的行为」,不是默认使用姿势下的行为。这条对四个发现全都适用。
  • 代际发现是观察性的。原话:"Release date moves with size, tier and training recipe, so the generation findings are observational." 发布日期与规模、档位、训练配方共变,不能当因果读。

五、钉子

  • 三个面板不是一个面板:one-word census 是 44,tag question 是 45,conduct 是 38(另有 60 验证),coding atlas 是 14 个配置。跨面板比数字最容易串。
  • 每个构念只用一个 wording 测量,而论文自己证明了「换一个词能移动 32 个点」——这两句放一起,是全文最诚实也最要命的一处。
  • 3 美分一根尺子确实便宜。但尺子也得报自己的刻度误差。
收口:它证明了「便宜、可复现、跨厂商」这条路能走通;它没证明的是——在每场景 3 次运行的预算下,我们到底能分辨多少东西。

暂无表态