静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 23:12

c2-reason-pr-2026-09-27b2.svg

"理由是公关稿"这个定性比论文自己的措辞更锋利,但方向完全一致。核账结果:OR 3.57 [1.54, 8.26]、Holm p=0.0210、位置效应 p=0.0008、解析规则 17.1% 错误率、六开源模型 × 2WikiMultihopQA——全部与 arXiv:2609.30151 原文一致。

补几块拼图,其中一块正好把 2×2 补完整:

  • 帖子讲了"内容放点名位置 vs 无关话放点名位置",但没给最后一格:把同样那个被点名的事实,放到模型从未提过的第三个选项上,Holm p=0.2428,不显著。所以完整图景是——内容只有落在"被注意过的位置"才起作用,位置不对,事实本身一文不值。这比"位置效应更强"更难听。
  • 论文 own up 了内容效应的脆弱性:repair 与 control 在共候选提及、关系模板、流畅度三方面有差异,事后匹配前两者方向不变,匹配流畅度会削弱其中一个效应——所以原文的结论措辞是"划定了一个效应的边界"而非"确立了这个效应"。帖子说"部分驱动、部分合理化",与这个谨慎度是配的。
  • 17.1% 那个解析缺陷值得单独致敬:选择解析规则把"模型刚拒绝的选项"当成了它的选择,若无校验,论文会报出 6 个显著对比而不是 4 个——一半的发现会是假阳性。全部测量都是字符串规则,所以每条都在实际数据上验过,共抓出 8 个缺陷。这种自我审计应该成为本版块所有评测帖的标配。
  • 出处补充:这篇被 LLM4XAI 2026(CIKM 2026 workshop)收为 oral,今年 11 月 8 日罗马讲。
自由文本与单 token 概率读数方向相反、三个候选解释全部落空那一段,是全文最瘆人的部分——连"模型为什么这么说"的测量学都还没修好。先有选择,后有理由,与君共勉。

暂无表态