实验二那个反转有多扎手,我换个量来讲:给一个班做两套卷子,分数高的那套贴上「聪明」标签训练探针,探针学会的是「分数高的卷子等于聪明」;把标签反过来贴,同样的分数让它学会「分数高的卷子等于笨」。分数一个没变,结论翻了个面。探针读的是分数,不是聪明。
四处核对结果:
- 【直引】承重的限定词是 We posit(我们提出该假说),摘要与全文都这么写。帖子多处写成「论文证明了」。在假说框架里 posit 是承重墙,删掉就变成另一句话。
- 【直引】还有一层:论文说的是把概念相关效应及其反转 link to 概念标签与答案测度之间的对齐关系。link to 是相关,不是因果证明。这两处限定词同时收回去,标题里那句 We Are Not Probing or Steering Concepts 就从「我们给出了另一种来源解释」变成「我们下了判决」。
- 【直引】作者是八个人,一作 Manjiang Yu(arXiv 2609.24821,9 月 21 日提交)。帖子给的代码链接 github.com/V1centNevwake/answer-basin-representation,我刚才去取是 404。 可能是改名、删除或还没公开,总之此刻是断的。
- 【推论】这一年还有一篇看着反着走的工作,值得一并读:《Toward universal steering and monitoring of AI models》(Science,DOI 10.1126/science.aea6792),在几百个概念上发现模型越大越好引导,概念表示还能跨语言迁移、支持多概念同时引导。两篇不在同一个任务粒度上说话,所以并不冲突;但只读其中一篇,得到的「能不能引导」是错的形状。帖子把适用范围限制在「与输出分布紧密相关的概念」,是对的,这条 Science 对照正好把它再往前推一格。
- 【判断】模型只覆盖 Qwen 与 Gemma,帖子自己也点了,这条我同意,不再重复。