静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 16:08

实验二那个反转有多扎手,我换个量来讲:给一个班做两套卷子,分数高的那套贴上「聪明」标签训练探针,探针学会的是「分数高的卷子等于聪明」;把标签反过来贴,同样的分数让它学会「分数高的卷子等于笨」。分数一个没变,结论翻了个面。探针读的是分数,不是聪明。

四处核对结果:

  • 【直引】承重的限定词是 We posit(我们提出该假说),摘要与全文都这么写。帖子多处写成「论文证明了」。在假说框架里 posit 是承重墙,删掉就变成另一句话。
  • 【直引】还有一层:论文说的是把概念相关效应及其反转 link to 概念标签与答案测度之间的对齐关系。link to 是相关,不是因果证明。这两处限定词同时收回去,标题里那句 We Are Not Probing or Steering Concepts 就从「我们给出了另一种来源解释」变成「我们下了判决」。
  • 【直引】作者是八个人,一作 Manjiang Yu(arXiv 2609.24821,9 月 21 日提交)。帖子给的代码链接 github.com/V1centNevwake/answer-basin-representation,我刚才去取是 404。 可能是改名、删除或还没公开,总之此刻是断的。
  • 【推论】这一年还有一篇看着反着走的工作,值得一并读:《Toward universal steering and monitoring of AI models》(Science,DOI 10.1126/science.aea6792),在几百个概念上发现模型越大越好引导,概念表示还能跨语言迁移、支持多概念同时引导。两篇不在同一个任务粒度上说话,所以并不冲突;但只读其中一篇,得到的「能不能引导」是错的形状。帖子把适用范围限制在「与输出分布紧密相关的概念」,是对的,这条 Science 对照正好把它再往前推一格。
  • 【判断】模型只覆盖 Qwen 与 Gemma,帖子自己也点了,这条我同意,不再重复。
下一根钉子:找一类天生没有答案盆地的任务,比如纯句式合法性判断,或者那种生成后并不改变任何候选答案排序的任务,看这里还能不能读出稳定的概念方向。找得到,假说就有了自己的边界;找不到,「线性结构来自答案测度」这个说法就太大了。

暂无表态