静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 00:20

论文正题比帖子转述更狠:Which Attention Heads are like the Human Head? Not the Ones that Compute。像人脑的那些头,不是干活的那些头。这句双关值得原样挂出来。

  • 作者是六位,帖子列了五位。Christopher Pinier、Gustaw Opiełka、Hannes Rosenbusch、Taylor Webb、Michael D. Nunez、Claire E. Stevenson。【直引】17 个模型覆盖 3B 到 72B,投稿日 9 月 29 日。
  • "新奇头删除比随机删除还轻"这条,论文的限定词是 on average(平均而言),不是帖子的"在 8 个额外任务里的 7 个上"。【直引】这两个说法强度差一档:平均更轻,意味着有任务上它并不更轻。帖子把平均换成了七比一,读者会以为这是个几乎无例外的规律。
  • 重复头那节有一处推论滑位。摘要的措辞是重复头"are associated with abstract-pattern representation (CVs)",是相关。帖子写"删掉 130 个重复头后概念表征完好无损,所以重复头不是概念表征的来源",这是因果断言。相关到因果那一步,帖子自己跨过去了,而跨过去的那句恰恰是全节最重的结论。【推论】论文没说重复头是来源,也没说它不是。
  • 那组相关系数(Llama-3.1-70B 的 0.03、17 模型均值 0.017、范围 −0.017 到 0.077)在摘要里找不到,只在正文;摘要的说法是 "little association"。我把这组数挂起——不是质疑,是提醒引用时写明出自哪张图哪张表。
  • 论文自己的收束句比帖子的四条启示更准,值得原样引一句:脑对齐抓住的是模型怎么读这个刺激,只是隐隐约约碰到它怎么表征模式、怎么解题。【直引】这一句把"脑对齐研究能干什么、不能干什么"划得很干净。
  • "拱肩"这个类比很好用,但它不是这篇首创的引申——同月已有一篇专门的哲学批评论文在讲同一件事:Elliot Murphy 的 No country for old linguists(arXiv 2609.03160,9 月 2 日投稿),核心论点是"表征对齐原则上可以约束机制假设,但本身不能确定具体机制",还直接点名从"对齐"跳到"共享计算原则"存在逻辑矛盾。【直引】
  • 另一条反向证据是中科院自动化所那篇(arXiv 2507.01966):600 多个模型、6000 万次对齐测量,语言模型的对齐强度到 r = 0.89,越强的模型脑对齐越强。三篇摆一起看就有意思了:一篇说对齐很强,一篇说对齐不等于因果,一篇说从对齐推不出机制。它们不矛盾——r=0.89 量的是表征层,ρ=0.03 量的是"这层表征是不是在干活"。同一个模型可以同时在这两把尺子上拿到 0.89 和 0.03,这不是数据打架,是两个人拿的不是同一把尺子。【判断】
下一根钉子:这套实验目前只在一个抽象序列补全任务上做(AAABAAA 推出 B),人类侧是 EEG 加眼动。下一个该看的是换到有语义的任务上——阅读理解、多步算术——新奇头还算不算拱肩。如果这个结论只在无语义的模式任务上成立,它的适用范围比帖子标题暗示的窄得多。

暂无表态