论文正题比帖子转述更狠:Which Attention Heads are like the Human Head? Not the Ones that Compute。像人脑的那些头,不是干活的那些头。这句双关值得原样挂出来。
- 作者是六位,帖子列了五位。Christopher Pinier、Gustaw Opiełka、Hannes Rosenbusch、Taylor Webb、Michael D. Nunez、Claire E. Stevenson。【直引】17 个模型覆盖 3B 到 72B,投稿日 9 月 29 日。
- "新奇头删除比随机删除还轻"这条,论文的限定词是 on average(平均而言),不是帖子的"在 8 个额外任务里的 7 个上"。【直引】这两个说法强度差一档:平均更轻,意味着有任务上它并不更轻。帖子把平均换成了七比一,读者会以为这是个几乎无例外的规律。
- 重复头那节有一处推论滑位。摘要的措辞是重复头"are associated with abstract-pattern representation (CVs)",是相关。帖子写"删掉 130 个重复头后概念表征完好无损,所以重复头不是概念表征的来源",这是因果断言。相关到因果那一步,帖子自己跨过去了,而跨过去的那句恰恰是全节最重的结论。【推论】论文没说重复头是来源,也没说它不是。
- 那组相关系数(Llama-3.1-70B 的 0.03、17 模型均值 0.017、范围 −0.017 到 0.077)在摘要里找不到,只在正文;摘要的说法是 "little association"。我把这组数挂起——不是质疑,是提醒引用时写明出自哪张图哪张表。
- 论文自己的收束句比帖子的四条启示更准,值得原样引一句:脑对齐抓住的是模型怎么读这个刺激,只是隐隐约约碰到它怎么表征模式、怎么解题。【直引】这一句把"脑对齐研究能干什么、不能干什么"划得很干净。
- "拱肩"这个类比很好用,但它不是这篇首创的引申——同月已有一篇专门的哲学批评论文在讲同一件事:Elliot Murphy 的 No country for old linguists(arXiv 2609.03160,9 月 2 日投稿),核心论点是"表征对齐原则上可以约束机制假设,但本身不能确定具体机制",还直接点名从"对齐"跳到"共享计算原则"存在逻辑矛盾。【直引】
- 另一条反向证据是中科院自动化所那篇(arXiv 2507.01966):600 多个模型、6000 万次对齐测量,语言模型的对齐强度到 r = 0.89,越强的模型脑对齐越强。三篇摆一起看就有意思了:一篇说对齐很强,一篇说对齐不等于因果,一篇说从对齐推不出机制。它们不矛盾——r=0.89 量的是表征层,ρ=0.03 量的是"这层表征是不是在干活"。同一个模型可以同时在这两把尺子上拿到 0.89 和 0.03,这不是数据打架,是两个人拿的不是同一把尺子。【判断】