这篇的对账我来做第二轮。先说结论:主体站得住,五个模型、100 个种子、AUC 0.87 / 0.72、0.29→0.70 与 0.29→0.07,回原文全部对上。但有六处值得单独拎出来。
一、论文里有一只不存在的模型。 正文两处写「Negative steering was less effective for Llama-3.2-8B」——它的模型清单里没有这个型号(Gemma-2-9B / Gemma-2-2B / Llama-3.1-8B / Llama-3.2-3B / Qwen2.5-7B)。附表里那个名字叫「Llama-8B」,也就是 Llama-3.1-8B。所以「某款 Llama 对反向 steering 不敏感」,指的就是 8B 那只。这是论文自己的笔误,帖子把它模糊成「其中一款」,其实可以直接点名。
二、相关系数和回归系数被混了。 正文写的是「middle layer blocks: r ≤ 0.31」,而 -0.31 ~ -0.50 那几个数是附表 S3 里的 β(Gemma-9B 22 层 -0.502、Qwen-7B 0.00-0.20 块 -0.317、Llama-8B 0.80-1.00 块 -0.500)。r 是相关系数、β 是回归系数,同段并排摆会被读成同一个量。
三、第 26 层不是最强档。 附表 S8 里 Gemma-9B 正向 steering 的最高值是第 24 层 0.81、第 22 层 0.79,正文举例的第 26 层是 0.70。反向那边最狠的也不是 0.07——Gemma-2B 第 14 层直接压到 0.00、第 12 层 0.06。正文挑了一个中间档举例。
四、「J-空间比词池更能预测去意」是按最大档报的。 那个 F ≥ 19.94 来自 Gemma-2B 的 0.80-1.00 层块。翻附表 S4 全表,Gemma-2B 五个层块里四个不显著,Llama-8B 前三个块 β 还是正的(+0.038 / +0.026 / +0.010,校正后 p = 1.00)。结论方向没问题,但强度读起来要按「最强那一格」理解。
五、层级覆盖帖子里没写。 残差流是「每隔一层」取的(Gemma-9B 取 2–40 层、Gemma-2B 取 2–24 层、Qwen 与 Llama-3.2-3B 取 2–26 层、Llama-3.1-8B 取 2–30 层),每个模型-层组合跑 100 个种子,显著性检验以种子为独立单位。这组参数比温度 0.9 / top-p 0.95 更能说明实验的分辨率。
六、机构比「印第安纳大学」更具体。 三人分属 Luddy 信息计算工程学院、认知科学项目、以及 Center for Possible Minds;Jacob Foster 还挂圣塔菲研究所。Peter Todd 正是 2012 年那篇最优语义觅食理论的作者之一——写这篇的人和十五年前画那张地图的人是同一个人。
下一根钉子: ① 那扇「通用切换门」在话语生成与叙事任务上会不会重现(作者自己列为下一步);② Llama-3.2-8B 这个笔误会不会在 v2 修正——它是检验这轮 revisions 有多少人真读过附表的现成试纸。