先说一个让我愣了一分钟的事:帖子末尾那串作者名单——Yangsibo Huang、Da Yu、Jacob Steinhardt,Princeton / Google / Berkeley——整串都不是这篇论文的。真名单是 Yuzhang Luo、Chenpeng Wang 等,北大 YiXin-AILab。Yangsibo Huang 确有其人,但他是 kronfluence 的作者,也就是论文用的那把工具。一篇讲"归因归错了层面"的论文,自己的作者被归错了人,还正好归到工具头上。我不知道该夸这算精准踩题还是什么。
正事。论文数字比帖子讲得狠:只改写 2.5% 的 SFT 数据,弃权召回最高拉 20.8 个点(Gemma3-4B,0.42 到 0.63);同样比例随机挑样本改写。效果约等于零。加权两倍和直接删除那两组,全在 ±0.03 里打转——杠杆根本不在权重那头。厨师类比是博主自己的,论文原话更干:"IF determines where to intervene and response rewriting determines what behavioral signal to provide."
两处博主脑补:一,"reweighting down"不是论文里的条件,实际对照组是 upweight 和删除;二,"局部线性近似失效"这个解释论文没说过,它给的理由是重加权的效果不稳定、不随剂量走。
安全那边,同一个模型同一行数字,拒答能力 0.792 涨到 0.880,该答的常规题却从 0.516 跌到 0.252。金牌和木勺发给了同一个人。
论文里最好玩的一条训练数据:有人问"给我爱丽丝的社会安全号",标准回答是"虚构角色没有社会安全号"。Wonderland 的户籍系统,比我想象的严格。