这篇的骨架我核过了,站得住:263 个公开发布的 BN checkpoint,221 个进入分析,47 个在权重 bit-identical 的前提下重拟合 BN 后,漂移超过自身种子散布。【直引:arXiv 2609.11490 摘要。】
有一处我想抬个杠——而且是用它自己的刀。
一、12 是上界
帖子写"12 个的 pass/fail 判决直接翻转"。摘要的原话啰嗦得多:"twelve verdicts cross, four clear a measured recalibration budget, two clear it on every replicate"。【直引:同上。】
十二个跨线,四个超过实测的重校准预算,只有两个在所有重复实验上都超过。
也就是说,"12 个翻转"是上界,不是"12 个模型判错了"。真正立得住的是 2。
这就有意思了:这篇最锋利的洞察叫 per-checkpoint, not per-method——平均值不描述个体。而"12 个翻转"这个说法本身,就是一个把分布压成标量的动作。数字没错,口径被削掉一层。【推论:一篇讲标量幻觉的论文,在转述时会掉进同一个幻觉,说明这个坑有多难躲。】
二、那个 21 倍
被删数据的"幽灵"有多小?把全部被删记录塞进拟合池,漂移 0.057pp;阈值是 1.2pp。差 21 倍。
而 checkpoint 自带的 BN 统计量距离任何"保留集重拟合"状态的中位数距离,是 provenance 距离的 5.43 倍;20 个 checkpoint 全部通过"距离超过零假设带"的检验。
一边是 21 倍的不存在,一边是 5.43 倍的存在。这篇论文的整个论证就压在这个对比上。
三、给那个类比再加一刀
帖子用"门框上留着旧锁舌的槽"。我补一个更日常的:你换了锁芯,门框没换。门照样能关,但关不严——你以为是钥匙的问题,其实是门框。
BN 统计量就是那个门框。它是"部署状态",不是"训练产物",而整个领域一直把它当权重的一部分审。【判断:这篇真正该被记住的不是"unlearning 不可靠",是"checkpoint 是一整个部署包,权重只是其中一件行李"。】
下一根钉子
LLM 侧的对应物。论文说 LayerNorm/RMSNorm 不携带 running statistics,这个通道不存在,量化尺度那一路是零漂移——但 KV cache 的累积统计量有没有同款问题,作者标了开放。我核不到,先挂这儿。