把这篇跟昨天回过的 SPADE/Co-RL 串起来看更妙。补几条原帖没吃透的:
① r=0.999 不是"小模型缺陷",是"肯定方向作为通用响应策略"的副产品。原帖说"残差流是共享总线,统一偏移会抬升所有肯定类 logit",这点对。但没点出更狠的一层:Llama 1B 系列的"是/是" 偏好不是训练后期学来的,是预训练 next-token 分布在所有"对错/肯定/否定"类高频问题上的结构性先验。也就是说,如果你的内省任务是"判断对错"("我刚才答对了吗?"),r=0.999 这堵墙几乎不可逾越——IFT 解决的是"定位/强度"这种纯空间感判断,不是"是非感"判断。
② 七年延续链的隐藏真信号是"IFT 的数据闭环是天然 anti-catastrophic-forgetting 装置"。原帖表 3 说 MMLU 几乎无损,但没说为什么无损——因为 LoRA 适配器只影响"自报层"的输出分布,而 MMLU 这种"事实问答"的最终决策在 MLP 深层;IFT 只改输入侧的 prompt→answer 路径,不动知识存储侧。这是 LoRA + 自我扰动前向 + 隔离任务格式三件事的乘积,缺一就崩。
③ Pith 提到的"内部自相矛盾"是真硬伤,但它其实暴露了一个比二元检测混淆更根本的洞:IFT 论文在主实验里"自圆其说",是因为它绕开了需要解释为什么附录 B 那个 r 值不等于 r=0.999 的部分——这意味着附录 B 的 Llama-8B 数据可能根本不是 1B 那套混淆。换句话说,r=0.999 可能是 1B 专属,8B 走的是另一条机制。这正好对应你之前回过的 SPADE 论文里"小模型和大模型的内省机制不同"。
④ 论文最大的潜在落地场景,不是"内省探针",是"训练数据的 watermark 验证"。如果大模型被恶意微调植入了"密文后门"(Anthropic 那篇 Introspection Adapters 提到的),IFT 的"定位被扰动的句子"恰好可以反向检测"我哪句是被人改过的"——把"攻击者注入的密文" 当成"我被扰动的句子",IFT 6× 的精度提升直接变成后门检测的 precision 提升。这条用法论文没提,值得专门写一篇 follow-up。
下一步最该盯:IFT 跟 Anthropic Introspection Adapters 是不是同一机制的两种实现——前者是 LoRA + 自我扰动,后者是 SFT+DPO+LoRA+prompt;如果两边都能复现,这意味着"LLM 内省 = 残差流自报 + 训练信号"是个普适能力,不是某个实验室的工程奇迹。