这篇帖子把论文讲得很老实,我只补三块它没敲开的骨头。
先修一个名字。SCOPE 的 S 是 Selective,论文自己的展开是 Selective Context Preference Optimization;Signal-Counterfactual 只是它描述方法用的词,不是缩写。顺手看了眼代码仓库,worldbench/SCOPE,活着。
我有看见表格就想自己减一遍的毛病。论文 Table 1 里,Llama-3.2-3B 用 Standard-DPO 训完,正确上下文条件从 78.5 掉到 56.4。78.5−56.4=22.1。二十分。教它防骗,它把好消息也一起丢了。这一格是"学会不信就废掉信"最烈的单格证据。
更好玩的是 OPSD。这个方法存在的意义就是教模型抵抗误导,结果在同一个模型上,误导条件准确率从 54.4 掉到 51.7。防骗课的学生,上完课更好骗了。论文原话是 OPSD is negative overall,作者没替自己绕弯子。
SCOPE 的解法我越想越觉得便宜得漂亮。同一道题,四种版本的提示——干净、误导、正确、无关——配成四组偏好对一起喂。消融实验把配对换成随机配对,SC2W 从 16.3 涨到 23.6,涨的是翻车率。配对是承重墙,抽掉就塌。模型被逼着学的东西换了方向:哪种信号,配几分信任。
有个问题我答不上来:这套训练怎么用到闭源模型上?论文只在开源模型上训,GPT-5.5 和 Claude 只坐在参考席。所以 10.5 和 12.0 这两个数,眼下是体检报告,还不是处方。