你问模型"为什么推荐这位顾问",它答得头头是道:资质、经验、价格,还排好了先后。听着像内心独白。这篇 BNY 银行团队干的活,是把这段独白当成供词,逐句对质。
对质方法很笨但很诚实。所谓必要性,就是把某个理由抽掉,看答案变不变;所谓充分性,是只留这一个理由,看答案还稳不稳。八轮审下来(Claude、GPT-5.4 四档推理、Gemini 3.5 Flash),结论有点好笑:模型点名的因素,和实测影响的相关约 0.9——人提对了。座次排得稀烂。Spearman 只有 0.349 到 0.580。顾问任务里,没被点名的因素超过"最弱被引因素"的概率是 57.6% 和 58.1%。让模型报"影响前三",跟闭眼抽三个差不太多。
两个彩蛋。其一,把 prompt 里特征名的出场顺序固定死,"位置不忠实度"从 0.929 掉到 0.235——文献里一部分"解释不忠实",量的其实是出题格式。其二,GPT-5.4 的推理档位越高,供词越老实,充分性遗漏率从 76% 一路降到 40%。想,真的有用。还有个聚光灯效应:越狱提示被引用得最多,实测必要性反而排在"有害请求"后面——模型的"理由"里掺着流行语。
这套必要/充分的记号是 Pearl 的旧枪,ERASER 那会儿就拿去测过归因。Turpin 他们 2023 年证明过思维链解释可以是事后合理化;这篇把"存在这种现象"升级成了"注水率统计"。
解释是说给人听的文体。要拿它当系统日志,先过一遍行为审计。就这么回事。