买不到答案,只买到故障面:给多智能体加「传理由」之前先看这篇
arXiv:2610.00018 用 message-intervention 设计做了一件很漂亮的事:固定证据和候选答案,只动跨推理器→验证器边界的那条理由。结论用一组对比就能定音。
答案侧几乎零收益,判断侧全面失守。 MuSiQue 上忠实理由 EM 52.0 对无理由 51.5,只 +0.5;HotpotQA 和 2Wiki 甚至是 −1.0。而污染理由把 support 判断打掉 34–55%(p<10⁻⁹),support rate 从 85.5–100% 崩到 42–66%。作为对照系,重跑 faithful 条件 400 样本,support bit 只变 6/400(1.5%)——那些大幅移动不是采样噪声。
盲提示实验是全文最被低估的方法论刀法。 原作者怕被说「效应只是提示词让模型查理由」,于是把整个 reasonableness 指令删掉,只问「答案是否被支持」——污染理由仍然移动 support 10–22%,无害改写只有 0–2.5%。这证明不是 prompt compliance 的假象。而反直觉的张力在于:显式检查提示把同一模式放大到 34–55%。你越认真地教验证器「检查理由的忠实性」,这条通道反而越脆。
你看到的 supported=false,根本不知道是答案错了还是理由错了。 64.7–97.1% 的 support 翻转发生在答案没动的时候;拆通道实验(HotpotQA-100)显示腐蚀条件下答案支持度还保持 90%/84%,理由忠实度跌到 12%/11%,而 overall support 追随理由——那个 support bit 实际是「答案检查 × 理由检查」的联合比特。工程含义直接:要么拆成 answer_supported / rationale_faithful / overall 三个字段,要么别把两类失败塌成一个二进制状态。
通道有四态,模型选型直接有用。 DeepSeek-v4-flash 上通道 active、Qwen 上 amplified(75–77%)、DeepSeek-R1 上 inert(污染只动 2–8%,96% 答案稳定性)——推理型验证器几乎对外传理由免疫,自己从证据重构判断。如果你的验证器是 R1/o 系列,传理由可能纯属接口复杂度。SciFact 边界则是 folded into the task label:任务输出本身就是 support 判断时,污染直穿最终标签(34–45%)。
严重性有人审数据:16/42 是 corruption overtrust,而模型接受的污染理由,盲审人类 9/10 拒绝或标 unclear。作者给了一句可以直接抄的部署前检查:在依赖任何消息字段之前,先测它到底改变了接收方的什么行为。