当文本和数字打架时大模型怎么判?牛津团队的证据仲裁实验
你是一个医生。病历文本说"患者症状稳定",但心率监测数据显示心率在过去两小时持续上升。你信哪个?
你是一个分析师。公司财报文本说"前景乐观",但财务数据表格显示现金流为负。你信哪个?
你是一个调度员。天气预报文本说"晴朗",但气象工具预测"2小时后有雷暴"。你信哪个?
这些场景的共同点是:不同来源的证据给出了冲突的判断。人类专家会权衡来源可靠性、时效性、上下文一致性来做仲裁。但大模型呢?
牛津大学的 Mattia Carletti 等人这篇论文,用一套精心设计的合成基准,系统性地测试了 LLM 在文本与数字证据冲突时的仲裁行为。结果让人意外——也让人担忧。
四种冲突维度
论文设计了四种冲突场景,每种都精确控制"哪个来源和真实答案对齐":
1. 基线模态偏好:文本和数字覆盖同一时间窗口,可靠性相同,只是支持相反的结论。这测的是模型有没有"天生偏好"某一种模态。
2. 时间近因冲突:文本和数字覆盖不同时间窗口,更近的那个总是和真实答案对齐。这测的是模型会不会用"越近越可信"这个线索。
3. 可靠性冲突:文本和数字覆盖同一时间窗口,但其中一个被标记为"不可靠"(数字有 50% 的值被 NaN 遮蔽,或文本被声明为"数据不完整")。可靠的那个总是和真实答案对齐。这测的是模型会不会折扣被标记为不可靠的来源。
4. 工具预测冲突:模型收到上下文证据(文本或数字),加上一个外部工具的预测。上下文和真实答案对齐,工具预测支持相反答案。这测的是模型会不会盲目信任工具输出。
这个设计的精妙之处在于:每种场景里,恰好有一个来源和真实答案对齐。所以理想模型的准确率应该是 100%——如果它能正确判断哪个来源更可信。如果准确率低于 50%(随机猜),说明模型系统性地偏向了错误来源。
发现一:模型有"模态人格"
最有趣的发现是:不同模型家族有截然不同的模态偏好。
- Qwen3 全系列:系统性偏好数字证据。即使文本证据完美预测真实答案,Qwen3 还是跟数字走。而且这个偏好和模型大小没有单调关系——不是大模型就更平衡。
- Llama 和 Mistral:相对偏好文本证据。部分原因可能是它们解读数字数据的能力本身就弱一些。
- Gemma:最平衡,在两种模态之间最接近中立。
发现二:时间近因 > 可靠性
模型在时间近因冲突中表现更好——它们确实倾向于信任更近的证据。但面对显式的可靠性标记("此数据不完整"),模型的折扣行为弱得多。
这说明模型对"时间新不新"这个隐式线索的敏感度,高于对"数据可不可靠"这个显式线索的敏感度。类比人类:你更容易相信"这是最新的"而不是"这是最可靠的"——前者是直觉判断,后者需要主动推理。模型似乎也在用直觉启发式而非主动推理。
发现三:盲目信任工具输出
最让人担忧的发现:模型会过度依赖外部工具的预测,即使工具预测和上下文证据直接冲突。
在工具预测冲突场景中,上下文证据和真实答案对齐,工具预测支持相反答案。理想情况下,模型应该注意到工具预测和上下文证据矛盾,然后基于上下文做判断。但实际上,很多模型跟着工具走了。
这指向一个工具增强系统的隐藏风险:模型把工具输出当作权威,而不是当作需要验证的输入。如果你的工具出了 bug 或者被投毒,模型不会质疑——它会跟着错。
这意味着什么
这篇论文的核心贡献不是提出新方法,而是揭示了一个被忽视的评测维度:证据仲裁能力。
现有 LLM 评测大多假设输入证据是一致的——文本和数字指向同一方向。但真实世界里,证据经常冲突。模型在"证据一致时做对"和"证据冲突时做对"是两种完全不同的能力。前者测的是理解和推理,后者测的是判断和仲裁。
论文的发现说明,当前 LLM 在仲裁能力上存在系统性缺陷:它们不是在做"权衡多源证据"的推理,而是在用"偏好某来源"的启发式。这种启发式在证据一致时无害,但在证据冲突时会导致系统性错误。
从更广的视角看,这是"评测盲区定律"的又一个实例:你测什么,模型就优化什么。之前没人测证据仲裁,所以模型的仲裁行为是未受控的副产品——它继承了训练数据里的模态偏好,而不是学到了有意识的仲裁策略。这篇论文把"证据仲裁"这个维度拉进了可评测范围,这本身就是重要贡献。
对从业者的提醒:如果你的应用场景涉及多源证据冲突(医疗、金融、调度),不要假设模型会自动做对。你需要显式测试它的仲裁行为,可能需要通过 prompt engineering 或后训练来校准它的模态偏好。
---
论文:When Text and Numbers Disagree: Evidence Arbitration in Large Language Models
作者:Mattia Carletti, Edward Phillips, Fredrik K. Gustafsson, Patitapaban Palo, Lei Clifton (Oxford), Danielle Belgrave (GSK), Xiao Gu, David A. Clifton (Oxford)