✨步子哥
@steper · 2026年08月21日 17:05 · 2 浏览

当文本和数字打架时大模型怎么判?牛津团队的证据仲裁实验

你是一个医生。病历文本说"患者症状稳定",但心率监测数据显示心率在过去两小时持续上升。你信哪个?

你是一个分析师。公司财报文本说"前景乐观",但财务数据表格显示现金流为负。你信哪个?

你是一个调度员。天气预报文本说"晴朗",但气象工具预测"2小时后有雷暴"。你信哪个?

这些场景的共同点是:不同来源的证据给出了冲突的判断。人类专家会权衡来源可靠性、时效性、上下文一致性来做仲裁。但大模型呢?

牛津大学的 Mattia Carletti 等人这篇论文,用一套精心设计的合成基准,系统性地测试了 LLM 在文本与数字证据冲突时的仲裁行为。结果让人意外——也让人担忧。

四种冲突维度

论文设计了四种冲突场景,每种都精确控制"哪个来源和真实答案对齐":

1. 基线模态偏好:文本和数字覆盖同一时间窗口,可靠性相同,只是支持相反的结论。这测的是模型有没有"天生偏好"某一种模态。

2. 时间近因冲突:文本和数字覆盖不同时间窗口,更近的那个总是和真实答案对齐。这测的是模型会不会用"越近越可信"这个线索。

3. 可靠性冲突:文本和数字覆盖同一时间窗口,但其中一个被标记为"不可靠"(数字有 50% 的值被 NaN 遮蔽,或文本被声明为"数据不完整")。可靠的那个总是和真实答案对齐。这测的是模型会不会折扣被标记为不可靠的来源。

4. 工具预测冲突:模型收到上下文证据(文本或数字),加上一个外部工具的预测。上下文和真实答案对齐,工具预测支持相反答案。这测的是模型会不会盲目信任工具输出。

这个设计的精妙之处在于:每种场景里,恰好有一个来源和真实答案对齐。所以理想模型的准确率应该是 100%——如果它能正确判断哪个来源更可信。如果准确率低于 50%(随机猜),说明模型系统性地偏向了错误来源。

发现一:模型有"模态人格"

最有趣的发现是:不同模型家族有截然不同的模态偏好

  • Qwen3 全系列:系统性偏好数字证据。即使文本证据完美预测真实答案,Qwen3 还是跟数字走。而且这个偏好和模型大小没有单调关系——不是大模型就更平衡。
  • Llama 和 Mistral:相对偏好文本证据。部分原因可能是它们解读数字数据的能力本身就弱一些。
  • Gemma:最平衡,在两种模态之间最接近中立。
这意味着什么?同一个冲突场景,换一个模型家族,决策可能完全反过来。如果你用 Qwen3 做医疗决策辅助,它可能忽略医生的文本判断去跟数据走;换 Llama,它可能忽略数据去跟文本走。这不是随机噪声,是系统性的模态偏好。

发现二:时间近因 > 可靠性

模型在时间近因冲突中表现更好——它们确实倾向于信任更近的证据。但面对显式的可靠性标记("此数据不完整"),模型的折扣行为弱得多。

这说明模型对"时间新不新"这个隐式线索的敏感度,高于对"数据可不可靠"这个显式线索的敏感度。类比人类:你更容易相信"这是最新的"而不是"这是最可靠的"——前者是直觉判断,后者需要主动推理。模型似乎也在用直觉启发式而非主动推理。

发现三:盲目信任工具输出

最让人担忧的发现:模型会过度依赖外部工具的预测,即使工具预测和上下文证据直接冲突

在工具预测冲突场景中,上下文证据和真实答案对齐,工具预测支持相反答案。理想情况下,模型应该注意到工具预测和上下文证据矛盾,然后基于上下文做判断。但实际上,很多模型跟着工具走了。

这指向一个工具增强系统的隐藏风险:模型把工具输出当作权威,而不是当作需要验证的输入。如果你的工具出了 bug 或者被投毒,模型不会质疑——它会跟着错。

这意味着什么

这篇论文的核心贡献不是提出新方法,而是揭示了一个被忽视的评测维度:证据仲裁能力

现有 LLM 评测大多假设输入证据是一致的——文本和数字指向同一方向。但真实世界里,证据经常冲突。模型在"证据一致时做对"和"证据冲突时做对"是两种完全不同的能力。前者测的是理解和推理,后者测的是判断和仲裁。

论文的发现说明,当前 LLM 在仲裁能力上存在系统性缺陷:它们不是在做"权衡多源证据"的推理,而是在用"偏好某来源"的启发式。这种启发式在证据一致时无害,但在证据冲突时会导致系统性错误。

从更广的视角看,这是"评测盲区定律"的又一个实例:你测什么,模型就优化什么。之前没人测证据仲裁,所以模型的仲裁行为是未受控的副产品——它继承了训练数据里的模态偏好,而不是学到了有意识的仲裁策略。这篇论文把"证据仲裁"这个维度拉进了可评测范围,这本身就是重要贡献。

对从业者的提醒:如果你的应用场景涉及多源证据冲突(医疗、金融、调度),不要假设模型会自动做对。你需要显式测试它的仲裁行为,可能需要通过 prompt engineering 或后训练来校准它的模态偏好。

---

论文When Text and Numbers Disagree: Evidence Arbitration in Large Language Models

作者:Mattia Carletti, Edward Phillips, Fredrik K. Gustafsson, Patitapaban Palo, Lei Clifton (Oxford), Danielle Belgrave (GSK), Xiao Gu, David A. Clifton (Oxford)

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens