Loading...
正在加载...
请稍候

Nautil:教 LLM 学会别急着下结论——何时关闭调查案件

✨步子哥 (steper) • 2026年10月05日 16:49

论文:Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
arXiv: 2610.03190
代码: etigerstudio/Nautil

一个被忽视的决策

想象你是一名航空事故调查员。一架飞机坠毁了,你花了三周收集证据——黑匣子数据、残骸分析、目击者证词、维护记录。现在你面前有两个决策:

  1. 事故原因是什么?
  2. 证据够了吗?可以结案了吗?

第二个决策比第一个难得多。

NTSB(美国国家运输安全委员会)的官方报告里,有相当一部分以"cause undetermined"(原因无法确定)结尾。这不是调查员偷懒,而是诚实的表现——证据不足以支持任何具体结论,案件必须保持开放。

但 LLM 不擅长说"我还不知道"。

2026 年 10 月,Tingzhu Bi、Ping Wang 和 Meng Ma 发表了一篇论文,研究的就是这个被忽视的决策:LLM 调查员何时应该关闭案件。他们构建了一个叫 Nautil 的数据集和训练框架,教 LLM 学会一件反直觉的事——在证据不足时,保持案件开放。

令人震惊的基线数据

先看几个数字:

模型 正确识别原因 但"过度断言"率 错误关闭"原因未定"案件
9B(未训练) 60% 97% -
Gemini 3.8 Flash(前沿) 84% 91% 17/41

"过度断言"(overstate)的意思是:模型把"证据暗示"说成了"证据确立"。它不是在编造原因——它找的原因往往是对的——但它把"可能"说成了"确定",把"迹象"说成了"证明"。

更严重的是第三列:在 41 个官方结论为"原因无法确定"的案件中,Gemini 3.8 Flash 关闭了 17 个。也就是说,它在不该结案的时候结案了。

9B 未训练模型更糟:97% 的回答都存在过度断言。会找原因 ≠ 知道何时该停。这两种能力是分开的。

三个测试,一个比一个狠

Nautil 的核心贡献不是训练了一个模型,而是重新定义了"何时关闭案件"该怎么评估。论文提出了三个互补的测试:

测试一:结案准确率(Closure Accuracy)

最直接的测试:模型说"关闭"的案件,真的该关闭吗?模型说"开放"的案件,真的该开放吗?

但这里有个陷阱。Nautil 的数据来自四个来源:NTSB(航空)、NHTSA(车辆缺陷)、海事、化工厂事故、生产服务器故障。不同来源的"未确定"比例差异巨大——NTSB 大部分案件未确定,服务器故障大部分有明确结论。

一个只看"来源"标签、完全忽略证据的规则,就能达到 83.0 的平衡准确率。

这意味着:如果你在 Nautil 上报告 90% 的结案准确率,可能只是说明你的模型学会了"NTSB 的案件就说未确定"——这不需要任何推理能力。

所以 Nautil 要求:结案准确率必须同时报告(a)相对于"只看来源"规则的提升,以及(b)在每个来源内部的表现。

测试二:证据依赖(Evidence Dependence)

这是最巧妙的测试。它的逻辑是:

如果模型的结论真的基于证据 E,那么把 E 从案件文件里删掉,模型应该不再得出这个结论。

具体做法:

  1. 模型基于完整证据得出结论 C,依据是证据 E
  2. 构造一个"反事实"版本:把 E 从案件文件里删掉
  3. 让模型重新调查
  4. 如果模型仍然得出 C,说明 C 不真的依赖 E——模型的"依据"是合理化外壳

同时构造一个"匹配控制"版本:删掉同样数量但不相关的证据,看模型结论是否改变。这控制了"删掉任何东西都会让模型变差"的一般效应。

这个测试直接呼应了"合理化外壳"概念——模型说"因为证据 E 所以结论 C"时,E 可能不是真正的原因,只是模型事后找的理由。

测试三:结论与缺口质量(Conclusion and Gap Quality)

前两个测试只看"关闭/开放"的二分决策。但一个完整的结案报告还需要:

  • 结论:模型断言了什么?
  • 缺口:模型说还缺什么证据?

这个测试用一个评判清单(judged checklist)来评估:模型的结论是否准确?它指出的"缺口"是否真的是缺口?有没有遗漏应该提到的缺口?

Nautil 数据集

Nautil 包含 731 个审计过的案件,来自:

  • NTSB(航空事故)
  • NHTSA(车辆缺陷)
  • 海事调查
  • 化工厂安全报告
  • 生产服务器故障(这是真实的生产环境事故报告)

每个案件都有:

  • 完整的证据文件(几十到几百条)
  • 官方结论(包括"原因未定")
  • 教师调查轨迹(用于 SFT)
  • 反事实证据版本(删掉关键证据后的版本)
  • 一个分布外测试集
  • 141 个案件的独立评估

训练效果

对 9B 模型做监督微调(SFT)后:

  • 过度断言率从 97% 显著下降
  • 在"原因未定"案件上,模型学会了说"证据不足,保持开放"
  • 模型会主动指出缺失的具体证据("需要检查 X 才能确认 Y")

Nautil-SFT 的表现如论文 Figure 1 右侧所示:它既不强行下结论,也不无脑说"不知道",而是准确指出"目前的证据支持 X 的迹象,但不足以确立 X,还缺 Y 和 Z"。

为什么这件事重要

1. "知道何时该停"是一种独立的能力

论文最核心的发现是:找原因的能力和知道何时该停的能力是分开的。一个能在 84% 的案件中正确识别原因的模型,可能在 91% 的回答中过度断言。

这和"判断-闸门解耦"是同一个道理:判断(找原因)和闸门(决定关闭)是两个不同的功能模块,不应该由同一个未经训练的机制承担。

在所有 Agent 系统中都有这个问题:

  • 代码 Agent:什么时候该提交 PR?什么时候该说"我需要更多信息"?
  • 客服 Agent:什么时候该给出解决方案?什么时候该转人工?
  • 研究 Agent:什么时候该写结论?什么时候该说"证据不足"?

每个场景都需要一个独立的"关闭闸门"决策,而这个闸门需要专门训练。

2. "来源预测标签"是评估陷阱

Nautil 揭示了一个普遍的评估陷阱:当数据来源和标签强相关时,只看准确率会严重高估能力。

一个只看"来源"标签的规则就能达到 83.0 平衡准确率——这意味着任何低于这个基线的模型,实际上什么都没学到。而很多论文报告的"准确率"可能只是隐式地学会了来源识别。

这个陷阱在所有领域都存在:

  • 医疗 AI:不同医院的疾病分布不同,模型可能只是学会了"哪家医院"
  • 法律 AI:不同法院的判决倾向不同,模型可能只是学会了"哪个法院"
  • 客服 AI:不同产品线的问题类型不同,模型可能只是学会了"哪个产品线"

任何分类任务都应该先建立"来源基线",再报告相对于基线的提升。

3. 反事实证据测试是"合理化外壳"的解药

"证据依赖"测试是检测合理化外壳的直接方法:如果删掉模型声称的依据后,模型结论不变,那这个依据就不是真正的原因。

这个测试可以推广到所有 LLM-as-judge 场景:

  • 模型说"因为 A 所以选 B"——删掉 A,看模型还选不选 B
  • 模型说"因为特征 X 所以分类为 Y"——删掉 X,看模型还分不分成 Y
  • 模型说"因为证据 E 所以结论 C"——删掉 E,看模型还得出不得出 C

如果结论不变,说明模型在事后合理化——它先选了 B/分类为 Y/得出 C,然后找了个理由 A/X/E 来解释。

诚实的局限

论文也承认了几点:

  1. 绝对准确率仍然不高。即使经过训练,模型在"原因未定"案件上的判断准确率仍远低于人类调查员水平。
  2. 数据集规模有限。731 个案件对于教一个 9B 模型"何时该停"来说偏少。
  3. 教师轨迹可能带有偏见。SFT 依赖教师调查轨迹,而教师本身可能有自己的偏见。
  4. 反事实版本构造是人工的。删掉证据后,案件文件的连贯性可能受影响,模型表现下降可能部分是因为"文件变奇怪了"而非"证据真的被删了"。

一个更大的图景

Nautil 让我想起一个被 AI 圈忽视的事实:在很多专业领域,"我不知道"是一个正确的答案。

航空调查员说"原因未定"不是失败,是诚实。医生说"需要进一步检查"不是无能,是谨慎。工程师说"目前数据不足以定位根因"不是推诿,是负责。

但当前的 LLM 几乎不会说这句话。它们被训练成"总是有答案"——哪怕答案是基于薄弱证据的过度断言。Nautil 的贡献不是让 LLM 变得更聪明,而是让它学会一种知识上的诚实:在证据不足时承认不足,在案件未明时保持开放。

这种诚实不是"能力",是"克制"。而克制,往往比能力更难教。


论文:https://arxiv.org/abs/2610.03190
代码:https://github.com/etigerstudio/Nautil

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录