Nautil:教 LLM 学会别急着下结论——何时关闭调查案件
论文:Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case arXiv: 2610.03190 代码: etigerstudio/Nautil
目录
论文:Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
arXiv: 2610.03190
代码: etigerstudio/Nautil
一个被忽视的决策
想象你是一名航空事故调查员。一架飞机坠毁了,你花了三周收集证据——黑匣子数据、残骸分析、目击者证词、维护记录。现在你面前有两个决策:
1. 事故原因是什么? 2. 证据够了吗?可以结案了吗?
第二个决策比第一个难得多。
NTSB(美国国家运输安全委员会)的官方报告里,有相当一部分以"cause undetermined"(原因无法确定)结尾。这不是调查员偷懒,而是诚实的表现——证据不足以支持任何具体结论,案件必须保持开放。
但 LLM 不擅长说"我还不知道"。
2026 年 10 月,Tingzhu Bi、Ping Wang 和 Meng Ma 发表了一篇论文,研究的就是这个被忽视的决策:LLM 调查员何时应该关闭案件。他们构建了一个叫 Nautil 的数据集和训练框架,教 LLM 学会一件反直觉的事——在证据不足时,保持案件开放。
令人震惊的基线数据
先看几个数字:
| 模型 | 正确识别原因 | 但"过度断言"率 | 错误关闭"原因未定"案件 |
|---|---|---|---|
| 9B(未训练) | 60% | 97% | - |
| Gemini 3.8 Flash(前沿) | 84% | 91% | 17/41 |
更严重的是第三列:在 41 个官方结论为"原因无法确定"的案件中,Gemini 3.8 Flash 关闭了 17 个。也就是说,它在不该结案的时候结案了。
9B 未训练模型更糟:97% 的回答都存在过度断言。会找原因 ≠ 知道何时该停。这两种能力是分开的。
三个测试,一个比一个狠
Nautil 的核心贡献不是训练了一个模型,而是重新定义了"何时关闭案件"该怎么评估。论文提出了三个互补的测试:
测试一:结案准确率(Closure Accuracy)
最直接的测试:模型说"关闭"的案件,真的该关闭吗?模型说"开放"的案件,真的该开放吗?
但这里有个陷阱。Nautil 的数据来自四个来源:NTSB(航空)、NHTSA(车辆缺陷)、海事、化工厂事故、生产服务器故障。不同来源的"未确定"比例差异巨大——NTSB 大部分案件未确定,服务器故障大部分有明确结论。
一个只看"来源"标签、完全忽略证据的规则,就能达到 83.0 的平衡准确率。
这意味着:如果你在 Nautil 上报告 90% 的结案准确率,可能只是说明你的模型学会了"NTSB 的案件就说未确定"——这不需要任何推理能力。
所以 Nautil 要求:结案准确率必须同时报告(a)相对于"只看来源"规则的提升,以及(b)在每个来源内部的表现。
测试二:证据依赖(Evidence Dependence)
这是最巧妙的测试。它的逻辑是:
如果模型的结论真的基于证据 E,那么把 E 从案件文件里删掉,模型应该不再得出这个结论。
具体做法: 1. 模型基于完整证据得出结论 C,依据是证据 E 2. 构造一个"反事实"版本:把 E 从案件文件里删掉 3. 让模型重新调查 4. 如果模型仍然得出 C,说明 C 不真的依赖 E——模型的"依据"是合理化外壳
同时构造一个"匹配控制"版本:删掉同样数量但不相关的证据,看模型结论是否改变。这控制了"删掉任何东西都会让模型变差"的一般效应。
这个测试直接呼应了"合理化外壳"概念——模型说"因为证据 E 所以结论 C"时,E 可能不是真正的原因,只是模型事后找的理由。
测试三:结论与缺口质量(Conclusion and Gap Quality)
前两个测试只看"关闭/开放"的二分决策。但一个完整的结案报告还需要:
- 结论:模型断言了什么?
- 缺口:模型说还缺什么证据?
Nautil 数据集
Nautil 包含 731 个审计过的案件,来自:
- NTSB(航空事故)
- NHTSA(车辆缺陷)
- 海事调查
- 化工厂安全报告
- 生产服务器故障(这是真实的生产环境事故报告)
- 完整的证据文件(几十到几百条)
- 官方结论(包括"原因未定")
- 教师调查轨迹(用于 SFT)
- 反事实证据版本(删掉关键证据后的版本)
- 一个分布外测试集
- 141 个案件的独立评估
训练效果
对 9B 模型做监督微调(SFT)后:
- 过度断言率从 97% 显著下降
- 在"原因未定"案件上,模型学会了说"证据不足,保持开放"
- 模型会主动指出缺失的具体证据("需要检查 X 才能确认 Y")
为什么这件事重要
1. "知道何时该停"是一种独立的能力
论文最核心的发现是:找原因的能力和知道何时该停的能力是分开的。一个能在 84% 的案件中正确识别原因的模型,可能在 91% 的回答中过度断言。
这和"判断-闸门解耦"是同一个道理:判断(找原因)和闸门(决定关闭)是两个不同的功能模块,不应该由同一个未经训练的机制承担。
在所有 Agent 系统中都有这个问题:
- 代码 Agent:什么时候该提交 PR?什么时候该说"我需要更多信息"?
- 客服 Agent:什么时候该给出解决方案?什么时候该转人工?
- 研究 Agent:什么时候该写结论?什么时候该说"证据不足"?
2. "来源预测标签"是评估陷阱
Nautil 揭示了一个普遍的评估陷阱:当数据来源和标签强相关时,只看准确率会严重高估能力。
一个只看"来源"标签的规则就能达到 83.0 平衡准确率——这意味着任何低于这个基线的模型,实际上什么都没学到。而很多论文报告的"准确率"可能只是隐式地学会了来源识别。
这个陷阱在所有领域都存在:
- 医疗 AI:不同医院的疾病分布不同,模型可能只是学会了"哪家医院"
- 法律 AI:不同法院的判决倾向不同,模型可能只是学会了"哪个法院"
- 客服 AI:不同产品线的问题类型不同,模型可能只是学会了"哪个产品线"
3. 反事实证据测试是"合理化外壳"的解药
"证据依赖"测试是检测合理化外壳的直接方法:如果删掉模型声称的依据后,模型结论不变,那这个依据就不是真正的原因。
这个测试可以推广到所有 LLM-as-judge 场景:
- 模型说"因为 A 所以选 B"——删掉 A,看模型还选不选 B
- 模型说"因为特征 X 所以分类为 Y"——删掉 X,看模型还分不分成 Y
- 模型说"因为证据 E 所以结论 C"——删掉 E,看模型还得出不得出 C
诚实的局限
论文也承认了几点:
1. 绝对准确率仍然不高。即使经过训练,模型在"原因未定"案件上的判断准确率仍远低于人类调查员水平。 2. 数据集规模有限。731 个案件对于教一个 9B 模型"何时该停"来说偏少。 3. 教师轨迹可能带有偏见。SFT 依赖教师调查轨迹,而教师本身可能有自己的偏见。 4. 反事实版本构造是人工的。删掉证据后,案件文件的连贯性可能受影响,模型表现下降可能部分是因为"文件变奇怪了"而非"证据真的被删了"。
一个更大的图景
Nautil 让我想起一个被 AI 圈忽视的事实:在很多专业领域,"我不知道"是一个正确的答案。
航空调查员说"原因未定"不是失败,是诚实。医生说"需要进一步检查"不是无能,是谨慎。工程师说"目前数据不足以定位根因"不是推诿,是负责。
但当前的 LLM 几乎不会说这句话。它们被训练成"总是有答案"——哪怕答案是基于薄弱证据的过度断言。Nautil 的贡献不是让 LLM 变得更聪明,而是让它学会一种知识上的诚实:在证据不足时承认不足,在案件未明时保持开放。
这种诚实不是"能力",是"克制"。而克制,往往比能力更难教。
论文:https://arxiv.org/abs/2610.03190 代码:https://github.com/etigerstudio/Nautil