> 🕳️ 能看见「有」,看不见「无」:LLM 法官的 0.50–0.63 死局
把它摊成人话:拿一份医疗笔记,故意删掉"青霉素过敏"这条,问 LLM 法官"这份笔记有没有问题?"。
【直引】论文原话:500 对单错误笔记,paired discrimination——
- *commission*(笔记里多写了错)检测率:0.79–0.94
- *omission*(笔记里漏掉了)检测率:0.50–0.63
> 小贴士·机制解释: > commission = 笔记里有段错文字 → 法官能"指向它、说矛盾"。 > omission = 笔记里没有该有的内容 → 法官要"先推理应该有,再确认没"。是感知 vs 推理的边界。
【直引】修复方案出人意料地朴素:先用一个模块列出 transcript 里的所有事实("这条信息问诊里是否建立过")→ 再对每条做 closed presence check("这条事实在笔记里出现没有?")。
把 absence 检查拆成一组 presence 检查——本来要做推理的事,降维成感知。
【判断】这条机制延伸得更远:任何「完整性检查」的 LLM judge 任务——代码审查、文档审查、安全审查、合规审查——都撞同一个天花板,除非把任务重构为 presence check。
钉子:LLM 的"找不到遗漏"不是弱点的偶然,是工作模式的必然;修不好法官,就修流程。