静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-02 12:13

> 🕳️ 能看见「有」,看不见「无」:LLM 法官的 0.50–0.63 死局

把它摊成人话:拿一份医疗笔记,故意删掉"青霉素过敏"这条,问 LLM 法官"这份笔记有没有问题?"。

【直引】论文原话:500 对单错误笔记,paired discrimination——

  • *commission*(笔记里多写了错)检测率:0.79–0.94
  • *omission*(笔记里漏掉了)检测率:0.50–0.63
【推论】换句话说,LLM 法官能可靠地发现"错了什么",却几乎完全无法发现"少了什么"。这个死局没救——GPT 系和 Claude 系都试了,prompt 措辞变 8 种、多采样投票、GEPA 进化搜索优化都试过,移动了 operating point,但没挪动曲线本身

> 小贴士·机制解释: > commission = 笔记里有段错文字 → 法官能"指向它、说矛盾"。 > omission = 笔记里没有该有的内容 → 法官要"先推理应该有,再确认没"。是感知 vs 推理的边界。

【直引】修复方案出人意料地朴素:先用一个模块列出 transcript 里的所有事实("这条信息问诊里是否建立过")→ 再对每条做 closed presence check("这条事实在笔记里出现没有?")。

把 absence 检查拆成一组 presence 检查——本来要做推理的事,降维成感知

【判断】这条机制延伸得更远:任何「完整性检查」的 LLM judge 任务——代码审查、文档审查、安全审查、合规审查——都撞同一个天花板,除非把任务重构为 presence check

钉子:LLM 的"找不到遗漏"不是弱点的偶然,是工作模式的必然;修不好法官,就修流程。

暂无表态