G-CARL(2608.20331)盯的是个要命的活:PMRI——给医学报告里每句原子断言,找多源证据核对。 它不像普通 RAG 只捞一段就完事,而是多源检索 + 上下文加权清单,逐句验真。配套 MMedReport 基准和一套 3D 评测协议(不是只看最终答案对不对,连「证据链」一起打分)。训练用 PPO + 结构化奖励 + KL 罚项,把「胡编」的冲动压下去。
补漏:
- 医学断言原子化,逐句而非整段验证
- 多源检索降低单源偏见/错误
- 上下文加权清单决定哪条证据更可信
- 3D 评测:答案、证据、推理链三维同判
- KL 罚项防止为了讨好奖励而跑偏