这条我在两件事上想说点不一样的:一是编号,二是这个断点其实不新。
编号照例是错的
帖子写 arXiv:2609.21967,那是一篇全双工语音对话模型,NVIDIA 的。
真身是 arXiv:2609.28570,2026-09-23 提交,浙江大学加上海人工智能实验室,九位 作者(帖子写三位)。
摘要对得上:校正链两处薄弱、语义熵触发的专家前缀、优势符号感知的 Rényi 预处理、VideoMMMU 上 +4.0、95% CI [1.1, 6.9]。
第一处断裂,2025 年就有人处理过
论文说:高语义熵的难题,采样经常全体答错,组内均值 0、标准差趋 0,于是每个回答的优势都是 0,一个梯度都出不来。而幻觉恰恰集中在这些题上。
这段诊断我完全同意。但它是个已知问题。
字节 Seed 的 DAPO(arXiv:2503.14476,2025 年 3 月)第二条就是为它造的:动态采样 ——全对或全错的组直接丢掉,过采样把批次补满。理由和这篇一字不差:这类组提供零学习信号。
区别在处置:
- DAPO 选择 绕过:这批题这轮不学了,多花点采样去别处找信号。
- DEEPO 选择 救回:注入一段不含答案的专家思维链前缀,制造一个高奖励锚点,把优势方差撑回来,让那批错误回答真的拿到负优势。
论文正文也引了 Kalai 2025、Khan & Fu 2024,说的都是这件事。所以这条不是新发现,是 新解法。
第二处才是这篇的原创
「自信但错误的 token 在梯度上不可见」——分类策略的期望得分梯度范数,随着分布变尖而消失。
翻译成人话:模型越确定,你改它的力气越小。 而最需要改的,恰恰是它最确定的那批。
这一处我没有找到先例。Rényi 预处理加优势符号感知,是这篇自己的东西。
显著性的边界要说清
+4.0,95% CI [1.1, 6.9],在 VideoMMMU 上。
VideoMMMU 是它自己评测集里最复杂的长程任务。论文对 其余任务 的措辞是 additive——相加,不是显著。
也就是说:标题级的主张,证据落在一条任务上;下沿 1.1 离 0 只有一步。
论文报了区间这件事本身值得夸,比绝大多数同类工作强。但它只在一条任务上报了,其余的没报区间,别人也就无从复核。
论文自己先说了一半
引言里有一句很容易漏:GRPO 相对自己的基座,在 POPE 和 HallusionBench 上是改善的,在 VideoHallucer 上反而略降。
所以作者的立场不是「RL 让幻觉变多」,而是「RL 的纠错装置在最该干活的地方不干活」。这个立场比「RL 有害」精确得多,也比「RL 治幻觉」诚实得多。
一句话收口
纠错装置的可靠性,不是平均分能测出来的。
平均分能告诉你它答对了多少。它不会告诉你,在它答得最自信、错得最离谱的那一格上,修正的力气是不是正好趋近于零。