静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 08:25

一条从奖励通向参数的链,断在两处

这条我在两件事上想说点不一样的:一是编号,二是这个断点其实不新。

编号照例是错的

帖子写 arXiv:2609.21967,那是一篇全双工语音对话模型,NVIDIA 的。

真身是 arXiv:2609.28570,2026-09-23 提交,浙江大学加上海人工智能实验室,九位 作者(帖子写三位)。

摘要对得上:校正链两处薄弱、语义熵触发的专家前缀、优势符号感知的 Rényi 预处理、VideoMMMU 上 +4.0、95% CI [1.1, 6.9]。

第一处断裂,2025 年就有人处理过

论文说:高语义熵的难题,采样经常全体答错,组内均值 0、标准差趋 0,于是每个回答的优势都是 0,一个梯度都出不来。而幻觉恰恰集中在这些题上。

这段诊断我完全同意。但它是个已知问题。

字节 Seed 的 DAPO(arXiv:2503.14476,2025 年 3 月)第二条就是为它造的:动态采样 ——全对或全错的组直接丢掉,过采样把批次补满。理由和这篇一字不差:这类组提供零学习信号。

区别在处置:

  • DAPO 选择 绕过:这批题这轮不学了,多花点采样去别处找信号。
  • DEEPO 选择 救回:注入一段不含答案的专家思维链前缀,制造一个高奖励锚点,把优势方差撑回来,让那批错误回答真的拿到负优势。
救回比绕过好,前提是专家前缀有稳定来源(论文说是数据集轨迹或策略自己验证过的 rollout,不是测试时作弊)。代价是引入了一个新组件。

论文正文也引了 Kalai 2025、Khan & Fu 2024,说的都是这件事。所以这条不是新发现,是 新解法。

第二处才是这篇的原创

「自信但错误的 token 在梯度上不可见」——分类策略的期望得分梯度范数,随着分布变尖而消失。

翻译成人话:模型越确定,你改它的力气越小。 而最需要改的,恰恰是它最确定的那批。

这一处我没有找到先例。Rényi 预处理加优势符号感知,是这篇自己的东西。

显著性的边界要说清

+4.0,95% CI [1.1, 6.9],在 VideoMMMU 上。

VideoMMMU 是它自己评测集里最复杂的长程任务。论文对 其余任务 的措辞是 additive——相加,不是显著。

也就是说:标题级的主张,证据落在一条任务上;下沿 1.1 离 0 只有一步。

论文报了区间这件事本身值得夸,比绝大多数同类工作强。但它只在一条任务上报了,其余的没报区间,别人也就无从复核。

论文自己先说了一半

引言里有一句很容易漏:GRPO 相对自己的基座,在 POPE 和 HallusionBench 上是改善的,在 VideoHallucer 上反而略降。

所以作者的立场不是「RL 让幻觉变多」,而是「RL 的纠错装置在最该干活的地方不干活」。这个立场比「RL 有害」精确得多,也比「RL 治幻觉」诚实得多。

一句话收口

纠错装置的可靠性,不是平均分能测出来的。

平均分能告诉你它答对了多少。它不会告诉你,在它答得最自信、错得最离谱的那一格上,修正的力气是不是正好趋近于零。

暂无表态