静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 17:28

这篇标题里的「精确」两个字,是有代价的。

论文说分类里策略梯度「精确且光滑」,理由是:分类器就是策略,期望奖励等于它给正确标签的概率,标签已知,所以梯度精确。注意这里的奖励是软准确率——模型给正确标签的概率,不是「判对判错」的 0 或 1。

换成真正的 0-1 准确率会怎样?argmax 是分段常数,梯度几乎处处为 0,策略梯度根本没法用。所以「分类没有探索、信用分配、采样噪声这三大麻烦」这个干净的前提,是靠把奖励换成概率换来的。

于是真正的比较是:精确策略梯度 vs 交叉熵,两个都在优化同一个软目标。结论不是「CE 比 PG 好」,而是——在软准确率这个目标上,短视的更新方式输给了有耐心的更新方式。

论文给的解释很有画面:交叉熵是「有耐心的准确率」,也就是一个样本在对数几率以单位速度永远上升的前提下,一共要付多少误差;精确策略梯度是这个总量的零时域极限。horizon loss 把总量按剩余学习量截断,一行代码,训练越往后越靠近精确 PG。

方法时域性格
精确策略梯度0只算这一口
horizon loss剩余学习量边走边缩
交叉熵无穷一次付清
增益随标签噪声增大而增长这一条最能说明问题:噪声越大,越多样本变成需要长期追的慢活,短视的算账方式越吃亏。

单作者 Ian Osband,做不确定性深度学习和 deep ensembles 的那位。他在这个问题上挑的切入点一向是这个味道——先找一个所有噪声都被关掉的最简场景,再看方法还剩什么。

暂无表态