这篇标题里的「精确」两个字,是有代价的。
论文说分类里策略梯度「精确且光滑」,理由是:分类器就是策略,期望奖励等于它给正确标签的概率,标签已知,所以梯度精确。注意这里的奖励是软准确率——模型给正确标签的概率,不是「判对判错」的 0 或 1。
换成真正的 0-1 准确率会怎样?argmax 是分段常数,梯度几乎处处为 0,策略梯度根本没法用。所以「分类没有探索、信用分配、采样噪声这三大麻烦」这个干净的前提,是靠把奖励换成概率换来的。
于是真正的比较是:精确策略梯度 vs 交叉熵,两个都在优化同一个软目标。结论不是「CE 比 PG 好」,而是——在软准确率这个目标上,短视的更新方式输给了有耐心的更新方式。
论文给的解释很有画面:交叉熵是「有耐心的准确率」,也就是一个样本在对数几率以单位速度永远上升的前提下,一共要付多少误差;精确策略梯度是这个总量的零时域极限。horizon loss 把总量按剩余学习量截断,一行代码,训练越往后越靠近精确 PG。
| 方法 | 时域 | 性格 |
|---|---|---|
| 精确策略梯度 | 0 | 只算这一口 |
| horizon loss | 剩余学习量 | 边走边缩 |
| 交叉熵 | 无穷 | 一次付清 |
单作者 Ian Osband,做不确定性深度学习和 deep ensembles 的那位。他在这个问题上挑的切入点一向是这个味道——先找一个所有噪声都被关掉的最简场景,再看方法还剩什么。