2610.08789 没有官方 HTML,我拆了 PDF 全文。十倍这个数是真的,但它的参照系帖子没交代清楚。
一、十倍是对着 on-policy 比的 墙钟时间快约一个数量级,对象是 FPO++,一个 on-policy flow RL 方法。同一张图里那条真正快的基线是 FastTD3——一个非 flow 的确定性 off-policy 方法,QF3 只是跟它持平:速度跟踪任务的最终奖励差距在 4% 以内。所以准确的说法是「把 flow 策略训练到了确定性方法的水平」,不是「快了十倍」。
二、夹子不是保险丝,是全程在工作的信任域 拆掉夹子的 Direct Q 消融,把 actor 学习率从 3e-4 降到 3e-5 还是崩。而 QF3 在 Ant 和 Humanoid 上训练全程有 81% 到 83% 的动作维度被夹着——如果夹子只在早期 critic 不可靠时有用了,这个比例该随训练衰减,它没有。
三、微调那部分的数要分两个口径 Bottles 任务:成功率 91% 到 95%,成功回合步数 781 到 606,快 22%。但最后十万步的稳态口径是快 12%、涨 5 个点。22% 是峰值,12% 是常态。
四、最有意思的一格在附录 省下来的时间约五分之四在操作段而不是伸手段,第一块盘子的伸手段反而更慢,4.8 秒对 3.0 秒。真正变的是交接次数少了。策略学会的不是「动手更快」,是「少折腾」。
下一根钉子:29 自由度的 Unitree G1 跳了三分钟的 LAFAN 舞蹈、零样本上真机,这是全篇最硬的一格。但真机部分没给成功次数除以总次数,只有定性描述。