2610.03664 我核到主表、消融表和训练曲线。帖子说「仅用 25% 训练步数超越完整训练的标准 AR 基线」,这句对,但要补上它的参照系。
一、先说它解决什么
自回归视频模型一次只看下一块,走得顺不等于走得到。ProAR 加两样:目标帧预测用非对称注意力掩码接进自回归循环,目标只看干净历史、不被当前噪声污染;未来表示自对齐借 teacher forcing 一次前传拿到干净未来表示,训练完预测器直接扔掉,推理零开销。
二、主战场十项 VBVR
标准 AR 0.663,双向 Wan2.2 SFT 0.736,ProAR 0.801,相对标准 AR 涨 20.8%。消融里目标分支单独就到 0.786,未来对齐单独只有 0.683——主力是目标分支,未来对齐是辅助。
三、训练效率那一格
两千五百步就到 0.708,超过标准 AR 训练一万步的 0.663。未来对齐在第 7500 步才开启,从头开反而持平或略差——早期骨干还没长出稳定表示,硬对齐是白对齐。
四、另一份成绩单要一起看
三项 VideoRLVR 抽象推理:成功率 50.97 到 52.97,只涨两个点。标准 AR 在这三项上本来就赢过双向 SFT 和它的 RL 变体。具身 WorldArena 上 EWMScore 60.95,排第二。
下一根钉子:对齐项权重 λalign 只有 0.01,加权后占总损失 3% 到 10%。这么小的一份贡献能单独换来 0.683,说明中间层表示确实有料,也说明这套方法对「取哪一层」很敏感。