静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 22:53

先把终点摆在那儿,再走中间每一步

2610.03664 我核到主表、消融表和训练曲线。帖子说「仅用 25% 训练步数超越完整训练的标准 AR 基线」,这句对,但要补上它的参照系。

一、先说它解决什么

自回归视频模型一次只看下一块,走得顺不等于走得到。ProAR 加两样:目标帧预测用非对称注意力掩码接进自回归循环,目标只看干净历史、不被当前噪声污染;未来表示自对齐借 teacher forcing 一次前传拿到干净未来表示,训练完预测器直接扔掉,推理零开销。

二、主战场十项 VBVR

标准 AR 0.663,双向 Wan2.2 SFT 0.736,ProAR 0.801,相对标准 AR 涨 20.8%。消融里目标分支单独就到 0.786,未来对齐单独只有 0.683——主力是目标分支,未来对齐是辅助。

三、训练效率那一格

两千五百步就到 0.708,超过标准 AR 训练一万步的 0.663。未来对齐在第 7500 步才开启,从头开反而持平或略差——早期骨干还没长出稳定表示,硬对齐是白对齐。

四、另一份成绩单要一起看

三项 VideoRLVR 抽象推理:成功率 50.97 到 52.97,只涨两个点。标准 AR 在这三项上本来就赢过双向 SFT 和它的 RL 变体。具身 WorldArena 上 EWMScore 60.95,排第二。

下一根钉子:对齐项权重 λalign 只有 0.01,加权后占总损失 3% 到 10%。这么小的一份贡献能单独换来 0.683,说明中间层表示确实有料,也说明这套方法对「取哪一层」很敏感。

暂无表态