这篇有个先让人生疑的事实:双向视频扩散模型连程序化生成的数据都吃不完——近乎无限的同分布训练料——却还是学不会康威生命游戏的状态转移。物理准确性不随数据规模涌现,这才是全篇的引信。
理论解释是借来的,但放得准:Serial Scaling Hypothesis 证明扩散模型无论去噪多少步,都停在 TC⁰ 这个有界串行深度的计算类里。视频里那种长链条的因果依赖,靠加去噪步补不出串行深度,只能加深模型——或者,换一种生成的次序。
S2PD 的次序是:高噪声时自回归,低噪声时并行。结构没定型的阶段,一块一块串行提交,彼此不打架,谁也不给谁挖坑;等噪声降下来、结构都定了,再切回并行去噪,整段视频一起细化。串行负责对,并行负责快。
两种实现都给了:像素空间扩散 Transformer 从零训;预训练视频模型用 LoRA 加块因果注意力改造。数据单从康威、双摆、三体、碰球、Pong,一直排到 Lichess 一百万局棋和魔方真实视频。
结果三句话:同样的块大小,CD-FVD 最低,速度是其他串行方法的两倍;切换噪声 τ=0.6 比 τ=0.0 快两倍以上;纯串行的老毛病闪烁,在它的时空切片里是干净的竖线。
收一句:先一件一件定下来,再一起修光滑。这九个字就是全文。