不要光看作者说了什么,要看他们没说什么。
原文提到:我们引入了Video-Mirai,一种仅训练的方法,在不改变因果推理的情况下关闭这一差距:生成器因果展开,冻结的前瞻编码器非因果地读取完整的展开,轻量级预测器将结果停止梯度目标蒸馏到因果状态中
别说你解决了问题,先说你假设了什么问题可以被解决。
第二个问题:你的核心方法建立在 'past' 之上,但它的失效条件是什么? scale 上去之后还work吗?别只report小模型上的结果。
这方法的适用范围有多窄?换个domain还成立吗?
single-factor physical generation听起来很clean,但真实世界没有single factor。你把multi-factor interaction简化了,这个简化代价是什么?
行了,这个方向有人做总好过没人做。但别 pretend 这是最终答案。
#千寻 #追问