[论文解读] 🎬 当视频编辑从"剪辑室"走进"直播间":JoyAI-Video-Edit
> 论文: JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion > arXiv: 2608.03974 | 团队: 京东 Joy Future Academy | 类别: cs.CV > 一句话: 160亿参数、720p@30FPS、不知道视频有多长也能实时编辑——京东把视频编辑从"事后剪辑"变成了"直播同步"。
---
🎯 先问一个傻问题:为什么视频编辑一定要"拍完再做"?
想象一下这个场景:
你正在直播。画面里,你在沙漠里踢足球。弹幕突然刷屏:"换成雨中体育场!"你一秒钟后,画面真的变成了雨中的体育场——雨滴、积水、球衣湿透的效果,实时发生。再过几秒,弹幕又说:"穿上钢铁侠战甲!"你的身上立刻覆上了金属装甲,反光、关节活动、和环境的交互,全部实时渲染。
这不是后期特效。这是直播的同时,实时发生。
这就是 JoyAI-Video-Edit 想做、且做到了的事。
但为什么这很难?难到在 2026 年 8 月之前,几乎没人能做好?
---
🧩 视频编辑的两个世界,一直互相看不上
在这篇论文之前,视频编辑活在两个割裂的世界里。
世界一:离线编辑(事后剪辑)
代表:VACE、OpenVE-Edit、Bernini-R
工作方式:你把整段视频拍好、传好,模型通读全篇——它同时能看到过去和未来的所有帧(这叫"双向注意力"),然后反复去噪迭代,最后一次性吐出编辑好的结果。
优点:效果极好。因为模型有全局视野,前后连贯性有保证。
缺点:必须等视频拍完。直播场景下,这条路直接走不通——你总不能让观众在弹幕里刷"加载中"刷上一分钟。
世界二:流式/实时编辑(直播同步)
代表:StreamDiffusionV2、SANA-Streaming、LiveEdit、XMax-X2.0
工作方式:视频流进来一帧,模型处理一帧,实时输出。模型只能看到"过去"的帧,看不到"未来"(这叫"因果生成")。
优点:实时。
缺点:质量 sacrifice 太大了。
论文里的数据很扎心:这些流式方法在权威评测集 OpenVE-Bench 上的综合得分普遍在 1.2 到 2.6 分(满分 5 分),而离线强模型能做到 3.6 分以上。换句话说,为了追求"实时"这一个指标,这些方法把编辑质量做出了明显妥协——画面容易模糊、色彩会漂移、编辑指令执行得不够准。
这就是论文要解决的核心矛盾:
> 能不能既做到像离线模型一样的编辑质量,又做到像直播一样的实时响应?
---
🔧 为什么"直接把离线模型改造成实时"走不通?
最直观的思路:让离线模型别看"未来"的帧,只看"过去"的帧——这叫 因果化(causalization)。
但论文作者发现,单纯做这个改造,会撞上 训练-推理不匹配(train-inference mismatch) 的问题。
传话游戏的陷阱
模型训练时,研究者用 "教师强制"(teacher forcing)的方式:当模型预测第 10 秒的画面时,把真实、干净的第 1-9 秒画面喂给它作为历史参考。这样训练出来的模型,见到的历史永远是完美无瑕的。
但真到了部署推理时,模型生成第 10 秒画面时,能参考的第 1-9 秒画面,不是真实数据,而是模型自己之前生成的、可能带着瑕疵的画面。
第 3 秒的颜色偏了一点 → 传给第 4 秒 → 第 4 秒基于偏色的历史继续偏 → 一路累积……
这就是传话游戏:第一个人说的是原文,但从第二个人开始,每个人听到的都是上一个人转述后的版本。如果每次转述都有 1% 的误差,传到第 100 个人的时候,原意已经面目全非。
在视频编辑里,这叫 长期漂移(long-term drift):颜色漂移、人物身份漂移、背景细节丢失。
而且视频编辑比纯视频生成还难一层——它不仅要保证前后帧连贯,还必须 时刻和原始源视频对齐:没被编辑到的部分(人物动作、背景)要原封不动保留,同时编辑指令("把主角换成钢铁侠")要稳定执行。
过度依赖"生成的历史" → 错误累积。 过度依赖"原始源视频" → 编辑指令执行不彻底。
这是一个动态平衡。
---
🏗️ JoyAI-Video-Edit 的三板斧
论文的解决方案由三个层层递进的技术组成。
第一板斧:分块自回归——把马拉松切成百米冲刺
整体架构:
- MLLM(多模态大语言模型):理解"把猫身上加一件毛衣"这种自然语言指令 + 视频第一帧画面 → 转换成模型能理解的"条件信息"
- 因果 VAE:把视频压缩成潜在表示(压缩比 8×24×24,每 8 帧原始视频压缩成 1 个潜在帧)
- MM-DiT(多模态扩散 Transformer):真正干活的主体
把视频沿着时间轴切成一个个小块。每个小块内部,模型可以双向看信息(块内双向注意力);但跨块之间,模型只能看之前的块,不能看未来的块(跨块因果注意力)。
更聪明的设计:滑动窗口 + 全局锚点
模型只保留最近几个历史块 + 第一个块作为"全局锚点"。不管视频直播多久,每次要处理的历史信息量始终固定。
> 类比:你给一场马拉松直播做同声传译。如果要求你记住从开场到现在说过的每一句话,负担会越来越重。但如果你只需要记住最近几分钟 + 开场的基调,不管比赛多久,你的处理量始终差不多。
训练细节:重采样强制(Resampling Forcing)
不用干净的真实历史训练,而是先把每个历史块用模型自己跑一遍单步去噪,生成"模型自产"的历史版本(不参与梯度回传),再用这个带瑕疵的历史去训练。让模型在训练阶段就习惯"跟自己生成的、不那么完美的历史打交道"。
---
第二板斧:SA-DMD——临摹时时不时抬头看原画
扩散模型的核心:通过多步迭代去噪,把随机噪声变成清晰画面。步数越多画质越好,但计算量越大。
要做到实时,必须把几十步压缩到极少步数。这里用到了 分布匹配蒸馏(DMD):训练一个小的"学生"模型,学习效果好的"教师"模型的行为,用远少于教师的步数达到接近效果。
但直接套用标准 DMD 在视频编辑上会出问题——长时间自回归过程中,生成器越来越依赖自己不完美的历史,导致编辑内容偏离原始视频,甚至出现"幻觉"。
于是提出 SA-DMD(Source-Anchored Distribution Matching Distillation,源锚定分布匹配蒸馏):
核心思路:在蒸馏训练阶段,让教师模型额外参考和当前编辑块时间上严格对齐的原始源视频画面。通过无分类器引导(CFG),把"文本指令引导强度"和"源视频保真度引导强度"拆成两个独立旋钮分别控制。
关键洞察:这个"源锚定" 只在训练阶段的教师目标上做,实际部署后模型走单一推理分支,不需要额外参考源视频进行二次计算。
> 类比:临摹一幅画。如果只顾着看自己刚画的上一笔,越画越歪。但如果老师(教师模型)时不时抬头看原画(源视频)纠偏,教出来的学生(部署模型)就带上了"不容易跑偏"的习惯——而且这个习惯已经刻进肌肉记忆,实际画画时不需要再拿原画对照。
经过 SA-DMD,扩散去噪被压缩到只有两步。
---
第三板斧:LHAD——让新手司机上高速前先在高速上练
前两步解决了因果生成和加速推理,但还剩最后一道坎:长视频。
训练时如果只用几秒的视频,模型没见过"编辑到第 50 秒之后是什么状态"。而现实中视频流可能持续几小时,短期训练无法覆盖长期运行才会暴露的深层错误累积。
> 类比:新手司机只在小区绕了几圈,从没跑过长途。真上高速开五六个小时,方向盘会不自觉跑偏。
LHAD(Long-Horizon Autoregressive Distillation,长时程自回归蒸馏):
把一个长视频片段(m 个块组成的滚动序列)拆成若干短连续小段,每小段单独计算 SA-DMD 的梯度,算完立刻清空计算图(避免显存爆掉 OOM),然后累积所有小段梯度做一次统一参数更新。
这样既让模型"见识"到长视频运行后期的深层错误状态,又不会因保留整段视频的计算图而显存不够。
小设计:动态镜像循环(dynamic mirror looping)
如果目标长度超过手头源视频长度,把视频正着放一遍再倒着放一遍交替循环——延伸出足够长的"虚拟源视频",避免简单粗暴的循环重复带来的画面突兀跳变。
---
📊 实验结果:短视频打得过,长视频打得赢
评测一:短视频编辑(OpenVE-Bench)
覆盖全局风格转换、局部改动、背景替换、局部删除、局部添加五大类任务。Gemini 当裁判,满分 5 分。
| 方法 | 参数量 | 分辨率 | 综合得分 |
|---|---|---|---|
| StreamDiffusionV2 | 1.3B | 480×832 | 1.23 |
| SANA-Streaming | 2B | 704×1280 | 2.62 |
| LiveEdit | 1.3B | 480×832 | 2.00 |
| Xmax-X2.0 | — | 832×1440 | 1.87 |
| Bernini-R(离线) | 27B | 480×848 | 3.72 |
| JoyAI-Video-Edit | 16B | 720×1280 | 3.60 |
- 综合得分 3.60,比第二名 SANA-Streaming(2.62)高出近 1 分
- 五个类别中四个拿到流式方案第一
- 已追平甚至超过部分离线大模型:27B 参数的 Bernini-R 综合 3.72,只比 JoyAI 高 0.12;局部改动并列最高(4.47)
评测二:长视频编辑(LongV2VBench,论文自建)
229 个任务,视频长度统一 1 分钟。这是行业此前的盲区——现有评测集大多是不到 10 秒的短片段。
| 方法 | 分辨率 | 吞吐量 | 综合得分 |
|---|---|---|---|
| StreamDiffusionV2 | 480×832 | 18.07 FPS | 1.21 |
| SANA-Streaming | 704×1280 | 14.51 FPS | 1.64 |
| LiveEdit | 480×832 | 15.45 FPS | 1.23 |
| XMax-X2.0 | 832×1440 | 20.90 FPS | 1.71 |
| JoyAI-Video-Edit | 720×1280 | 30.19 FPS | 3.30 |
- JoyAI 综合 3.30,比第二名 XMax-X2.0(1.71)几乎翻倍
- 吞吐量最高(30.19 FPS),比分辨率更高的 XMax-X2.0 还快 44.4%
- 长视频下其他流式方案质量明显下滑——印证了"长期漂移"问题的严重性
消融实验:SA-DMD 和 LHAD 各自贡献什么?
| SA-DMD | LHAD | 综合得分 |
|---|---|---|
| ✗ | ✗ | 2.81 |
| ✓ | ✗ | 3.23 |
| ✗ | ✓ | 3.06 |
| ✓ | ✓ | 3.30 |
- SA-DMD 单独启用:全局风格 3.61→4.24,局部改动 3.43→4.00 → 狠狠遏制画面走样
- LHAD 单独启用:背景替换 2.45→2.60,局部删除 2.58→2.70 → 瞄准"长视频后期状态不稳"
- 两者一起:局部添加、局部改动、局部删除三项全表最优 → 互相补位
人类主观评审
两两对比,匿名投票:
- vs LiveEdit:90% 偏好票
- vs SANA-Streaming:87%
- vs StreamDiffusionV2:87%
- vs XMax-X2.0:81%
- vs Bernini-R(离线):48% vs 44%,平局 → 和顶尖离线系统掰手腕
- vs Kling-3.0 Omni / Seedance 2.0(商业闭源):56% → 稍占上风
⚡ 部署性能:720p@30FPS 怎么做到的?
在单块 NVIDIA B200 GPU 上,每 8 帧视频块的处理耗时:
| 组件 | 耗时 |
|---|---|
| VAE 编码 | 22 ms |
| DiT 去噪(2步) | 185 ms |
| VAE 解码 | 19 ms |
| 请求→响应延迟 | 226 ms |
| + KV 缓存构建 + 伪编码 | 266 ms |
| 换算帧率 | ≈30.1 FPS |
- FP8 量化:降低计算和存储开销
- 编译 VAE + 自动调优:加速编解码
- 流水线执行:主机端处理与 GPU 计算并行重叠
- 启动预热、持久化编译产物、保留内存池:避免重复编译和内存分配开销
| 方法 | 分辨率 | 完整延迟 | 完整 FPS | VAE FPS |
|---|---|---|---|---|
| StreamDiffusionV2 | 480×832 | 4.48s | 18.07 | 37.06 |
| LiveEdit | 480×832 | 5.24s | 15.45 | 37.26 |
| SANA-Streaming | 704×1280 | 5.58s | 14.51 | 27.12 |
| JoyAI | 720×1280 | 2.68s | 30.19 | 200.00 |
---
🧠 训练数据:两条路解决"配对数据稀缺"
高质量"视频编辑配对数据"(原始视频 + 编辑后目标视频)业内一直稀缺。
路一:关键帧引导的编辑传播
- 从源视频挑一帧代表性画面
- 用图像编辑模型改好这一帧
- 把改好的帧 + 原始视频喂给"图像+视频→视频"模型
- 让编辑效果传播到整段视频的其他帧,保持运动轨迹和未编辑内容不变
- 从一张原始图片和编辑后的对应图片出发
- 用两个分支的 I2V 模型分别生成视频
- 早期去噪阶段共享潜在变量(保证运动构图一致)
- 后期去噪阶段分别用不同图片作为条件(引入编辑效果)
- 按画面质量、编辑正确性、内容改动程度、时间连贯性过滤
- 用多模态大模型核对源视频和编辑后视频的差异
- 反过来修正和精炼编辑指令的文字描述
---
💡 核心洞察与启发
1. "长视频漂移"被真正当回事对待了
很多论文提到长期一致性时一笔带过,用"未来工作"打发。这篇论文 专门搭了 LongV2VBench 去量化这个问题,并用数据证明:不做专门优化,一分钟视频的编辑质量能比十秒钟差出一倍不止。
这说明行业里此前的"实时编辑"方案,大多是在"短平快"场景下堆的成绩——拉到真实长直播场景,立刻现原形。
2. "考前抱佛脚,考试凭记忆"——SA-DMD 的设计哲学
把推理时的计算负担提前转移到训练阶段消化。这个思路在需要平衡"实时性"和"质量"的场景里(实时语音翻译、实时人脸重建)都有借鉴价值。
3. 系统级优化的重要性
JoyAI 的优势不来自单点算法先进,而是 VAE、DiT、缓存机制、量化方案的协同优化。工程上每处抠出来的 5ms,加起来就是能不能上 30FPS 的区别。
4. 还没解决的问题
依赖 16B 参数量 + B200 顶级硬件才跑出 30 FPS。等哪天能塞进普通游戏本甚至手机,视频编辑才会真的变成"人人张口就来"。
---
📚 参考文献
- Yicheng Xiao, Wenxun Dai, et al. "JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion." arXiv:2608.03974, 2026.
- 京东 Joy Future Academy: https://research.joyai.com/
- 项目页面(如有公开): 待补充