美团开源 LongCat-Video:13.6B 参数一把梭,T2V/I2V/视频续写三种任务共用一个模型
视频生成领域有个老问题:Text-to-Video(文生视频)、Image-to-Video(图生视频)、Video-Continuation(视频续写)这三种任务,过去往往要用三个不同模型,或者一个模型三套权重。训练时各管各的,推理时来回切换,工程成本极高。
目录
美团开源 LongCat-Video:13.6B 参数一把梭,T2V/I2V/视频续写三种任务共用一个模型
研究对象:meituan-longcat/LongCat-Video
抓取日期:2026-10-03 | 当日 stars:43
许可证:MIT | 语言:Python
一个模型,三种任务,一个架构
视频生成领域有个老问题:Text-to-Video(文生视频)、Image-to-Video(图生视频)、Video-Continuation(视频续写)这三种任务,过去往往要用三个不同模型,或者一个模型三套权重。训练时各管各的,推理时来回切换,工程成本极高。
LongCat-Video 的第一个卖点是:一个模型原生支持三种任务,不需要任务特定的微调,不需要切换权重。你给它一段文字,它生成视频;你给它一张图加一段文字,它从图开始生成视频;你给它一段视频,它接着往下续写。
这听起来像是个工程优化,但它背后的含义是——模型在预训练阶段就把"视频的时空连续性"作为底层语法学会了,而不是通过后期的任务适配硬凑出来。
长视频生成的"色彩漂移"问题
大多数视频生成模型都有一个通病:视频一长,颜色就开始漂。第 5 秒还正常的画面,到第 30 秒可能整个色调都变了,像被蒙了一层滤镜。这是因为模型在逐帧生成时,没有全局的色彩一致性约束。
LongCat-Video 的解法是在预训练阶段就加入 Video-Continuation 任务。所谓 Video-Continuation,就是给模型一段视频的前 N 秒,让它续写后 M 秒。这个任务强制模型学会"从已有视频帧继承视觉特征",而不是每一段都从头生成。
结果就是:模型能生成分钟级的长视频,且不会出现色彩漂移或质量退化。这听起来是个小细节,但在实际应用中,"能不能生成 1 分钟以上的视频"和"能不能生成 10 秒以上的视频"是两个完全不同的应用场景。
Block Sparse Attention:长视频推理的算力瓶颈解法
长视频生成的最大障碍不是模型能力,而是算力。一段 720p、30fps、1 分钟的视频有 1800 帧。如果用标准的 Dense Attention,每帧都要和所有其他帧算注意力,计算量是 O(N²) 级别的。720p 长视频根本跑不动。
LongCat-Video 用了一个叫 Block Sparse Attention 的技术。核心思路是:把视频帧分成块,块内用 Dense Attention,块间用 Sparse Attention(只关注关键帧)。这样计算量从 O(N²) 降到接近 O(N·log N)。
配合 coarse-to-fine 生成策略(先低分辨率生成整体,再高分辨率精修),LongCat-Video 能在分钟级别的时间内生成 720p 30fps 的视频。这个"分钟"是推理时间,不是视频长度——也就是说,你等几分钟就能拿到一段可用的长视频。
多奖励 GRPO:让模型学会"人类觉得好看"
视频生成模型最尴尬的处境是:客观指标(PSNR、SSIM)很高,但人类看了觉得"不对劲"。这是因为客观指标测的是像素级相似度,而人类判断视频好坏用的是多维度的主观感受——画面美感、动作流畅度、语义一致性、物理合理性。
LongCat-Video 用了 多奖励 GRPO(Group Relative Policy Optimization) 来对齐人类偏好。GRPO 的核心思路是:
1. 生成一组视频候选(group) 2. 用多个奖励模型分别打分(美感、动作一致性、语义匹配等) 3. 在组内做相对排序(relative policy),而不是绝对打分 4. 用排序信号更新策略
这比传统的 PPO 更稳定,因为相对排序消除了奖励尺度差异的问题。多个奖励模型的组合也避免了"优化单一指标导致其他维度退化"的陷阱。
13.6B 参数:一个值得注意的规模选择
LongCat-Video 的参数量是 13.6B。这个数字值得玩味。
当前视频生成模型的参数规模两极分化:小的 1-3B(如一些轻量级 T2V 模型),大的 30B+(如一些旗舰模型)。13.6B 是一个中间选择——大到能支撑多任务统一架构和长视频生成,小到能在合理的 GPU 配置下推理。
美团的选型逻辑可能是:视频生成模型的商用瓶颈不在模型能力,而在推理成本。一个 30B 的模型即使效果更好,但如果推理一次要等 30 分钟,普通用户根本用不起。13.6B 是一个"效果够用、推理可负担"的平衡点。
美团为什么做视频生成模型?
美团做视频生成模型乍看有点跨界。但仔细想想,美团的核心业务——本地生活服务、餐饮、零售——都需要大量的视觉内容:菜品展示、店铺环境、商品演示、广告素材。这些场景对视频内容的需求量极大,但传统视频制作成本高、周期长。
一个能在分钟级生成 720p 长视频的模型,对美团这样的平台来说,意味着:商家可以用文字描述生成菜品展示视频,运营团队可以批量生成广告素材,用户评价可以从文字升级到短视频。
这和 OpenAI 做 Sora 的逻辑不同——Sora 是通用视频生成平台,LongCat-Video 更像是为本地生活场景定制的视频生成基础设施。美团的 Technical Report 里提到"first step toward world models"(迈向世界模型的第一步),暗示后续会有更宏大的规划。
开源的意义
LongCat-Video 的开源(MIT 协议)对行业有几个影响:
1. 视频生成模型的工程门槛降低。Block Sparse Attention、多奖励 GRPO 这些技术从论文变成了可运行的代码。 2. 国产视频生成模型多了一个选择。在 Sora 不开源、Stable Video Diffusion 效果有限的情况下,LongCat-Video 是一个 13.6B 参数、可商用、效果接近商业方案的开源选项。 3. 长视频生成的可行性验证。之前开源模型大多只能生成 5-10 秒视频,LongCat-Video 证明了分钟级长视频在开源社区也能做到。
一个被低估的细节:Video-Continuation 作为预训练任务
大多数视频生成模型的预训练任务是 T2V 或 I2V,LongCat-Video 把 Video-Continuation 也作为预训练任务(不是后期微调)。这个选择的意义是:
- T2V 教模型"从文字想象画面"
- I2V 教模型"从静态画面想象运动"
- Video-Continuation 教模型"从已有视频理解时空规律"
美团把 Video-Continuation 放到预训练阶段,等于在模型的底层语法里就植入了"时空连续性"的概念。这也是为什么 LongCat-Video 能生成长视频而不漂色——它不是在"生成"长视频,而是在"续写"长视频。
仓库地址:https://github.com/meituan-longcat/LongCat-Video 技术报告:见仓库 README 中的 Technical Report 链接 模型权重:HuggingFace 上可获取
每日 GitHub Trending 深度研究 · 第 83 篇