LTX-2.5 公开权重视频与世界模型 — Lightricks 拆分后的「本地优先 + 商用补强」打法
2026 年 8 月 11 日(周二),从 Lightricks 拆分出来的「开放世界模型公司」LTX 正式发布开源权重视频 + 世界模型 LTX-2.5。同一时间,与 ComfyUI 厂商 Comfy Org 达成「首发集成」(zero-day integration)——所有 ComfyUI 用户搭好的 workflow 可以直接调用最新一代 LTX 模型,无需另外下载。模式选择:开源权重 + 托管 API 双轨——开源权重上 Hugging Face,托管 API 同时开。
商业模式有讲究——ARR 低于 1000 万美元的组织可以完全免费使用,大型企业另行谈授权。这是「先让中小企业+个人开发者跑通自己的 pipeline → 然后向大企业按 ARR 收费」的标准平台战略。CEO Zeev Farbman 把这条路叫做「先本地验证,后商业授权」。
数字最显眼:2 张 NVIDIA GB200 自托管稳态运行的条件下,LTX-2.5 生成 10 秒 720P 图生视频只要 6.8 秒——比实时播放还快。官方把这个速度差写成「7× faster than realtime」,价格端 LTX-2.5 Fast 档每条 10 秒视频约 0.9 美元(720p + 同步音频),约 Veo 3.1 正式版的 1/4、FLUX 3 Video 的 1/2(0.9 美元 vs Veo 3.1 官方报价)。官方对标「比同档模型便宜约 8 倍、渲染快 7 倍」。注意「同档」是 LTX 自己定位的「开源可自托管权重」档,跟 Veo 3.1 Lite 仍比 LTX 贵一档(0.5 美元 vs 0.9 美元),但是自托管 vs API 的成本结构完全不一样——开源自托管的边际成本是 RTX 显卡电费。质量盲测胜率 67%。
架构
解码器全重写——LTX-2.5 用了一套全新的扩散视频解码器,专门修高动态镜头的视觉伪影、文字 / 人脸重建能力、高压缩比保留。「原生多镜头单次渲染」——一次性渲染多个镜头,跨镜头角色 / 场景 / 声音一致,不需要分段跑——这是专业影视工作流里对「世界观一致性」的硬需求。语言骨干用定制 Gemma 4 + 专用提示增强器处理复杂多主体提示词。面向物理 AI 与机器人的专用预训练 checkpoint——这意味着 LTX 在赌一件事:视频生成模型作为「世界模型」给机器人仿真做基座。蒸馏大幅改进的子版本可跑在 NVIDIA RTX + Mac 显存友好。
「世界模型」是什么——LTX 强调「这是视频与「世界模型」(World Model)的合体发布」。世界模型这个词来自 Yann LeCun 的研究范式:用视频生成的方式训练一个模型,让它「理解物理世界的运行规律」,不只是做一只视频生成器。LTX-2.5 同时发布 「物理 AI 与机器人专用 checkpoint」,这是「世界模型作为机器人仿真基座」的明确动作——机器人公司可以拿去微调,做 sim-to-real 训练管线。
时间对照表(LTX 官方端到端实测,每条 10 秒 720P):
- LTX-2.5 自托管:6.8 秒(2× GB200)
- LTX API 调用同一任务:23.7 秒(1080P 渲染)
- Veo 3.1:70 秒(8 秒片段)
- Gemini Omni Flash:52 秒
- Grok 1.5:63 秒
- Seedance 2.5:317 秒
- Kling 3.0 Pro:398 秒
物理 AI / Robotics 那一支 checkpoint 在机器人仿真上的具体 benchmark——LTX 没给。「Robotics 友好」是模型功能,「Robotics 出活」需要客户自己的 sim + 实际部署闭环,这部分 LTX 没法代写。这是它的真实风险点。
这件事改变了什么
1. 视频生成模型的「开源 vs 闭源」分水岭被 LTX 撬开。Veo 3.1(Google)、Seedance 2.5(字节)、Kling 3.0 Pro(快手)、Runway Gen-4、FLUX 3 Video 全部是闭源 API;LTX-2.5 是公开权重 + 商用友好的极少数。Wan 2.5 / Open-Sora 2 也走开源,但LTX 的「原生 ComfyUI 集成」是企业能立即接入生产 pipeline 的最低门槛——对成本敏感的中小企业 + VFX 工作室 + 视频素材工作流来说,跑自托管权重 vs 每月订阅 Veo 3.1 / Runway 的成本差额是月数量级的。
2. 「世界模型」+ 「机器人仿真」+ 「物理 AI」三角交叉。LTX 把视频生成模型 + 世界模型 + 机器人训练基座三件事打包推出——这是一个「模型公司走工业切片路线」的清晰姿态:不做 AGI、不做消费聊天机器人、不做复杂长流程 agent,专注「视频 / 物理仿真 / 机器人训练数据」一块垂直市场。它跟 DeepSeek(模型 API + 开源 + 性价比)、Anthropic(agent + enterprise + 安全)走的是不同位置。
3. 价格切片可视化:LTX 0.9 美元 vs Veo 3.1 Lite 0.5 美元的对比,让「自托管 vs 云 API」的真实成本差异第一次被摆上桌面。0.5 vs 0.9 不是「开源能省钱」的故事,是「自托管工作量能抵得过贵的那 0.4 美元吗」的故事——大中小企业的真实成本逻辑从此依赖「每月调用量 × 是否跑得起 GB200 集群」这个组合判断。
风险与限制
第一,速度测试在「稳态运行」下做。首次冷启动的延迟、显存交换期的卡顿、长 video 的累计漂移 LTX 没公开 benchmark。这是 self-hosting 工作流里的常规痛点——benchmark 上的 6.8 秒是「同一段重复跑 10 次」的第 7 次时间,不是「早上刚开机冷启动的第一次」。
第二,多镜头单次渲染的「跨镜头一致性」是模型能力,实际工作流里只解决一半问题。脚本、剪辑、声音、配乐、字幕、转场由 ComfyUI 用户自己拼——LTX 解决「镜头之间不出错」,不解决「整部短片能不能讲清楚一个故事」。
第三,物理 AI / Robotics 那一支 checkpoint 在机器人仿真上的可复用性需要第三方验证。NVIDIA Cosmos / Disney / Google RT 系列都已跑过 robot benchmark,LTX 现在声称「机器人专用 checkpoint」但没给出 benchmark。等 1–2 个月要看学术 + 工业机器人公司的反馈。
第四,免费边界——ARR 低于 1000 万美元免费意味着对真正的研究机构 + 大型企业不构成免费能力,对独立开发者 + 中小企业是好的。这种 ARR-阶梯定价跟 MongoDB 的 SSPL、ElasticSearch 的 ELv2 在大客户 case 里常常反向捆绑——大客户为「合规 + 防御性 + 法务路径清楚」付钱,不只是为「能不能用」。
最后一句话:LTX-2.5 不是「视频生成又一款新模型」,是「开源视频生成 + 物理 AI + 机器人训练」三个赛道正式合流——它赌的是「机器人 + 物理 AI 仿真训练数据的需求曲线比视频生成市场的速度曲线更陡」。如果这个赌赢了,LTX 可能是 2026 年首批独角兽里杀出 AI infra 转型路径的公司;如果赌输了,它会停在「ComfyUI 的一个不错插件」层。
事件源:
- https://www.toutiao.com/article/7673040796823601707/(头条:速度/价格对比 + 缓存 audio + Free for SMBs)
- https://digital.it168.com/a2026/0812/6945/000006945903.shtml(IT168:Gemma 4 骨干 + Physical AI 检查点 + 解码器全重写)
- https://www.chinaz.com/ainews/30277.shtml(Chinaz:33M 下载量 + GB200 自托管测试细节)
- https://www.aibase.com/news/30277(AIBase:质量盲测 67% + 世界模型定位)
- https://ai-damn.com/ltx-2-5-open-world-model-launches-free-for-smbs-native-comfyui-support-1786575845801(AIDamn:商业模式 ARR<$10M 免费 + 商业授权)