一个场景
你想做一部 30 秒的科幻短片。传统流程是:写脚本 → 分镜 → 拍摄/动画 → 配音 → 剪辑 → 后期。每一步都需要不同的专业人员和工具,周期以周计,成本以万计。
但如果你打开 Cursor,让 AI 编码助手跑一个叫 OpenMontage 的项目,它会:
- 读你的脚本
- 自动调用 12 条生产流水线中的合适那条
- 生成画面、配音、音效、字幕
- 按分镜表组装
- 输出成片
整个过程不到 10 分钟,成本 0.02 美元。
这不是假想。2026 年 3 月上线的 OpenMontage,用一部叫《The Library at Alexandria》的短片证明了这一点——制作成本两美分,在 GitHub 上拿了 4.7 万 star。
从"生成内容"到"编排生产"
过去两年,AI 生成视频的能力突飞猛进。Sora、Runway、Pika 都能生成几秒钟的片段。但"生成几秒片段"和"做一部完整短片"之间,隔着一整个生产流程。
OpenMontage 做的不是又一个视频生成模型,而是把生成能力编排成完整生产流水线。
它的核心是 12 条 production pipelines,每条对应一种视频类型:
- Image-based videos:用静态图片+运镜+特效做出动态视频
- Real video generation:调用视频生成模型直接产出动态画面
- Narrative pipeline:故事类内容,含分镜、角色一致性、场景转换
- Trailer pipeline:预告片风格,快节奏剪辑+音效冲击
- Explainer pipeline:科普解释类,含图表动画+旁白
- 等等
每条 pipeline 不是一个 prompt,而是一个完整的 agent 工作流:拆解任务 → 选择工具 → 执行步骤 → 质量检查 → 组装输出。
这个设计的本质是:把"视频制作"这件事从"艺术家手工活"变成"工厂流水线"。听起来不浪漫,但它把成本压到了两美分。
700+ Agent Skill 文件:给视频生产发一本操作手册
OpenMontage 最有意思的数字是 700+ agent skill and production-knowledge files。
这些文件做什么?它们是给 AI 编码助手的"操作手册"——告诉它:
- 怎么写分镜表(含格式模板)
- 怎么保持角色在不同镜头里的一致性(含 prompt 技巧)
- 怎么选择合适的背景音乐(含情绪-音乐映射表)
- 怎么做字幕排版(含时间轴规范)
- 怎么处理转场(含分类和适用场景)
这和 Anthropic 的 Agent Skills 思路完全一致:不训练更大的模型,而是给现有模型装上具体技能。区别在于,Anthropic 的 skills 仓库是通用的(文档处理、数据分析),OpenMontage 的 skills 是垂直的(视频生产专用)。
这种垂直化 skills 的价值在于:通用模型不知道"科幻短片的色调应该是冷色系"或"角色正脸镜头不能超过 3 秒否则观众会出戏"——这些是领域知识,需要专门编写。
OpenMontage 把这些领域知识结构化了。700+ 文件不是随机堆砌,而是按生产流程组织——前期、拍摄/生成、后期、分发,每个阶段都有对应的 skills。
三个示例项目的启示
OpenMontage 的 README 展示了三个示例:
SIGNAL FROM TOMORROW(科幻预告片)
- 类型:Trailer pipeline
- 风格:冷色调、快节奏剪辑、音效冲击
- 展示能力:叙事性视频的自动生产
THE LAST BANANA(Pixar 风格短片)
- 类型:Narrative pipeline
- 成本:$1.33
- 展示能力:角色动画+故事讲述
- 关键点:成本虽然比《The Library at Alexandria》高,但仍然远低于传统动画
The Library at Alexandria(科普短片)
- 类型:Explainer pipeline
- 成本:$0.02
- 展示能力:知识类内容的自动化生产
这三个示例覆盖了三种典型场景:商业预告、娱乐短片、科普内容。成本从两美分到一美元多,都远低于传统制作的万元级成本。
但更重要的不是成本,而是可复现性。传统视频制作是手工艺——同一个导演做两部片子,成本和质量可能差很多。OpenMontage 的流水线是标准化的——同一个 pipeline 跑两次,结果应该接近。这让视频生产从"艺术创作"变成了"工程制造"。
为什么开源?
OpenMontage 是 AGPLv3 协议——强 copyleft,任何使用它做商业产品的都必须开源自己的修改。这个协议选择很激进,说明项目方不打算走"开源核心+商业版"的路线。
这和它的定位有关。OpenMontage 不是一个产品,而是一个基础设施。它要解决的是"AI 视频生产的标准流程"问题——如果这个流程被一家公司垄断,整个行业都会受制于它。开源+AGPLv3 确保了流程的公共属性。
这和 Linux 的逻辑一样。Linux 之所以能成为服务器操作系统的事实标准,不是因为它是最好的技术,而是因为它是公共的——没有一家公司能控制它。OpenMontage 想成为"AI 视频生产的 Linux"。
4.7 万 star 说明这个定位打动了很多人。视频创作者、AI 开发者、内容平台都看到了它的价值——不是因为它能做视频,而是因为它把做视频的流程标准化且公开化了。
和已有工具的对比
| 维度 | Sora / Runway / Pika | Adobe Firefly Video | OpenMontage |
|---|---|---|---|
| 核心能力 | 生成几秒视频片段 | 生成+编辑视频 | 编排完整生产流程 |
| 流程覆盖 | 单步生成 | 生成+基础编辑 | 12 条完整 pipeline |
| 领域知识 | 无 | 内置在产品里 | 700+ 可读 skill 文件 |
| 可定制 | 不可 | 有限 | 完全可改 |
| 成本 | 按生成次数计费 | 订阅制 | API 成本(可低至 $0.02) |
| 开源 | 否 | 否 | 是(AGPLv3) |
关键区别在"流程覆盖"。Sora 能生成一段视频,但做不了一部短片——因为短片需要分镜、转场、配音、字幕,这些 Sora 不做。OpenMontage 做的是把这些步骤串起来,每一步调用合适的工具(包括可能调用 Sora 这样的模型)。
一个更大的图景
OpenMontage 代表的趋势是:AI 的价值正在从"模型本身"转向"编排模型的能力"。
2023-2024 年,AI 创业的主流叙事是"训练更好的模型"。2025 年开始,模型能力趋同——各家大模型在 benchmark 上差距缩小。差异化竞争转移到了应用层:谁能用现有模型做出更有用的产品。
OpenMontage 把这个逻辑推到了极致:它不训练任何模型,只是编排现有模型和工具。它的核心资产不是算法,而是 700+ 个 skill 文件——这些文件编码了视频生产的领域知识。
这和工业革命的逻辑一致。蒸汽机(模型)是通用技术,但真正改变世界的是把蒸汽机装进纺织机、火车、轮船的编排工程。OpenMontage 做的就是这件事——把 AI 生成能力"装进"视频生产的各个环节。
4.7 万 star 背后,是开发者社区对"编排比模型更重要"这个判断的认同。如果这个判断正确,未来 AI 创业的核心竞争力将不是"我能训练多大的模型",而是"我能把多少领域知识结构化成 agent skills"。
项目地址:https://github.com/calesthio/OpenMontage
协议:AGPLv3
示例作品:SIGNAL FROM TOMORROW / THE LAST BANANA / The Library at Alexandria
核心数据:12 条生产流水线 / 100+ 工具 / 700+ agent skill 文件
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。