MiniMax H3 生态解剖:开源了生成器,API 化了理解层
从一个 79 star 的 ComfyUI 插件说起。UP 主「鱼酥」(yusu)8 月初上架了一个叫 Yusu-MiniMaxH3-Unified 的自定义节点,两个月迭代十几版,今天(10 月 9 日)中午还在推送更新。单看这个插件平平无奇——它自称「只负责输入组织、媒体处理和接口映射,不修改推理核心」。有意思的…
MiniMax H3 生态解剖:开源了生成器,API 化了理解层
从一个 79 star 的 ComfyUI 插件说起。UP 主「鱼酥」(yusu)8 月初上架了一个叫 Yusu-MiniMaxH3-Unified 的自定义节点,两个月迭代十几版,今天(10 月 9 日)中午还在推送更新。单看这个插件平平无奇——它自称「只负责输入组织、媒体处理和接口映射,不修改推理核心」。有意思的是它封装的那个东西:ComfyUI 官方的 MiniMax H3 节点。顺着这条线往上摸,是一整个 7 月底以来长出来的生态,和一个把「开源」二字切得很精细的模型。
先把 H3 是什么说清。MiniMax 7 月 28 日开源的 H3 不是普通视频生成模型,官方定义是「通用全模态生成系统」:输入可以是文字、图片、视频、音频的任意混合(最多 9 张图、3 段视频、3 段音频,混合不超过 12 个文件),输出是带原生立体声的视频——视频和音频由同一个 33B Transformer 联合生成,24 帧、最长 15 秒、默认 768p。教程圈叫它「黑科技」,拆开看黑科技就一条:以前视频模型出哑巴画面、配音软件单独配声,H3 的画面和声音是同一个模型同时决定的,所以对口型、音画同步是原生的。
架构上 H3 分三块,开源边界画得很讲究。生成器 H3-Base 完全开源:一个 33B 的稠密单流 Transformer,其中约 13B 参数住在 AdaLN 调制分支里——这类分支的输出可以预计算缓存,纯推理部署不用加载,实际跑的是 20B。文本编码器直接搬了 Qwen3-VL-32B 的完整预训练权重,从第 50 层取隐状态用。视觉侧是时空压缩 16×/4× 的因果 VAE,音频侧把 32kHz 立体声压成 40Hz 的 latent 序列。这套东西以两个任务专用 checkpoint 发布(首尾帧版 FL2VA 和全模态参考版 Ref2VA),都做了 CFG 蒸馏,ComfyUI 官方 7 月 30 日就完成集成——重打包仓库至今 2300 万下载。
但 H3 的「理解」不开源。官方卡明说:输入一复杂,靠的是一个叫 H3-Context-IR 的预处理系统——解析指令、跨模态关联、时间理解、逻辑推理,把自由格式输入整理成生成器能吃的结构化表示。这个系统依赖多阶段工作流和多个托管模型,不随权重发布,只提供 API 复现。2K 版本同理:不是传统超分模块,而是把 768p 结果和原始上下文一起喂回 H3 重新生成(小文字和细节靠原始上下文找回),这个 Regenerate-2K 模块也标注「尚未开源」。于是 H3 的开源形态是一个精确的切口:你可以在本地跑它的生成器,但把素材「翻译成生成器听得懂的话」的那一层——恰恰是官方自己强调「对最终质量至关重要」的那一层——留在云端,按次计费。开源权重送你引擎,导游收费。这个切口和判断模型与生成模型分开计价的商业逻辑是同构的:理解是判断,生成是执行,MiniMax 把判断留在了服务端。
鱼酥插件的位置就在这个生态的末端。ComfyUI 官方节点把 FL2VA 和 Ref2VA 两种模式拆成两个节点、媒体输入管理很朴素,yusu 把三种模式(文生视频、首尾帧、全模态参考)统一进一个节点,节点内做媒体面板:上传、预览、裁剪、波形画布、Ctrl+V 粘贴、按参考音频自动算生成时长。质量上有两个值得说的细节。一是规格忠实:9 图、3 视频、3 音频、单段 2-15 秒、视频总长不超 15 秒——逐条对着官方 Ref2VA 的输入规格抄的,一个没加戏。二是今天的更新恰好踩在忠实和加戏的边界上:新版取消了插件自己的「单段参考音频 15 秒上限」,保留 2 秒下限,视频限制不动。这是输入组织层的自主放宽——模型层是否真能吃下超过 15 秒的音频,官方规格没承诺,插件 README 也没说验证过。用官方卷子划自己的考场,考不考得过要用户自己试。另外两个小注脚:插件声明「无遥测、无外部 API、无后台轮询」,在同类插件里算干净的;仓库没挂 license,严格说默认保留所有权利,拿去二次分发前得问一声。
整个生态的时间线也值得记一笔。7 月 28 日官方开源,7 月 30 日 Comfy-Org 重打包集成,8 月 5 日 Kijai 出实验版封装,8 月 6 日 yusu 插件创建,8 月 7 日 lightx2v 挂出 Turbo 蒸馏加速版(现已 149 万下载),9 月进入 LoRA 控制层(角色替换、360 环绕、人物移除),10 月还有人在出低步数预览版。三个月里,一个开源视频模型的分工图就长齐了:官方管权重和 API,Comfy-Org 管分发,Kijai 和 yusu 这类开发者管可用性,lightx2v 管速度,LoRA 作者管控制,RunningHub 这样的云平台和 UP 主教程管「没有显卡的人怎么用」——鱼酥的免费插件是入口,教程末尾的 RunningHub 云端工作流和邀请码是变现出口,本地跑不动 33B 的用户顺着链接就上了云。这不是批评,这是这个生态的运转方式:每一层都有人挣自己的钱,用户每一层都有得选。
留给读者一组数字:2300 万对 79。前者是 Comfy-Org 重打包仓库的下载量——模型本身的抵达规模;后者是鱼酥插件的 star 数——它之上的可用性改良层。一个开源模型能不能被用起来,这两个数字缺一不可,而挣到钱的往往是小的那个。