MiniMax H3 生态解剖:开源了生成器,API 化了理解层

从一个 79 star 的 ComfyUI 插件说起。UP 主「鱼酥」(yusu)8 月初上架了一个叫 Yusu-MiniMaxH3-Unified 的自定义节点,两个月迭代十几版,今天(10 月 9 日)中午还在推送更新。单看这个插件平平无奇——它自称「只负责输入组织、媒体处理和接口映射,不修改推理核心」。有意思的…

MiniMax H3 生态解剖:开源了生成器,API 化了理解层

从一个 79 star 的 ComfyUI 插件说起。UP 主「鱼酥」(yusu)8 月初上架了一个叫 Yusu-MiniMaxH3-Unified 的自定义节点,两个月迭代十几版,今天(10 月 9 日)中午还在推送更新。单看这个插件平平无奇——它自称「只负责输入组织、媒体处理和接口映射,不修改推理核心」。有意思的是它封装的那个东西:ComfyUI 官方的 MiniMax H3 节点。顺着这条线往上摸,是一整个 7 月底以来长出来的生态,和一个把「开源」二字切得很精细的模型。

先把 H3 是什么说清。MiniMax 7 月 28 日开源的 H3 不是普通视频生成模型,官方定义是「通用全模态生成系统」:输入可以是文字、图片、视频、音频的任意混合(最多 9 张图、3 段视频、3 段音频,混合不超过 12 个文件),输出是带原生立体声的视频——视频和音频由同一个 33B Transformer 联合生成,24 帧、最长 15 秒、默认 768p。教程圈叫它「黑科技」,拆开看黑科技就一条:以前视频模型出哑巴画面、配音软件单独配声,H3 的画面和声音是同一个模型同时决定的,所以对口型、音画同步是原生的。

架构上 H3 分三块,开源边界画得很讲究。生成器 H3-Base 完全开源:一个 33B 的稠密单流 Transformer,其中约 13B 参数住在 AdaLN 调制分支里——这类分支的输出可以预计算缓存,纯推理部署不用加载,实际跑的是 20B。文本编码器直接搬了 Qwen3-VL-32B 的完整预训练权重,从第 50 层取隐状态用。视觉侧是时空压缩 16×/4× 的因果 VAE,音频侧把 32kHz 立体声压成 40Hz 的 latent 序列。这套东西以两个任务专用 checkpoint 发布(首尾帧版 FL2VA 和全模态参考版 Ref2VA),都做了 CFG 蒸馏,ComfyUI 官方 7 月 30 日就完成集成——重打包仓库至今 2300 万下载。

但 H3 的「理解」不开源。官方卡明说:输入一复杂,靠的是一个叫 H3-Context-IR 的预处理系统——解析指令、跨模态关联、时间理解、逻辑推理,把自由格式输入整理成生成器能吃的结构化表示。这个系统依赖多阶段工作流和多个托管模型,不随权重发布,只提供 API 复现。2K 版本同理:不是传统超分模块,而是把 768p 结果和原始上下文一起喂回 H3 重新生成(小文字和细节靠原始上下文找回),这个 Regenerate-2K 模块也标注「尚未开源」。于是 H3 的开源形态是一个精确的切口:你可以在本地跑它的生成器,但把素材「翻译成生成器听得懂的话」的那一层——恰恰是官方自己强调「对最终质量至关重要」的那一层——留在云端,按次计费。开源权重送你引擎,导游收费。这个切口和判断模型与生成模型分开计价的商业逻辑是同构的:理解是判断,生成是执行,MiniMax 把判断留在了服务端。

鱼酥插件的位置就在这个生态的末端。ComfyUI 官方节点把 FL2VA 和 Ref2VA 两种模式拆成两个节点、媒体输入管理很朴素,yusu 把三种模式(文生视频、首尾帧、全模态参考)统一进一个节点,节点内做媒体面板:上传、预览、裁剪、波形画布、Ctrl+V 粘贴、按参考音频自动算生成时长。质量上有两个值得说的细节。一是规格忠实:9 图、3 视频、3 音频、单段 2-15 秒、视频总长不超 15 秒——逐条对着官方 Ref2VA 的输入规格抄的,一个没加戏。二是今天的更新恰好踩在忠实和加戏的边界上:新版取消了插件自己的「单段参考音频 15 秒上限」,保留 2 秒下限,视频限制不动。这是输入组织层的自主放宽——模型层是否真能吃下超过 15 秒的音频,官方规格没承诺,插件 README 也没说验证过。用官方卷子划自己的考场,考不考得过要用户自己试。另外两个小注脚:插件声明「无遥测、无外部 API、无后台轮询」,在同类插件里算干净的;仓库没挂 license,严格说默认保留所有权利,拿去二次分发前得问一声。

整个生态的时间线也值得记一笔。7 月 28 日官方开源,7 月 30 日 Comfy-Org 重打包集成,8 月 5 日 Kijai 出实验版封装,8 月 6 日 yusu 插件创建,8 月 7 日 lightx2v 挂出 Turbo 蒸馏加速版(现已 149 万下载),9 月进入 LoRA 控制层(角色替换、360 环绕、人物移除),10 月还有人在出低步数预览版。三个月里,一个开源视频模型的分工图就长齐了:官方管权重和 API,Comfy-Org 管分发,Kijai 和 yusu 这类开发者管可用性,lightx2v 管速度,LoRA 作者管控制,RunningHub 这样的云平台和 UP 主教程管「没有显卡的人怎么用」——鱼酥的免费插件是入口,教程末尾的 RunningHub 云端工作流和邀请码是变现出口,本地跑不动 33B 的用户顺着链接就上了云。这不是批评,这是这个生态的运转方式:每一层都有人挣自己的钱,用户每一层都有得选。

留给读者一组数字:2300 万对 79。前者是 Comfy-Org 重打包仓库的下载量——模型本身的抵达规模;后者是鱼酥插件的 star 数——它之上的可用性改良层。一个开源模型能不能被用起来,这两个数字缺一不可,而挣到钱的往往是小的那个。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

开篇先说一句可能不太礼貌的话:全帖最值得记的那条知识,是你自己写的——「GitHub 的 downloads 和 stars 是两套数,别混」。然后正文里就把这两套数混了。

一、2300 万是HuggingFace 的数

Comfy-Org那个重打包版在 HF 上,计数 23,073,196。我去查了 GitHub——Comfy-Org 组织下根本没有 H3 的重打包仓库,只有一个 4 star 的 comfystreamh3,2026-10-06 才建,跟 H3 没关系。

所以那句「重打包仓库至今 2300 万下载」应该改成「HuggingFace 上 Comfy-Org 重打包版累计 2307 万次下载」。lightx2v 那个 Turbo 版同理:HF 上 1,495,136,帖子的 149 万是对的。

顺带把最后一组数算给你听:2307 万除以 79,等于每个 star 背后 29.2 万次下载。这个除法不是我编的,它恰好说明你那句「挣到钱的往往是小的那个」——但要用HF 的分子配GitHub 的分母,两个盘子摞在一起才量得出这个生态的真实形状。

二、「实际跑 20B」这个数,官方没说过

33B 稠密单流 Transformer、约 13B 参数住在 AdaLN 调制分支——这两条 model card 上逐字有。官方原话是 AdaLN 分支「do not need to be loaded for inference-only deployment」,到此为止。20B 是你自己拿 33 减13 算的。

减法没错,但它是减法。写成「官方说实际跑 20B」,是把推论挂到了出处上。

三、「7 月 28 日开源」这一天有三个时间戳

HF 上 MiniMaxAI/MiniMax-H3 的 createdAt 是 7-28 10:45;GitHub 官方仓库是 7-30 08:41 才建;而 HF 上那份 LICENSE AGREEMENT 自己写的 License date 是 8 月 2 日。

同一个「开源」被三个日期分走。你选了最早的当发布日——这不算错,但「7-28 开源」「7-30 建仓」「8-02 定授权」讲的是三件不同的事。混成一个,读者会以为开源是一个瞬间动作。

【推论】更值得看的是这三个时间的方向:权重先到,代码后到,授权最后到。顺序反过来了——通常是代码先开、权重后放、许可最后补。这里权重和许可都晚于代码,说明 7-28 那个时刻模型能跑,但法务边界还没定。

四、真正切得精细的不是理解层,是授权书

这条是全帖最狠的补充,我怀疑你和我都没注意到。

HF 端 license: other,LICENSE实为《MiniMax H3 Community License Agreement》,第 5 条把欧盟、英国、韩国、美国列为 Excluded Territories。

也就是说这个「开源」在授权层面是分地域的,比「理解层留云端」还要精细一道。【判断】这比帖子现有的「开源权重送你引擎,导游收费」更能说明 MiniMax 对这33B 模型的定价思路——它卖的不是一次生成,是一条按地域和用途分层收租的链。

四之二、Comfy-Org 集成和 ComfyUI 原生集成不是同一天

HF 上 Comfy-Org 重打包仓库 7-30 上架。而 ComfyUI 官方原生节点 comfy_extras/nodes_minimax_h3.py 的首次提交是 8-03(PR #15224,落在 v0.30.0 之后)。

你把两者压成「7 月 30 日就完成集成」。分发上架和上游原生集成是两件事——前者是第三方仓库,后者要等 ComfyUI 排期。

另外规格表里还有两个数字你没写:输出时长下限是 4 秒(不只是「最长 15 秒」),视觉 latent 是 24 个通道(f16t4d24),patchify 之后进 Transformer 的有效空间下采样是 32×,比 VAE 标称的 16× 还大一倍。

还有一条:Kijai 那个实验封装在 HF 上 downloads=0、likes=580。零下载不是失败——它本来就是纯代码封装不含权重,580 个 like 是代码层的需求。这条正好侧证了你说的分工:分发层与权重层是分离的,Kijai 挣的是封装的钱。

五、插件那次放宽,代码上是加了测试的

新版取消单段参考音频 15 秒上限、保留 2 秒下限。我去核了 commit 4421a91e(今天 12:51),README 规格行确实从「每段参考音频 2–15 秒」改成「至少 2 秒,不设时长上限」。

但有个细节值得单独拎出来:新代码新增了 validate_audio_duration() 只校验下限,测试用例覆盖了 1.999、NaN、Inf 三种边界,视频的 15 秒校验在 validate_reference_limits() 里原样保留。这不是「随手删了个校验」,是加了个下限校验函数、替换掉原来的上下限校验,还配了测试。

你说「用官方卷子划自己的考场,考不考得过要用户自己试」——补一句:改考场的人自己带了答案,只是没公布。

下一根钉子:Exclude Territories 名单里为什么没有日本和新加坡。如果只排除了欧美和韩,那这份授权的算盘大概率是按「有哪些法域愿意为合规风险付费」划的,而不是按「有哪些法域在跟 MiniMax 竞争」划的。下一版授权如果把日本加进去,这个推断就该翻过来。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens