MiniMax-H3 深度研究
研究对象:MiniMaxAI/MiniMax-H3(别称 Hailuo 3.0)
文本版 · 供搜索与朗读
MiniMax-H3 深度研究
MiniMax-H3 深度研究
能「一边拍片一边配乐」的 33B 全模态模型
研究对象:MiniMaxAI/MiniMax-H3(别称 Hailuo 3.0)
研究时间:2026-08-12 | 多源交叉核证(官方 / HF 卡 / AMA / 独立媒体 / 中文核实)
目录
〇、费曼视角 · 一句话讲清
一、它到底是什么(含事实校正)
二、架构鸟瞰(技术深拆)
三、能力实测与边界
四、开源与许可(最该细读)
五、生态与部署
六、横向对比:全模态视频诸强
七、诚实的边界
八、结论
附:资料来源
〇、费曼视角 · 一句话讲清
试想一位能一边拍画面、一边同步写出配乐与对白的导演。过往的视频 AI,是先拍默片(视觉模型),再外包配音棚(TTS / 音乐模型),最后由剪辑师把声音「贴合」画面——三步串行,嘴形与脚步常对不齐。
MiniMax-H3 就是那位一人包办的导演:它把文字、图片、视频、音频全塞进同一个 33B 模型,一次前向传播,画面与立体声同时出炉,且声音是因、画面是果地联合生成,而非事后拼贴。沉默视频早已「够用」,难的是「声画同源」——H3 想从结构上解决这桩 generative media 的硬骨头。
一、它到底是什么(侦察结论 + 关键校正)
项内容
出品方MiniMax(上海)| 视频产品线「海螺」第三代(Hailuo 01 → 02 → H3 / Hailuo 3.0)
发布日2026-07-31(API + Hailuo App 同步;同日字节 Seedance 2.5 发布,正面对撞)
开源权重日2026-08-03(HF MiniMaxAI/MiniMax-H3 + 魔搭 ModelScope 镜像)
定位通用全模态视频生成:理解文本/图像/视频/音频,生成带原生立体声音频的视频
核心网络H3-Omni-Transformer:33B 参数、稠密(dense)、单流 Transformer;约 13B 在 AdaLN 分支(推理可缓存)
输出规格最长 15s、24fps、最高 2K;原生立体声 32kHz;默认 H3-Base 768p
输入规格任意模态混合:最多 9 图 + 3 视频 + 3 音频;提示词上限 7000 字符;11 种语言对话
三大组件① H3-Context-IR(指令理解,未开源)② H3-Base(已开源,FL2VA / Ref2VA)③ H3-Regenerate-2K(2K 再生,未开源)
文本编码器Qwen3-VL-32B(第 50 层隐藏态,nvfp4_awq)——真实 Apache 2.0 开源
精度BF16(可量化 int8 / fp8 / nvfp4_awq)
托管MiniMax API(全球)、fal、Segmind;本地 ComfyUI / Diffusers / SGLang / h3.c
⚠️ 关键事实校正(含与既有《h3.c深度研究》之重要更正)
常见说法核证结论
「H3 是 Mamba / SSM + 注意力 混合架构」更正。《h3.c深度研究》沿用了此说,但 官方博客与多份独立分析一致确认 H3 为稠密单流 Transformer,无 Mamba/SSM 块。该混淆源于把 H3 与同门文本模型 MiniMax-01(闪电注意力)张冠李戴。H3 的「统一」靠 3D 多模态 RoPE,非 SSM。
「本地能跑 2K」误。开源 H3-Base 默认输出 768p;2K 由 H3-Regenerate-2K 完成,官方明言未开源。本地即 768p;2K 须走云端 API。
「33B ≈ 37 GiB 权重」口径混淆。「33B」指 DiT 主体;完整栈满血约 144GB(DiT 66.3 + 编码器 66.7 + 视频 VAE 10.4 + 音频 VAE 0.6)。37 GiB 为某量化切片;量化 ComfyUI 版压至 42.5GB。
「完全开源」否。权重可下载,但受 Community License 约束(自定义,非 OSI);Context-IR 与 Regenerate-2K 未开放。
「RTX 3060 12GB 轻松跑满血」半真。12GB + 动态卸载确能出片,但重度量化,5s 480p 约 5 分钟;「轻松」须打折扣。
「苹果 64–128GB 统一内存即可」偏乐观。MLX 实测下载 ~115GB;建议 ≥192GB,512GB 已验证。
二、架构鸟瞰(技术深拆)
2.1 为什么「稠密单流」是 H3 的精髓
多数「视频+声音」系统走串行拼装:文生视频出默片 → 独立 TTS/音乐出音轨 → 同步对口型事后缝合。H3 反其道:一个 33B 稠密 Transformer,单流处理,四种模态共享权重,一次前向同时预测视频与音频 latent。
费曼比喻:别人「画师画完,交作曲家谱曲,再请剪辑对嘴」;H3「一人执笔,画面与乐谱同纸落定」——声画同源,不会各说各话。
统一输入(text / image / video / audio)
│
┌───────────────────────────────┐
│ H3-Encoder(文本 Qwen3-VL-32B)│
│ H3-VisualVAE(视频) │
│ H3-AudioVAE(立体声 L/R) │
└───────────────┬───────────────┘
│ 统一 token 序列(3D 多模态 RoPE 同空间)
▼
┌───────────────────────────────┐
│ H3-Omni-Transformer(33B 稠密单流)│
│ · 50 层;隐藏维度 5376 │
│ · ~13B 参数在 AdaLN 分支(可缓存)│
│ · 无模态专属 attention/FFN │
└───────────────┬───────────────┘
│ 联合预测
┌─────────┴─────────┐
▼ ▼
视频 latent 音频 latent
(VisualVAE 解码) (AudioVAE 解码立体声)
2.2 VAE:把「高分辨率视频」压得动
H3-VisualVAE(f16t4d24):时间因果结构,空间压缩 16×、时间压缩 4×,latent channel 24;进 Transformer 前再 1×2×2 patchify,等效空间下采样 32×——高分辨率算力可控的支点。
H3-AudioVAE:同一编码器/解码器分别处理左、右声道再重组立体声;每声道把 32kHz 压成 40Hz latent token 序列。
2.3 AdaLN 分支:13B 参数的「可卸妆」
约 13B 参数集中在 AdaLN(自适应层归一化)分支,调制输出可预计算并缓存,推理时无需常驻加载。训练/微调满 33B,纯推理「卸下」约 13B(~26GB)——MLX 移植把内存从 ~134GB 压到 ~40GB 即此一手。
2.4 与同门 MiniMax-01 之别
模型类型架构开源
MiniMax-01 / H1-MoE语言模型混合专家 + 闪电注意力(线性注意力)部分
MiniMax H3全模态视频生成稠密单流 Transformer + 3D RoPEH3-Base 权重(Community License)
2.5 稀疏注意力:未发布的下一张牌
NxCode 等多方指出 MiniMax 提及过稀疏注意力路线(类似 M3 的 MSA),但当前开源运行时是 full-attention 路径,稀疏实现未公开。结论:本地跑测的是 full-attention 公开路径,不能与云端(内部 kernel + 稀疏 + 两段管线)的延迟/吞吐直接对比——比较时须标 runtime 标签。
三、能力实测与边界
原生立体声是真稀缺点:多数开源视频模型出默片(HunyuanVideo 1.5 即无声),H3 把对白+音效+配乐在同一次前向生成,做短片/广告/品牌内容者「出片自带声」,少一道工序。
全参考模式(Ref2VA / R2V):一次吃进最多 9 图 + 3 视频 + 3 音频,用自然语言描述素材间关系——H3 最具价值的差异化能力。
指令编辑(Context-IR):自然语言改已有片段,免重生成;但该模块未开源,本地须调 API 或自建提示词系统。
质量边界:独立评测(Simon Willison M5 Max 实测)显示画面惊艳,但音频若提示词未给足声音指引,会成「语音形状的噪声」;音频质量高度依赖提示词中的声音描写。
榜单成绩(MiniMax 自评 + 独立榜):
Video Arena:开源视频模型第 1,图生视频 1476 分,仅落后 Seedance 2.0(1478)2 分;较 HunyuanVideo-1.5 高 ~280 分。
Artificial Analysis:音频视频编辑 Elo ~1130 第 1;文生视频第 2、图生视频第 3;所有视频榜进前三、质量/价格象限最优。
提醒:Arena 类 Elo 反映特定评审池在特定 prompt 集上的偏好,方向性证据,非绝对质量真理。
四、开源与许可(最该细读的一节)
H3 不是 OSI 意义上的开源,而是「公开下载的开放权重 + 自定义 Community License」。
条款内容对你意味着
适用地域全球除 美国、欧盟、英国、韩国(四地须单独申请授权)四地本地跑权重须走申请;托管 API 全球可用
商业收入门槛年营收 >$2000 万 须事先书面授权「免费商用」有天花板
署名商业产品 UI 须显著展示「MiniMax H3」UI 改动,非脚注
禁止模型洗白不得用 H3 产出训练/微调/改进其他 AI 模型(含蒸馏)合成数据管线、拿视频喂别家者当心
分发须随附协议、NOTICE、标注修改标准但约束下游
管辖法律香港特区法律、香港专属管辖风险登记簿留一行
生效日2026-08-02—
真实开源组件文本编码器 Qwen3-VL-32B 为 Apache 2.0栈中唯一货真价实 OSI 开源件
为何排除四地?
MiniMax 开发者关系负责人 Ryan Lee 在 X 回应:源于与迪士尼、环球、华纳等好莱坞巨头正在进行的生成式视频版权诉讼——是「版权官司逼出的自保」,非阴谋。
转机
MiniMax 于 2026-08-09 在 X 宣布,待版权问题解决,拟迁移至 Apache 2.0(地域限制与收入门槛或撤废),并预告将开源 H3-Regenerate-2K、低步数 4/8-NFE 变体、文生图模型。
五、生态与部署
5.1 开箱即用的生态(Day-0)
ComfyUI:发布当日即支持,Comfy-Org/MiniMax-H3 提供 T2V / FLF2V / R2V 工作流与量化权重。
Diffusers:官方加 pipeline,Python 熟悉接口。
SGLang:分布式部署指引。
h3.c(antirez):纯 C + Metal 为 Apple Silicon 重写(MIT,见《h3.c深度研究》专文)。
16 家芯片平台发布即适配(英伟达/英特尔/AMD/华为昇腾/沐曦/摩尔线程/Apple 等)。
5.2 硬件梯度(关键!)
「33B 稠密」≠ 小模型。完整栈满血约 144GB;量化 ComfyUI 版 ~42.5GB。
档位设备体验预期
旗舰桌面RTX 4090/3090 (24GB) + 量化较高分辨率可跑,质量佳
消费级RTX 4070 Ti / 3060 (12GB) + int8 + 卸载5s 480p 约 1–5 分钟;能跑有代价
边缘/迷你DGX Spark (FP8)加载 ~89GB,FL2VA 实测 ~155s
苹果M 系(MLX)建议 ≥192GB 统一内存;512GB 已验证
服务器8×141GB 级(BF16 满血)个人基本免谈
系统内存 32GB 起步、64GB+ 推荐;硬盘必须 NVMe;本地 2K 不存在(H3-Base = 768p)。
5.3 最小可行命令(ComfyUI 本地,量化版)
# 1) 拉取 Comfy-Org 重打包权重(约 42.5GB,4 文件)
# diffusion_models/ 放 fl2va / ref2va 的 pruned_int8_convrot.safetensors
# text_encoders/ 放 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
# vae/ 放 video_vae_fp16 + audio_vae_fp32
# 2) ComfyUI ≥ 0.30.0,导入官方 MiniMax H3 工作流 JSON(T2V / FLF2V / R2V)
# 填提示词(务必含声音描写:对白+环境音+配乐),设 16:9、5–15s,跑!
# 不想买 GPU?走 API(七牛云 MaaS 等):model = "minimax/minimax-h3",按秒计费
提示:R2V 用 ref2va 扩散模型(与 T2V/I2V 的 fl2va 不同),须单独下载;文本编码器与 VAE 共用。
六、横向对比:全模态视频诸强
模型分辨率原生音频开放权重本地可跑备注
MiniMax H3768p 本地 / 2K 云端✅ 立体声 32k✅(Community Lic)✅(量化)多参考融合控制最强
Sora 2 / Pro至 1080p✅❌❌封闭、贵($0.30–0.50/s)
Veo 3.1至 4K✅❌❌封闭、贵($0.40–0.75/s 含音)
Seedance 2.0/2.5至 1080p✅❌❌封闭,价格约 H3 三倍
HunyuanVideo 1.5480/720p +1080p SR❌(默片)✅(开放)✅本地无声视频之王
Wan 2.7—✅✅✅AA 榜单同列前三
LTX-2.3—✅✅✅声画联合、可训练
Kling / Runway1080p❌❌❌封闭
H3 的差异化不在「绝对画质碾压」,而在 开放权重 + 本地可控 + 原生声画 + 多参考控制 + 约 1/3 价格 的组合——封闭对手给不了的五件套。
6.1 一图定夺:何时选它
要「视频 + 同步声音」且不愿被云厂商按秒收割?
├─ 是 + 需本地/可改/数据不出机 → ★ MiniMax H3(量化本地跑 768p;2K 走 API)
├─ 是 + 只要最高画质不差钱 → Sora 2 / Veo 3.1(封闭但 4K)
└─ 否(只要默片)+ 纯本地 → HunyuanVideo 1.5(更轻)
七、诚实的边界
「开源」须拆开看:权重可下 ≠ OSI 开源;Context-IR 与 Regenerate-2K 未开源;许可排除美/欧/英/韩,营收超 $20M 须授权。
本地只有 768p:2K 是云端特权;勿把「本地出片」误读为「本地 2K」。
音频质量是提示词工程:不给声音描写,出「语音形状噪声」;三类声音不可缺。
硬件门槛被营销软化:12GB 能跑≠流畅;苹果建议 192GB、已验证 512GB;满血 144GB。
基准是方向性证据:Elo 非生产真理;上生产前按自身 prompt 集实测。
稀疏注意力未公开:本地 full-attention 与云端稀疏路径延迟不可直接比。
八、结论
MiniMax-H3 不是又一个「更小的前沿模型」,而是把生成式视频里最难的「声画同源」单独产品化:33B 稠密单流 Transformer,一次前向同出画面与立体声,多参考融合控制冠绝开源圈,权重可下、可本地、可微调,价格约封闭对手三分之一。
它的战略分量,在于把视频生成这条此前由 Sora/Veo 封闭把持的战线,第一次以「开放权重 + 本地可控」的姿态撕开缺口——与 DeepSeek、Qwen、Kimi 一道,构成中国实验室 2026 年的开放权重浪潮。
然须清醒:它非 OSI 开源(Community License + 四地排除 + 两模块未开放),本地止于 768p,音频质量吃提示词功夫,硬件门槛被营销软化。对「本地优先、数据不出机、长期可控」的诉求,H3 是目前开放权重视频模型里最值得放进短名单的选手;但若指望「下载即 2K、12GB 流畅、全球免授权」,请收起期待——它生来是「开放权重浪潮里的尖兵」,不是「无拘无束的免费午餐」。
附:资料来源
• MiniMax 官方开源博客(minimaxi.com,2026-08):H3-Omni-Transformer、VAE、AdaLN、组件拆分
• MiniMax 官方 AMA / Reddit(2026-08-09):Apache 2.0 迁移意向、Regenerate-2K 预告、稀疏注意力
• HuggingFace MiniMaxAI/MiniMax-H3 模型卡与 LICENSE(Community License,生效 2026-08-02)
• metirai.com / nxcode.io / domoai.app / atlascloud.ai(2026-08):架构、双榜第一、许可逐条、系统边界
• pandaily.com / newshunt.io(2026-08):vs Seedance 2.0 定价、本地双 RTX 5090、API 价格
• dev.to / ai-indeed.com(2026-08):ComfyUI 部署、硬件梯度、内存需求(满血 144GB)
• 七牛云 MaaS 实战教程(news.qiniu.com):ComfyUI 双路径、API 价格(¥0.8/s 2K)
• 腾讯新闻(2026-08-04 / 08-10):Video Arena 第一、四地排除回应(Ryan Lee)
• 既有《h3.c深度研究》(2026-08-11):antirez C/Metal 引擎专文(本文已更正其架构表述)
*本报告由 WorkBuddy(千寻)核查撰写,技术事实经多源交叉印证,营销表述已逐条标注。*