MiniMax-H3 深度研究

研究对象:MiniMaxAI/MiniMax-H3(别称 Hailuo 3.0)

文本版 · 供搜索与朗读

MiniMax-H3 深度研究

MiniMax-H3 深度研究

能「一边拍片一边配乐」的 33B 全模态模型

研究对象:MiniMaxAI/MiniMax-H3(别称 Hailuo 3.0)

研究时间:2026-08-12 | 多源交叉核证(官方 / HF 卡 / AMA / 独立媒体 / 中文核实)

目录

〇、费曼视角 · 一句话讲清
一、它到底是什么(含事实校正)
二、架构鸟瞰(技术深拆)
三、能力实测与边界
四、开源与许可(最该细读)
五、生态与部署
六、横向对比:全模态视频诸强
七、诚实的边界
八、结论
附:资料来源

〇、费曼视角 · 一句话讲清

试想一位能一边拍画面、一边同步写出配乐与对白的导演。过往的视频 AI,是先拍默片(视觉模型),再外包配音棚(TTS / 音乐模型),最后由剪辑师把声音「贴合」画面——三步串行,嘴形与脚步常对不齐。

MiniMax-H3 就是那位一人包办的导演:它把文字、图片、视频、音频全塞进同一个 33B 模型,一次前向传播,画面与立体声同时出炉,且声音是因、画面是果地联合生成,而非事后拼贴。沉默视频早已「够用」,难的是「声画同源」——H3 想从结构上解决这桩 generative media 的硬骨头。

一、它到底是什么(侦察结论 + 关键校正)

项内容

出品方MiniMax(上海)| 视频产品线「海螺」第三代(Hailuo 01 → 02 → H3 / Hailuo 3.0)

发布日2026-07-31(API + Hailuo App 同步;同日字节 Seedance 2.5 发布,正面对撞)

开源权重日2026-08-03(HF MiniMaxAI/MiniMax-H3 + 魔搭 ModelScope 镜像)

定位通用全模态视频生成:理解文本/图像/视频/音频,生成带原生立体声音频的视频

核心网络H3-Omni-Transformer:33B 参数、稠密(dense)、单流 Transformer;约 13B 在 AdaLN 分支(推理可缓存)

输出规格最长 15s、24fps、最高 2K;原生立体声 32kHz;默认 H3-Base 768p

输入规格任意模态混合:最多 9 图 + 3 视频 + 3 音频;提示词上限 7000 字符;11 种语言对话

三大组件① H3-Context-IR(指令理解,未开源)② H3-Base(已开源,FL2VA / Ref2VA)③ H3-Regenerate-2K(2K 再生,未开源)

文本编码器Qwen3-VL-32B(第 50 层隐藏态,nvfp4_awq)——真实 Apache 2.0 开源

精度BF16(可量化 int8 / fp8 / nvfp4_awq)

托管MiniMax API(全球)、fal、Segmind;本地 ComfyUI / Diffusers / SGLang / h3.c

⚠️ 关键事实校正(含与既有《h3.c深度研究》之重要更正)

常见说法核证结论

「H3 是 Mamba / SSM + 注意力 混合架构」更正。《h3.c深度研究》沿用了此说,但 官方博客与多份独立分析一致确认 H3 为稠密单流 Transformer,无 Mamba/SSM 块。该混淆源于把 H3 与同门文本模型 MiniMax-01(闪电注意力)张冠李戴。H3 的「统一」靠 3D 多模态 RoPE,非 SSM。

「本地能跑 2K」误。开源 H3-Base 默认输出 768p;2K 由 H3-Regenerate-2K 完成,官方明言未开源。本地即 768p;2K 须走云端 API。

「33B ≈ 37 GiB 权重」口径混淆。「33B」指 DiT 主体;完整栈满血约 144GB(DiT 66.3 + 编码器 66.7 + 视频 VAE 10.4 + 音频 VAE 0.6)。37 GiB 为某量化切片;量化 ComfyUI 版压至 42.5GB。

「完全开源」否。权重可下载,但受 Community License 约束(自定义,非 OSI);Context-IR 与 Regenerate-2K 未开放。

「RTX 3060 12GB 轻松跑满血」半真。12GB + 动态卸载确能出片,但重度量化,5s 480p 约 5 分钟;「轻松」须打折扣。

「苹果 64–128GB 统一内存即可」偏乐观。MLX 实测下载 ~115GB;建议 ≥192GB,512GB 已验证。

二、架构鸟瞰(技术深拆)

2.1 为什么「稠密单流」是 H3 的精髓

多数「视频+声音」系统走串行拼装:文生视频出默片 → 独立 TTS/音乐出音轨 → 同步对口型事后缝合。H3 反其道:一个 33B 稠密 Transformer,单流处理,四种模态共享权重,一次前向同时预测视频与音频 latent。

费曼比喻:别人「画师画完,交作曲家谱曲,再请剪辑对嘴」;H3「一人执笔,画面与乐谱同纸落定」——声画同源,不会各说各话。

统一输入(text / image / video / audio)
│
┌───────────────────────────────┐
│ H3-Encoder(文本 Qwen3-VL-32B)│
│ H3-VisualVAE(视频) │
│ H3-AudioVAE(立体声 L/R) │
└───────────────┬───────────────┘
│ 统一 token 序列(3D 多模态 RoPE 同空间)
▼
┌───────────────────────────────┐
│ H3-Omni-Transformer(33B 稠密单流)│
│ · 50 层;隐藏维度 5376 │
│ · ~13B 参数在 AdaLN 分支(可缓存)│
│ · 无模态专属 attention/FFN │
└───────────────┬───────────────┘
│ 联合预测
┌─────────┴─────────┐
▼ ▼
视频 latent 音频 latent
(VisualVAE 解码) (AudioVAE 解码立体声)

2.2 VAE:把「高分辨率视频」压得动

H3-VisualVAE(f16t4d24):时间因果结构,空间压缩 16×、时间压缩 4×,latent channel 24;进 Transformer 前再 1×2×2 patchify,等效空间下采样 32×——高分辨率算力可控的支点。

H3-AudioVAE:同一编码器/解码器分别处理左、右声道再重组立体声;每声道把 32kHz 压成 40Hz latent token 序列。

2.3 AdaLN 分支:13B 参数的「可卸妆」

约 13B 参数集中在 AdaLN(自适应层归一化)分支,调制输出可预计算并缓存,推理时无需常驻加载。训练/微调满 33B,纯推理「卸下」约 13B(~26GB)——MLX 移植把内存从 ~134GB 压到 ~40GB 即此一手。

2.4 与同门 MiniMax-01 之别

模型类型架构开源

MiniMax-01 / H1-MoE语言模型混合专家 + 闪电注意力(线性注意力)部分

MiniMax H3全模态视频生成稠密单流 Transformer + 3D RoPEH3-Base 权重(Community License)

2.5 稀疏注意力:未发布的下一张牌

NxCode 等多方指出 MiniMax 提及过稀疏注意力路线(类似 M3 的 MSA),但当前开源运行时是 full-attention 路径,稀疏实现未公开。结论:本地跑测的是 full-attention 公开路径,不能与云端(内部 kernel + 稀疏 + 两段管线)的延迟/吞吐直接对比——比较时须标 runtime 标签。

三、能力实测与边界

原生立体声是真稀缺点:多数开源视频模型出默片(HunyuanVideo 1.5 即无声),H3 把对白+音效+配乐在同一次前向生成,做短片/广告/品牌内容者「出片自带声」,少一道工序。

全参考模式(Ref2VA / R2V):一次吃进最多 9 图 + 3 视频 + 3 音频,用自然语言描述素材间关系——H3 最具价值的差异化能力。

指令编辑(Context-IR):自然语言改已有片段,免重生成;但该模块未开源,本地须调 API 或自建提示词系统。

质量边界:独立评测(Simon Willison M5 Max 实测)显示画面惊艳,但音频若提示词未给足声音指引,会成「语音形状的噪声」;音频质量高度依赖提示词中的声音描写。

榜单成绩(MiniMax 自评 + 独立榜):

Video Arena:开源视频模型第 1,图生视频 1476 分,仅落后 Seedance 2.0(1478)2 分;较 HunyuanVideo-1.5 高 ~280 分。

Artificial Analysis:音频视频编辑 Elo ~1130 第 1;文生视频第 2、图生视频第 3;所有视频榜进前三、质量/价格象限最优。

提醒:Arena 类 Elo 反映特定评审池在特定 prompt 集上的偏好,方向性证据,非绝对质量真理。

四、开源与许可(最该细读的一节)

H3 不是 OSI 意义上的开源,而是「公开下载的开放权重 + 自定义 Community License」。

条款内容对你意味着

适用地域全球除 美国、欧盟、英国、韩国(四地须单独申请授权)四地本地跑权重须走申请;托管 API 全球可用

商业收入门槛年营收 >$2000 万 须事先书面授权「免费商用」有天花板

署名商业产品 UI 须显著展示「MiniMax H3」UI 改动,非脚注

禁止模型洗白不得用 H3 产出训练/微调/改进其他 AI 模型(含蒸馏)合成数据管线、拿视频喂别家者当心

分发须随附协议、NOTICE、标注修改标准但约束下游

管辖法律香港特区法律、香港专属管辖风险登记簿留一行

生效日2026-08-02—

真实开源组件文本编码器 Qwen3-VL-32B 为 Apache 2.0栈中唯一货真价实 OSI 开源件

为何排除四地?

MiniMax 开发者关系负责人 Ryan Lee 在 X 回应:源于与迪士尼、环球、华纳等好莱坞巨头正在进行的生成式视频版权诉讼——是「版权官司逼出的自保」,非阴谋。

转机

MiniMax 于 2026-08-09 在 X 宣布,待版权问题解决,拟迁移至 Apache 2.0(地域限制与收入门槛或撤废),并预告将开源 H3-Regenerate-2K、低步数 4/8-NFE 变体、文生图模型。

五、生态与部署

5.1 开箱即用的生态(Day-0)

ComfyUI:发布当日即支持,Comfy-Org/MiniMax-H3 提供 T2V / FLF2V / R2V 工作流与量化权重。

Diffusers:官方加 pipeline,Python 熟悉接口。

SGLang:分布式部署指引。

h3.c(antirez):纯 C + Metal 为 Apple Silicon 重写(MIT,见《h3.c深度研究》专文)。

16 家芯片平台发布即适配(英伟达/英特尔/AMD/华为昇腾/沐曦/摩尔线程/Apple 等)。

5.2 硬件梯度(关键!)

「33B 稠密」≠ 小模型。完整栈满血约 144GB;量化 ComfyUI 版 ~42.5GB。

档位设备体验预期

旗舰桌面RTX 4090/3090 (24GB) + 量化较高分辨率可跑,质量佳

消费级RTX 4070 Ti / 3060 (12GB) + int8 + 卸载5s 480p 约 1–5 分钟;能跑有代价

边缘/迷你DGX Spark (FP8)加载 ~89GB,FL2VA 实测 ~155s

苹果M 系(MLX)建议 ≥192GB 统一内存;512GB 已验证

服务器8×141GB 级(BF16 满血)个人基本免谈

系统内存 32GB 起步、64GB+ 推荐;硬盘必须 NVMe;本地 2K 不存在(H3-Base = 768p)。

5.3 最小可行命令(ComfyUI 本地,量化版)

# 1) 拉取 Comfy-Org 重打包权重(约 42.5GB,4 文件)
# diffusion_models/ 放 fl2va / ref2va 的 pruned_int8_convrot.safetensors
# text_encoders/ 放 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
# vae/ 放 video_vae_fp16 + audio_vae_fp32

# 2) ComfyUI ≥ 0.30.0,导入官方 MiniMax H3 工作流 JSON(T2V / FLF2V / R2V)
# 填提示词(务必含声音描写:对白+环境音+配乐),设 16:9、5–15s,跑!

# 不想买 GPU?走 API(七牛云 MaaS 等):model = "minimax/minimax-h3",按秒计费

提示:R2V 用 ref2va 扩散模型(与 T2V/I2V 的 fl2va 不同),须单独下载;文本编码器与 VAE 共用。

六、横向对比:全模态视频诸强

模型分辨率原生音频开放权重本地可跑备注

MiniMax H3768p 本地 / 2K 云端✅ 立体声 32k✅(Community Lic)✅(量化)多参考融合控制最强

Sora 2 / Pro至 1080p✅❌❌封闭、贵($0.30–0.50/s)

Veo 3.1至 4K✅❌❌封闭、贵($0.40–0.75/s 含音)

Seedance 2.0/2.5至 1080p✅❌❌封闭,价格约 H3 三倍

HunyuanVideo 1.5480/720p +1080p SR❌(默片)✅(开放)✅本地无声视频之王

Wan 2.7—✅✅✅AA 榜单同列前三

LTX-2.3—✅✅✅声画联合、可训练

Kling / Runway1080p❌❌❌封闭

H3 的差异化不在「绝对画质碾压」,而在 开放权重 + 本地可控 + 原生声画 + 多参考控制 + 约 1/3 价格 的组合——封闭对手给不了的五件套。

6.1 一图定夺:何时选它

要「视频 + 同步声音」且不愿被云厂商按秒收割?
├─ 是 + 需本地/可改/数据不出机 → ★ MiniMax H3(量化本地跑 768p;2K 走 API)
├─ 是 + 只要最高画质不差钱 → Sora 2 / Veo 3.1(封闭但 4K)
└─ 否(只要默片)+ 纯本地 → HunyuanVideo 1.5(更轻)

七、诚实的边界

「开源」须拆开看:权重可下 ≠ OSI 开源;Context-IR 与 Regenerate-2K 未开源;许可排除美/欧/英/韩,营收超 $20M 须授权。

本地只有 768p:2K 是云端特权;勿把「本地出片」误读为「本地 2K」。

音频质量是提示词工程:不给声音描写,出「语音形状噪声」;三类声音不可缺。

硬件门槛被营销软化:12GB 能跑≠流畅;苹果建议 192GB、已验证 512GB;满血 144GB。

基准是方向性证据:Elo 非生产真理;上生产前按自身 prompt 集实测。

稀疏注意力未公开:本地 full-attention 与云端稀疏路径延迟不可直接比。

八、结论

MiniMax-H3 不是又一个「更小的前沿模型」,而是把生成式视频里最难的「声画同源」单独产品化:33B 稠密单流 Transformer,一次前向同出画面与立体声,多参考融合控制冠绝开源圈,权重可下、可本地、可微调,价格约封闭对手三分之一。

它的战略分量,在于把视频生成这条此前由 Sora/Veo 封闭把持的战线,第一次以「开放权重 + 本地可控」的姿态撕开缺口——与 DeepSeek、Qwen、Kimi 一道,构成中国实验室 2026 年的开放权重浪潮。

然须清醒:它非 OSI 开源(Community License + 四地排除 + 两模块未开放),本地止于 768p,音频质量吃提示词功夫,硬件门槛被营销软化。对「本地优先、数据不出机、长期可控」的诉求,H3 是目前开放权重视频模型里最值得放进短名单的选手;但若指望「下载即 2K、12GB 流畅、全球免授权」,请收起期待——它生来是「开放权重浪潮里的尖兵」,不是「无拘无束的免费午餐」。

附:资料来源

• MiniMax 官方开源博客(minimaxi.com,2026-08):H3-Omni-Transformer、VAE、AdaLN、组件拆分

• MiniMax 官方 AMA / Reddit(2026-08-09):Apache 2.0 迁移意向、Regenerate-2K 预告、稀疏注意力

• HuggingFace MiniMaxAI/MiniMax-H3 模型卡与 LICENSE(Community License,生效 2026-08-02)

• metirai.com / nxcode.io / domoai.app / atlascloud.ai(2026-08):架构、双榜第一、许可逐条、系统边界

• pandaily.com / newshunt.io(2026-08):vs Seedance 2.0 定价、本地双 RTX 5090、API 价格

• dev.to / ai-indeed.com(2026-08):ComfyUI 部署、硬件梯度、内存需求(满血 144GB)

• 七牛云 MaaS 实战教程(news.qiniu.com):ComfyUI 双路径、API 价格(¥0.8/s 2K)

• 腾讯新闻(2026-08-04 / 08-10):Video Arena 第一、四地排除回应(Ryan Lee)

• 既有《h3.c深度研究》(2026-08-11):antirez C/Metal 引擎专文(本文已更正其架构表述)

*本报告由 WorkBuddy(千寻)核查撰写,技术事实经多源交叉印证,营销表述已逐条标注。*

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

我来对账。最硬的一笔钱算得漂亮:满血 144GB,我照仓库文件重加了一遍,66.28 加 66.73 加 10.42 加 0.61,等于 144.04。分毫不差,这种账给满分。

榜单就露馅了。我去抓 Artificial Analysis 的实时榜:H3 图生视频 1185,Seedance 2.0 是 1190,差 5 分;HunyuanVideo-1.5 在 1126,领先 59 分。帖子写 1476 对 1478 差 2 分、领先 280 分——这两个数我在任何子榜都翻不到。不知道从哪来的。

总榜第一名更好玩:Minimax H3 Max,fal 后训练的版本,1202 分,2.4 美元一分钟。原厂被改装车超了 17 分,车价还更便宜。

许可逐条对过,四地排除、两千万门槛、香港法管辖,全在。帖子漏了个细节:签约主体是新加坡的 Nanonoble Pte. Ltd.。上海团队,新加坡壳,香港法庭。三个地名摆一起,比模型卡上的任何参数都耐读。

还有个数:Comfy-Org 打包仓下载 2137 万次,官方主仓 526 万。用脚投票的人,投的是量化那份。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens