MiniMax H3 私有化部署方案
MiniMax H3 不是文本大模型,而是开源的"视频+原生立体声"生成模型(2026-07-31 开源)。开源的只有 H3-Base(768p 主干),2K 超分和复杂提示词理解两个模块仍只有官方 API。私有化部署在中国大陆许可上完全可行(社区许可排除的只有 EU/UK/韩/美),商用门槛是年营收 >2000 万…
文本版 · 供搜索与朗读
MiniMax H3 私有化部署方案 — 深度研究
DEEP RESEARCH · 智柴
MiniMax H3 私有化部署方案
深度研究笔记 · 2026-09-07 · 全部关键事实经一手来源核对(许可原文 / HF 模型卡 / SGLang 与 vLLM 官方配方)
开源 2026-07-31
许可 中国大陆可用(排除 EU/UK/韩/美)
商用门槛 年营收 > $20M 需授权
开源部分 仅 H3-Base 768p
生产首选 SGLang
目录
MiniMax H3 私有化部署方案 — 深度研究
日期:2026-09-07 | 全部关键事实来自一手来源(许可原文、HF 模型卡、SGLang/vLLM 官方配方,均已抓取原文核对)
0. 一句话结论
MiniMax H3 不是文本大模型,而是开源的"视频+原生立体声"生成模型(2026-07-31 开源)。开源的只有 H3-Base(768p 主干),2K 超分和复杂提示词理解两个模块仍只有官方 API。私有化部署在中国大陆许可上完全可行(社区许可排除的只有 EU/UK/韩/美),商用门槛是年营收 >2000 万美元才需书面授权。生产部署首选 SGLang(4×H100/H200 或 8 卡昇腾 NPU 均有官方验证配方),单卡/工作站走 ComfyUI 量化生态(24GB 卡即可起步,12GB 是地板),要 2K 官方画质只能"本地 768p + 官方 API 混合"。
1. H3 是什么:先把对象搞清楚
维度
事实
定位
通用全模态生成系统:统一理解文本/图像/视频/音频上下文,生成带原生立体声的视频
官宣开源
2026-07-31(Reuters 报道);许可证落款 2026-08-02
输出规格
4–15 秒、24 FPS、32kHz 立体声、宽高比 21:9~9:16、短边默认 768px(画布 32 的倍数)
提示词语言
11 种稳定支持(含中英)
两个开源 checkpoint
FL2VA(文生视频+首/尾帧控制)、Ref2VA(全参考:≤9 图 + ≤3 视频 + ≤3 音频,共 ≤12 文件,纯音频被拒)
开源边界
只有 H3-Base(768p 生成主干)开源。H3-Context-IR(多模态提示词理解/改写)和 H3-Regenerate-2K(768p→2K 再生成)均未开源,只有官方 API
精度
BF16,且是 CFG 蒸馏后的权重(部署时 cfg-parallel-size 必须为 1,没有负分支)
架构(决定硬件需求的三件事)
H3-Omni-Transformer:33B dense 单流 Transformer,50 个 block;其中 ~13B 参数在 AdaLN 分支里——推理时这部分可预计算/跳过(社区 "pruned" 量化版就是砍这个,体积小 ~40%)。视频+音频各一份 52-block DiT,单份 61.73 GiB (BF16)。
H3-Encoder = Qwen3-VL-32B(取前 50 层隐状态),约 46–51.5 GB BF16,Apache 2.0 无附加限制。
双 VAE:VisualVAE(f16t4d24,patch 后等效 32× 空间/4× 时间压缩,含 ViT 解码器,约 10GB 级)+ AudioVAE(32kHz→40Hz 潜变量,左右声道独立编解码)。
训练时用了原生稀疏注意力,但开源首发只有全注意力推理,稀疏实现"未来更新"。
由此总账:一套 FL2VA 分区 ~134 GiB BF16 权重(DiT+编码器+双 VAE),两个任务分区全下 ~270 GiB;HF 官方仓库全量 464.2 GiB(含 diffusers 格式重复份)。存储预算按 ≥500GB NVMe 规划。
2. 许可与合规(私有化前必须过的一关)
来源:许可原文 + 官方 License Q&A(均已核对原文,媒体报道与原文有出入,以本节为准)。
许可类型:MiniMax H3 Community License Agreement(v2026-08-02),授予方为 MiniMax 新加坡主体 Nanonoble Pte. Ltd.,管辖法域香港。下载/使用即视为接受。
适用地域 = 全球,排除四处:欧盟、英国、韩国、美国。官方 Q&A 明确这是监管原因(EU AI Act、美方视频生成版权诉讼等),"not yet, not ever";被排除地区可走 申请表 单独拿授权。中国大陆属于适用地域,社区许可直接覆盖。
商用门槛:使用 H3 的商业产品/服务年营收 > 2000 万美元需事先书面授权(api@minimax.io,主题 "MiniMax H3 licensing - authorization request");低于门槛自由商用。
商用硬义务:在产品 UI 上显著标注 "MiniMax H3"(许可第 IV.2 条,强制);分发需附协议副本和 NOTICE 文件;鼓励 "Powered by MiniMax H3" 和给生成文件加 AI 标识。
使用限制:不得用 H3 或其输出改进其他 AI 模型;不得军事用途;对外提供服务需自建与 AUP 等强的安全护栏 + 违规举报机制(本地部署后内容审核责任在自己,这点对国内企业还叠加《生成式 AI 服务管理暂行办法》/深度合成标识义务)。
编码器豁免:Qwen3-VL-32B 部分是 Apache 2.0,不受上述约束。
下载渠道:HF 仓库当前未设门禁(2026-09-07 实测 gated:false,匿名可下;vLLM 配方里"需申请访问"的说法已过时);国内走 ModelScope 官方镜像 MiniMax/MiniMax-H3(SGLang 支持 SGLANG_USE_MODELSCOPE=true 直拉)。
3. 硬件门槛总账
资源
最低
生产推荐
存储
FL2VA 单分区 ~135 GiB
全仓库 500+ GiB NVMe(权重随机读取,HDD 会拖垮流式加载)
显存(数据中心)
4×80GB(H100,TP2+Ulysses2,峰值 ~57GB/卡)
4×141GB H200(Ulysses4)或 8×B300 FP8
显存(单卡)
12GB VRAM + 32GB 内存 + NVMe(SGLang 极简路径,流式)
单卡 96GB 可容纳 FL2VA 分区不卸载(容量检查通过)
显存(消费级 ComfyUI)
8GB(DiffSynth NF4 重卸载,很慢)
24GB(pruned INT8 19.5GB + TE 量化 14.6GB)
主机内存
32GB(极简流式路径)
双卡 recipe 需 ≥200GB,推荐 384GB;RTX 2080Ti 22G 老卡也有 W4A8 方案
特殊平台
Turing sm_75、Apple Silicon(h3.c Metal 原生)、AMD MI300X/MI355X、华为昇腾 NPU 均有可跑方案
H20(96GB):未找到任何官方验证配方。按"单卡 96GB 容量检查通过(B300 代理峰值 92.9GB)"推断 FL2VA 分区 BF16 大概率装得下,但 H20 算力弱、去噪是算力受限任务,速度会很差——能买验证过的卡就别赌。
4. 路线 A:SGLang(生产首选,配方最全)
SGLang Diffusion 有 H3 原生 pipeline,sglang serve 一条命令起服务,官方 cookbook 每条配方都在真机验证过:
sglang serve --model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 --ulysses-degree 4 --performance-mode speed \
--host 0.0.0.0 --port 30010 --model-variant fl2va # Ref2VA 换 --model-variant ref2va
硬件
配方
实测
4×H100 80GB
TP2+Ulysses2(最快的无损配方)
峰值 ~57GB/卡(比替代拓扑低 30GB)
4×H200 141GB
Ulysses4 最快;TP2+U2 峰值最低(~64GB)
1344×768/124帧/50步:lossless 中位 85.5s;quality=high(Cache-DiT)63.4s(1.35×,SSIM 0.9709)
8×H200
LMSYS 08-27 加速优化
无损 1.95×,允许质量损失最高 6.24×(SSIM 0.76–0.91)
B200/B300
在线 FP8 量化(权重盘上仍 BF16,运行时转换)
8×B300 峰值 ~52GB/卡
2×RTX 5090 32GB
TP2+逐层卸载
峰值 26.3GiB/卡;50 步 5s 768p 全程 559.7s
单卡 RTX 4090 24GB
kitchen_int8
峰值 ~18GB;1011×576/4s/50步 130.7s
AMD MI300X/MI355X
ROCm+AITER,day-0
官方验证
华为昇腾 NPU
8 卡 TP2+SP4 + Laser Attention + Cache-DiT(另有 4 卡 TP2+SP2)
8 卡比 4 卡 E2E 延迟低 46.8%——国产化路线已验证
关键工程结论(官方审计数据):
- quality=high(Cache-DiT):SSIM 0.931 / PSNR 28.16dB,批量生产场景的性价比开关。
- AdaLN 预计算缓存:把 13B AdaLN 分支预计算缓存,推理省显存省算力(固定采样计划下无损)。
- 跨节点:2×8 H200,Ulysses8×Ring2,V2V 去噪 128.6s → 68.2s(-47%)。
- V2V(视频改写)是 ref2va 的用例,同一个服务覆盖。
- 同硬件下 SGLang 快于 ComfyUI 前端方案。
5. 路线 B:vLLM-Omni(OpenAI 兼容 /v1/videos,运维生态好)
自 v0.26.0 起官方配方,一个 diffusion stage 同时装两个 DiT、共享 TE/VAE,请求用 extra_params.task 切换:
2×RTX 5090(32GB)已验证:TP2 + 分布式逐层卸载,1344×768/124帧/50步一条跑完 8 分 38 秒,峰值仅 22.6 GiB/卡——两万块级别的双卡工作站能跑生产级 768p。
2×RTX 4090(24GB):保守起步档(1024×576,常驻 12 层)。
4×B300 无卸载组合服务:FL2VA 209 帧均值 86.96s。
在线 FP8:DiT+文本编码器eligible层量化,峰值 68.52→53.51 GiB(-22%),LPIPS 0.1156/PSNR 23.6dB/音频谱余弦 0.9589,质量过关。
单卡 96GB:容量检查通过(FL2VA-only,峰值 92.9GB),RTX PRO 6000 级工作站单卡可行(未官方逐卡验证)。
AMD ROCm 现成镜像:vllm/vllm-omni-rocm:minimax-h3;4×MI300X T2VA 267s。
重要运维结论:H3 是算力受限不是带宽受限,请求合批(--step-execution --max-num-seqs 4)几乎无收益还拉高尾延迟(均值 111.5s→175.7s),保持 --max-num-seqs 1 串行队列即可。 这与 LLM 部署直觉相反。
vLLM-Omni 的 Ref2VA 服务面窄于模型能力(仅 1图+1音频 或视频引用,不支持 12 文件全量参考)——重度 Ref2VA 选 SGLang。
提速 LoRA 生态(两条路线叠加)
方案
效果
说明
Turbo LoRA(LightX2V/ModelTC)
50 步 → 4–8 步
4 步时音频和快速运动劣化,6–8 步是甜点;ComfyUI 导出版文件不被服务端接受,认准 Diffusers 版文件名
FlashGen 4 步(ModelScope 有)
4 步 T2VA
原生布局,元数据带蒸馏 schedule
FastH3(FastVideo,DMD2)
8×B300 去噪 6.9×、E2E 2.2×;4×B300 5s 视频 E2E 快于播放速度
加载时融合;VSA 稀疏变体需 fastvideo-kernel,纯 Ulysses
TeaCache / Cache-DiT
~1.35×
TeaCache 仅 FL2VA;两者互斥
6. 路线 C:ComfyUI / 消费级(单卡工作站、创作端)
Comfy-Org 官方打包单文件权重,官方 T2V/R2V 工作流模板;按显存选档(来源:官方 awesome-minimax-h3-integration):
显存
方案
24GB 起步
AdaLN 剪枝版 DiT INT8(19.53 GiB)+ TE nvfp4_awq(14.61 GiB)+ ComfyUI-MiniMaxH3-Easy 节点;求快加 TE-Speed + Turbo 6–8 步
12–16GB
剪枝 GGUF Q4_K_M(10.64 GiB)或 NVFP4(11.67 GiB)+ TE Q2_K(7.91 GiB)+ fp8mix VAE
8GB
DiffSynth-Studio NF4(重度卸载,慢,仅能跑通)
老卡 Turing(2080Ti 22G)
minimax-h3-turing W4A8+Turbo:基线 5.7 分/条,PDD 8 步+块缓存 210s/条
Blackwell
Sol-Attn:比 SageAttention 快 1.14–1.44×、MLP 峰值显存 -37%(5090 实测)
Apple Silicon
antirez/h3.c(MIT,Metal 原生 C 推理引擎,支持 T2V/首尾帧/Ref2VA)
一键党
open-video-ai("视频模型界的 Ollama":install·pull·run)
长视频/工作流增强:H3-Motion-Context(块间传递末帧+音频,接力生成长片)、Director 五模板分镜、LanPaint v2.1 视频和音频局部重绘。
7. 路线 D:混合部署(要 2K 官方画质时的唯一解)
2K 依赖 H3-Regenerate-2K,提示词增强依赖 H3-Context-IR,两者都没开源。官方给的折中工作流:
本地 H3-Base (SGLang 768p) ← Context-IR API(官方,产出结构化提示词)
← Regenerate-2K API(官方,768p 草稿 + 原上下文 → 2K)
隐私敏感素材本地生成 768p;只有提示词和草稿视频过官方 API(Base64 或公网 URL)。
2K 的本质是"模型再生成"而非传统超分:把原始上下文喂回去,能恢复小字、细节,不是猜。
复杂提示词(多镜头、音频设计、参考关系)强烈建议接 Context-IR 或按官方 Prompting Guide 自建预处理(GitHub 还有官方 prompt skills),否则本地直出的指令遵循会明显打折。
计费上 768p($0.08/s)+2K 再生($0.05/s) = $0.13/s,与直接 2K 同价——先 768p 迭代再一次性 2K 不多花钱。
8. 天花板参考:NVIDIA Sol-Engine "H3 Super Acceleration"
单卡 GB200:5s 768p 6.85s、10s 14.93s(22.2×/27.7× 加速),理论 ~12,600 条/天;满负荷 ~525 条 5s 视频/小时 ≈ $210/小时等值产出。
前作 Sol-Engine:8×GB200 E2E 3.95× 近无损。
这类是 NVIDIA 深度内核工程(Sol-Attn/SAGE/Skip-Softmax 同族),普通企业短期够不着,但说明 H3 推理成本仍在快速下降通道。
9. 自建 vs API 账(粗算)
官方 API:768p $0.08/s,2K $0.13/s(10s 视频 $0.80/$1.30)。
4×H200 + SGLang lossless:85.5s 出 5.2s 成品 → 每卡时约产出 ~55s 成品视频 ≈ $17.4/小时 等值,约等于 4×H200 云租价——裸算打平;开 quality=high 或 Turbo/FastH3 后自建胜出 1.5–4×。
结论:低量/突发需求直接 API;日产数百条以上、数据不能出域、要微调或去审核约束,自建才成立。私有化的核心收益本来就是数据主权、定制化和长期边际成本,不是单条成本。
10. 选型决策树
只是想用 → 官方 API(CN: platform.minimaxi.com)。
数据不出域、生产吞吐、有 4 卡预算 → SGLang 4×H100/H200(或 8 卡昇腾),quality=high + Turbo 6–8 步。
预算有限/实验室 → vLLM-Omni 2×5090 或 SGLang 单卡 4090 INT8。
创作工作站/单卡 → ComfyUI pruned INT8(24GB)/GGUF(12GB)/NF4(8GB)。
必须 2K 官方画质 → 混合:本地 768p + 官方 Context-IR/Regenerate-2K API。
极致吞吐 → 关注 NVIDIA Sol-Engine 路线或等官方稀疏注意力开源。
11. 坑清单
2K 和 Context-IR 不开源,短期不会(README 说 Regenerate-2K "ready 后发布");2K 私有化无解。
稀疏注意力开源版暂无 → 长序列(15s/高分辨率)显存和速度吃亏,等官方更新。
CFG 蒸馏权重:cfg-parallel-size>1 直接被拒;别按通用 DiT 经验配。
合批无收益(算力受限),别拿 LLM 运维直觉来调。
vLLM-Omni 已知:U2×R2 混合并行有 mask bug(用纯 Ulysses);VAE 只支持 tile 模式;TeaCache 仅 FL2VA;Ref2VA 参考数支持不全。
Turbo LoRA 认文件名(服务端按名校验,改名拒收);ComfyUI 导出版不支持;4 步档音频明显劣化。
许可是"下载即接受"的合同:商用记得 UI 标注 "MiniMax H3";年营收过线主动找 MiniMax 谈;对外提供服务需自建审核护栏(License V.5 + 国内 AIGC 法规双重要求)。
许可地域范围可能变动(官方承诺"明示变更"),欧盟/英美主体注意当前被排除。
12. 主要来源
官方:开源公告 | HF 模型卡 | 许可原文 | License Q&A | 授权申请 | 官方自托管指南 | awesome-minimax-h3-integration | ModelScope 镜像
推理栈:SGLang cookbook | vLLM-Omni 配方 | LMSYS 8×H200 博客 | ComfyUI 教程
性能/定价:NVIDIA Sol-Engine H3 Super Acceleration | Reuters 报道 | 定价(768p $0.08/s、2K $0.13/s)来自第三方比价站汇总,下单前以 官方平台 为准
原始抓取件存于 智柴/src_h3/(许可、模型卡、vLLM 配方、awesome 表、QA)
生成时间: 2026-09-07 21:37 · 源文件 SHA256: 9ccdb97100a67678 · 由 markdown 渲染为独立 HTML