MiniMax H3 开源:33B 全模态视频生成模型,一个视觉语言模型只够当它的编码器
MiniMax H3 分析报告 — 33B 全模态开源视频生成模型
发布时间: 2026年7月31日发布(8月3日开源,8月4日 OSCHINA 报道)
来源: OSCHINA 新闻 | HuggingFace 模型卡 | 腾讯新闻实测
模型尺寸: 33B 参数(约 13B 在 AdaLN 分支,推理可缓存) | 许可: MiniMax H3 Community License(非标准开源协议)

概述
MiniMax H3 是 MiniMax(稀宇科技)推出的 33B 全模态(omni-modal)生成模型,支持将文本、图片、视频、音频统一放入同一上下文理解,并生成带原生立体声音频的视频,分辨率最高 2K、时长最长 15 秒。没有发布会、没有预告,权重直接上传 Hugging Face——这是继字节 Seedance 系列之后又一个达到 SOTA 水平的视频模型,也是头部厂商中少有的"SOTA 性能 + 开源"组合。
H3 由三个模块组成,"理解与精修闭源、生成开源":
| 模块 | 职责 | 开源状态 |
|---|---|---|
| H3-Context-IR | 多模态指令理解与编排,输出 Context Intermediate Representation | ❌ 闭源(提供 API) |
| H3-Base | 核心生成模型,33B 参数,768p 音视频生成 | ✅ 开源 |
| H3-Regenerate-2K | in-context 重新生成 2K 分辨率 | ❌ 闭源(提供 API) |

一、技术架构
1.1 整体设计
H3 是纯 dense single-stream 的 Omni Transformer 架构,没有 per-modality 的 attention 或 FFN 层——模态差异只体现在输入输出层和 AdaLN 分支。输入侧:文本由 H3-Encoder 编码,视觉由 H3-Encoder + H3-VisualVAE 编码,音频由 H3-AudioVAE 编码;统一 packed 成多模态序列后送入 Omni Transformer,联合预测视频与音频 latent。

1.2 三个关键技术点
1)编码器直接复用 Qwen3-VL-32B
H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,取第 50 层 hidden states 喂给生成模型——一个 32B 的视觉语言模型,在 H3 里只是编码器。这体现了"语言作为可泛化连接器"的设计哲学:把多模态理解建立在成熟 VLM 之上。
2)Omni Transformer 与 AdaLN 分支
33B 参数中约 13B 在 AdaLN(Adaptive LayerNorm)相关分支,推理时这部分可以预计算并缓存,不需要加载,显著降低部署成本。使用三维 MM-RoPE 编码 (t, h, w) 时空位置关系。
3)原生稀疏注意力(暂未开源)
训练阶段原生支持稀疏注意力以降低长序列成本,但首次开源版本只给了全注意力,稀疏注意力"后续更新中发布"。
1.3 VAE 设计
| VAE | 压缩规格 | 说明 |
|---|---|---|
| H3-VisualVAE | f16t4d24(空间 16x、时间 4x、24 latent channels) | 进 Transformer 前再 patchify 成 1×2×2,等效空间下采样 32 倍;ViT 解码器降低解码成本 |
| H3-AudioVAE | 32 kHz → 40 Hz latent token 率 | 左右声道独立编解码后合成立体声(32kHz 立体声输出) |
二、2K 生成:in-context 重生成,而非超分
H3 的 2K 输出没有使用传统超分辨率模块,而是把 768p 生成结果连同原始多模态上下文一起送回 H3 模型,让模型用 in-context 方式重新生成 2K 分辨率。这个思路的优势:
- 不需要额外训练超分模型,最大化复用 H3 的生成能力
- 高分辨率输出能直接复用原始上下文补充细节(小文字、精细纹理),而不是靠超分模块"猜"
这也是"任务泛化"(task generalization)设计哲学的体现——整个 H3 系统围绕"一个模型干多类任务"构建。
三、模型变体与输入规格
| 变体 | 输入模式 | 规格 |
|---|---|---|
| H3-Base-FL2VA | 首尾帧模式 | 0/1/2 张图:无图=文生视频;1 图=首帧或尾帧生视频;2 图=首尾帧生视频 |
| H3-Base-Ref2VA | 全模态参考模式 | ≤9 张图 + ≤3 段视频(每段 2-15s)+ ≤3 段音频(需配图/视频,每段 2-15s),混合输入最多 12 个文件 |
输出规格: 短边默认 768p(2K 需 H3-Regenerate-2K)、24 FPS、32 kHz 立体声、最长 15 秒、稳定支持 11 种语言(中英日韩法德意葡俄阿西)。
四、部署与生态
开源内容: 两个 BF16 checkpoint(FL2VA / Ref2VA),各包含 Omni Transformer + processor + tokenizer + text encoder + Visual VAE + Audio VAE,为 CFG-distilled 权重。同时提供 diffusers 格式。
推理框架支持:
| 框架 | 支持状态 | 说明 |
|---|---|---|
| SGLang | ✅ 官方示例 | 官方部署示例需要 4 张 GPU(--num-gpus 4 --ulysses-degree 4) |
| vLLM | ✅ | recipes.vllm.ai 有官方配方 |
| diffusers | ✅ | ModularPipeline.from_pretrained 直接加载 |
| ComfyUI | ✅ | 官方 R2V/T2V 工作流模板 |
模型卡数据(开源初期): MiniMaxAI/MiniMax-H3 2048 likes;第三方 GGUF/NVFP4 量化版本已出现(Abiray/MiniMax-H3-GGUF 下载 84K+),社区适配速度快。
五、实测能力(腾讯新闻 2026-08-03)
第三方实测集中在 多模态精准编辑和控制:
| 场景 | 实测效果 |
|---|---|
| 文字图层嵌入 | 一镜到底短片按秒级提示词添加粗体无衬线大字(Origin→Fire→Beyond),文字作为图层嵌入背景,每帧有海报质感 |
| 人物/元素替换 | 上传《纸牌屋》片段 + 奶龙图片,两个人物全部替换成奶龙,眼神变化、动作、声音到位,光影方向与原片一致 |
| 特效迁移 | 指定参考视频中的彩虹像素特效迁移到新视频,沿主体边缘精准蔓延,无失控溢出 |
| 色彩控制 | 高对比度多色彩碰撞下维持色彩边界,色彩质感清晰(喷射战士风格实测) |
| 配音/音频 | 视频参考 + 音频参考混合输入,可替换配音并保持原片音轨 |
实测总结:文字、图片、视频、音频可放进同一上下文理解并按提示词局部改动;"加文字图层、替换人物、迁移特效"这类过去需要多步骤的工作,现在一次生成即可完成,改动边界可控。提示词写得越复杂详细,控制越精细。
六、与同类方案对比
| 维度 | MiniMax H3 | 字节 Seedance | Google Veo 3.1 | 可灵 (Kling) | Runway Gen-4 | LTX-2.3(开源) |
|---|---|---|---|---|---|---|
| 参数规模 | 33B | 未公开 | 未公开 | 未公开 | 未公开 | 3.3B |
| 开源 | ✅ 权重开源 | ❌ | ❌ | ❌ | ❌ | ✅ |
| 原生音频 | ✅ 32kHz 立体声 | ✅ | ✅ 48kHz 语音 | 部分 | 部分 | 部分 |
| 2K 输出 | ✅(in-context 重生成) | ✅ | ✅ | ✅ | ✅ | 否 |
| 多模态输入 | ✅ 图/视频/音频/文本混合(≤12 文件) | ✅ | ✅ | 图/视频 | 图/视频 | 文本/图 |
| 精准编辑 | ✅ 替换/特效迁移/文字图层 | ✅ | ✅ | 部分 | ✅ | 一般 |
| 许可证 | MiniMax H3 Community(非标准) | - | - | - | - | Apache-2.0 |
| 部署门槛 | 4 卡 GPU(SGLang 示例) | API | API | API | API | 单卡可跑 |
| 生态热度 | 刚开源(2048 likes) | 商业 API | 商业 API | 商业 API | 商业 API | HF 1800万+ 下载 |
定位差异: H3 的核心差异化是全模态输入 + 精准编辑(UI 设计、广告、MV、游戏界面、AR/转绘、电商场景表现好),且开源 33B 让自部署成为可能。LTX-2.3 证明开源视频模型有真实刚需(HF 下载 1800 万+),H3 走的是"更高质量但更高门槛"的开源路线。
七、本地化部署可行性分析
| 维度 | 评估 |
|---|---|
| 开源状态 | ✅ 权重开放(HuggingFace / ModelScope 均有) |
| 硬件需求 | 高:官方 SGLang 示例 4 张 GPU(BF16);社区已有 GGUF/NVFP4 量化版,单卡部署有希望但质量待验证 |
| 部署框架 | SGLang / vLLM / diffusers / ComfyUI 全支持,生态成熟 |
| 是否仅 API | 否,H3-Base 权重开源;但 Context-IR 和 2K 精修模块仅 API |
| License 限制 | MiniMax H3 Community License 不是标准开源协议,需仔细阅读商用/衍生条款 |
分场景建议:
| 场景 | 建议 |
|---|---|
| 个人/研究用途 | ✅ 可本地部署 768p(量化版可降门槛) |
| 商业视频生成产品 | ⚠️ 需确认 Community License 商用条款;768p 自部署 + 2K API 混合方案可行 |
| 追求开箱即用 2K | ✅ 直接用官方 API(hailuoai.com / platform.minimaxi.com) |
| 低算力环境 | ⚠️ 33B 模型门槛高,建议 API 或等更成熟的量化部署方案 |
八、总结与展望
技术亮点:
- "SOTA 性能 + 33B 开源"组合在视频赛道稀缺,降低了对闭源 API 的绑定
- 全模态统一上下文理解 + 精准编辑(替换/特效迁移/文字图层),直击生产力场景
- in-context 2K 重生成替代超分模块,架构思路新颖且自洽
- 编码器复用 Qwen3-VL-32B,验证"语言作为可泛化连接器"的 Scaling 路径
风险与不足:
- "开源"不彻底:理解(Context-IR)和精修(Regenerate-2K)两个关键模块闭源,"一个模型三个模块两个开源"(OSCHINA 语)
- License 是非标准 Community License,商用需谨慎
- 33B + 4 卡部署门槛高,个人开发者主要走 API 或量化路线
- 稀疏注意力未随首发开源,长序列推理成本待观察
- 视频模型赛道竞争极密(Seedance/Veo/可灵/Gen-4),迭代速度快
行业信号: 一年前行业还在卷提示词一致性,今天已卷到"精准替换画面元素且不干扰周边";原生音频从加分项变成及格线(Veo 3.1 已 48kHz)。视频模型正加速向生产力级工具演进,厂商宣发也从炫特效转向 TVC、商业广告等实操演示。H3 的开源选择可能推动更多国内厂商跟进"高质量开源"路线。
参考链接
- HuggingFace 模型卡:https://huggingface.co/MiniMaxAI/MiniMax-H3
- 腾讯新闻实测:https://news.qq.com/rain/a/20260803A064OC00
- OSCHINA 新闻:https://www.oschina.net/news/486031
- Hailuo AI 在线体验:https://hailuoai.video
- MiniMax API 文档:https://platform.minimaxi.com/docs/api-reference/video-generation-v2-create