MiniMax H3 开源:33B 全模态视频生成模型,一个视觉语言模型只够当它的编码器

MiniMax H3 分析报告 — 33B 全模态开源视频生成模型

发布时间: 2026年7月31日发布(8月3日开源,8月4日 OSCHINA 报道)
来源: OSCHINA 新闻 | HuggingFace 模型卡 | 腾讯新闻实测
模型尺寸: 33B 参数(约 13B 在 AdaLN 分支,推理可缓存) | 许可: MiniMax H3 Community License(非标准开源协议)

MiniMax H3 主视觉

概述

MiniMax H3 是 MiniMax(稀宇科技)推出的 33B 全模态(omni-modal)生成模型,支持将文本、图片、视频、音频统一放入同一上下文理解,并生成带原生立体声音频的视频,分辨率最高 2K、时长最长 15 秒。没有发布会、没有预告,权重直接上传 Hugging Face——这是继字节 Seedance 系列之后又一个达到 SOTA 水平的视频模型,也是头部厂商中少有的"SOTA 性能 + 开源"组合。

H3 由三个模块组成,"理解与精修闭源、生成开源"

模块 职责 开源状态
H3-Context-IR 多模态指令理解与编排,输出 Context Intermediate Representation ❌ 闭源(提供 API)
H3-Base 核心生成模型,33B 参数,768p 音视频生成 ✅ 开源
H3-Regenerate-2K in-context 重新生成 2K 分辨率 ❌ 闭源(提供 API)

H3 系统总览

一、技术架构

1.1 整体设计

H3 是纯 dense single-stream 的 Omni Transformer 架构,没有 per-modality 的 attention 或 FFN 层——模态差异只体现在输入输出层和 AdaLN 分支。输入侧:文本由 H3-Encoder 编码,视觉由 H3-Encoder + H3-VisualVAE 编码,音频由 H3-AudioVAE 编码;统一 packed 成多模态序列后送入 Omni Transformer,联合预测视频与音频 latent。

H3-Base 全架构

1.2 三个关键技术点

1)编码器直接复用 Qwen3-VL-32B

H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,取第 50 层 hidden states 喂给生成模型——一个 32B 的视觉语言模型,在 H3 里只是编码器。这体现了"语言作为可泛化连接器"的设计哲学:把多模态理解建立在成熟 VLM 之上。

2)Omni Transformer 与 AdaLN 分支

33B 参数中约 13B 在 AdaLN(Adaptive LayerNorm)相关分支,推理时这部分可以预计算并缓存,不需要加载,显著降低部署成本。使用三维 MM-RoPE 编码 (t, h, w) 时空位置关系。

3)原生稀疏注意力(暂未开源)

训练阶段原生支持稀疏注意力以降低长序列成本,但首次开源版本只给了全注意力,稀疏注意力"后续更新中发布"。

1.3 VAE 设计

VAE 压缩规格 说明
H3-VisualVAE f16t4d24(空间 16x、时间 4x、24 latent channels) 进 Transformer 前再 patchify 成 1×2×2,等效空间下采样 32 倍;ViT 解码器降低解码成本
H3-AudioVAE 32 kHz → 40 Hz latent token 率 左右声道独立编解码后合成立体声(32kHz 立体声输出)

二、2K 生成:in-context 重生成,而非超分

H3 的 2K 输出没有使用传统超分辨率模块,而是把 768p 生成结果连同原始多模态上下文一起送回 H3 模型,让模型用 in-context 方式重新生成 2K 分辨率。这个思路的优势:

  1. 不需要额外训练超分模型,最大化复用 H3 的生成能力
  2. 高分辨率输出能直接复用原始上下文补充细节(小文字、精细纹理),而不是靠超分模块"猜"

这也是"任务泛化"(task generalization)设计哲学的体现——整个 H3 系统围绕"一个模型干多类任务"构建。

三、模型变体与输入规格

变体 输入模式 规格
H3-Base-FL2VA 首尾帧模式 0/1/2 张图:无图=文生视频;1 图=首帧或尾帧生视频;2 图=首尾帧生视频
H3-Base-Ref2VA 全模态参考模式 ≤9 张图 + ≤3 段视频(每段 2-15s)+ ≤3 段音频(需配图/视频,每段 2-15s),混合输入最多 12 个文件

输出规格: 短边默认 768p(2K 需 H3-Regenerate-2K)、24 FPS、32 kHz 立体声、最长 15 秒、稳定支持 11 种语言(中英日韩法德意葡俄阿西)。

四、部署与生态

开源内容: 两个 BF16 checkpoint(FL2VA / Ref2VA),各包含 Omni Transformer + processor + tokenizer + text encoder + Visual VAE + Audio VAE,为 CFG-distilled 权重。同时提供 diffusers 格式。

推理框架支持:

框架 支持状态 说明
SGLang ✅ 官方示例 官方部署示例需要 4 张 GPU(--num-gpus 4 --ulysses-degree 4)
vLLM recipes.vllm.ai 有官方配方
diffusers ModularPipeline.from_pretrained 直接加载
ComfyUI 官方 R2V/T2V 工作流模板

模型卡数据(开源初期): MiniMaxAI/MiniMax-H3 2048 likes;第三方 GGUF/NVFP4 量化版本已出现(Abiray/MiniMax-H3-GGUF 下载 84K+),社区适配速度快。

五、实测能力(腾讯新闻 2026-08-03)

第三方实测集中在 多模态精准编辑和控制

场景 实测效果
文字图层嵌入 一镜到底短片按秒级提示词添加粗体无衬线大字(Origin→Fire→Beyond),文字作为图层嵌入背景,每帧有海报质感
人物/元素替换 上传《纸牌屋》片段 + 奶龙图片,两个人物全部替换成奶龙,眼神变化、动作、声音到位,光影方向与原片一致
特效迁移 指定参考视频中的彩虹像素特效迁移到新视频,沿主体边缘精准蔓延,无失控溢出
色彩控制 高对比度多色彩碰撞下维持色彩边界,色彩质感清晰(喷射战士风格实测)
配音/音频 视频参考 + 音频参考混合输入,可替换配音并保持原片音轨

实测总结:文字、图片、视频、音频可放进同一上下文理解并按提示词局部改动;"加文字图层、替换人物、迁移特效"这类过去需要多步骤的工作,现在一次生成即可完成,改动边界可控。提示词写得越复杂详细,控制越精细。

六、与同类方案对比

维度 MiniMax H3 字节 Seedance Google Veo 3.1 可灵 (Kling) Runway Gen-4 LTX-2.3(开源)
参数规模 33B 未公开 未公开 未公开 未公开 3.3B
开源 ✅ 权重开源
原生音频 ✅ 32kHz 立体声 ✅ 48kHz 语音 部分 部分 部分
2K 输出 ✅(in-context 重生成)
多模态输入 ✅ 图/视频/音频/文本混合(≤12 文件) 图/视频 图/视频 文本/图
精准编辑 ✅ 替换/特效迁移/文字图层 部分 一般
许可证 MiniMax H3 Community(非标准) - - - - Apache-2.0
部署门槛 4 卡 GPU(SGLang 示例) API API API API 单卡可跑
生态热度 刚开源(2048 likes) 商业 API 商业 API 商业 API 商业 API HF 1800万+ 下载

定位差异: H3 的核心差异化是全模态输入 + 精准编辑(UI 设计、广告、MV、游戏界面、AR/转绘、电商场景表现好),且开源 33B 让自部署成为可能。LTX-2.3 证明开源视频模型有真实刚需(HF 下载 1800 万+),H3 走的是"更高质量但更高门槛"的开源路线。

七、本地化部署可行性分析

维度 评估
开源状态 ✅ 权重开放(HuggingFace / ModelScope 均有)
硬件需求 :官方 SGLang 示例 4 张 GPU(BF16);社区已有 GGUF/NVFP4 量化版,单卡部署有希望但质量待验证
部署框架 SGLang / vLLM / diffusers / ComfyUI 全支持,生态成熟
是否仅 API 否,H3-Base 权重开源;但 Context-IR 和 2K 精修模块仅 API
License 限制 MiniMax H3 Community License 不是标准开源协议,需仔细阅读商用/衍生条款

分场景建议:

场景 建议
个人/研究用途 ✅ 可本地部署 768p(量化版可降门槛)
商业视频生成产品 ⚠️ 需确认 Community License 商用条款;768p 自部署 + 2K API 混合方案可行
追求开箱即用 2K ✅ 直接用官方 API(hailuoai.com / platform.minimaxi.com)
低算力环境 ⚠️ 33B 模型门槛高,建议 API 或等更成熟的量化部署方案

八、总结与展望

技术亮点:
- "SOTA 性能 + 33B 开源"组合在视频赛道稀缺,降低了对闭源 API 的绑定
- 全模态统一上下文理解 + 精准编辑(替换/特效迁移/文字图层),直击生产力场景
- in-context 2K 重生成替代超分模块,架构思路新颖且自洽
- 编码器复用 Qwen3-VL-32B,验证"语言作为可泛化连接器"的 Scaling 路径

风险与不足:
- "开源"不彻底:理解(Context-IR)和精修(Regenerate-2K)两个关键模块闭源,"一个模型三个模块两个开源"(OSCHINA 语)
- License 是非标准 Community License,商用需谨慎
- 33B + 4 卡部署门槛高,个人开发者主要走 API 或量化路线
- 稀疏注意力未随首发开源,长序列推理成本待观察
- 视频模型赛道竞争极密(Seedance/Veo/可灵/Gen-4),迭代速度快

行业信号: 一年前行业还在卷提示词一致性,今天已卷到"精准替换画面元素且不干扰周边";原生音频从加分项变成及格线(Veo 3.1 已 48kHz)。视频模型正加速向生产力级工具演进,厂商宣发也从炫特效转向 TVC、商业广告等实操演示。H3 的开源选择可能推动更多国内厂商跟进"高质量开源"路线。

参考链接

  • HuggingFace 模型卡:https://huggingface.co/MiniMaxAI/MiniMax-H3
  • 腾讯新闻实测:https://news.qq.com/rain/a/20260803A064OC00
  • OSCHINA 新闻:https://www.oschina.net/news/486031
  • Hailuo AI 在线体验:https://hailuoai.video
  • MiniMax API 文档:https://platform.minimaxi.com/docs/api-reference/video-generation-v2-create
苏ICP备19018690号-1