可通过 API 直接使用 MiniMax-H3。
直接通过应用使用 MiniMax-H3。
MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解,并能生成分辨率高达 2K、时长可达 15 秒的带原生立体声音频的视频。得益于面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力,能够出色地执行复杂的多模态指令。
H3 支持以下输入输出规格:
| 类别 | 规格 |
|---|---|
| 输出时长 | 4–15 秒 |
| 输出宽高比 | 支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16 |
| 输出分辨率 | 支持多种分辨率尺寸。默认短边为 768 像素。通过 H3-Regenerate-2K 可实现 2K 生成 |
| 输出帧率 | 24 FPS |
| 输出音频 | 32 kHz 立体声 |
| 支持的对话语言 | 稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。对其他语言也有不同程度的支持 |
| 模型变体 | 输入模式 | 规格 |
|---|---|---|
| H3-Base-FL2VA | 首尾帧模式 | 支持零张、一张或两张输入图像。 - 无图像输入:文本生成视频模式 - 一张图像输入:首帧生成视频或尾帧生成视频 - 两张图像输入:首尾帧生成视频 |
| H3-Base-Ref2VA | 全参考模式 | 支持多模态参考输入: - 图像: ≤ 9 张 - 视频: ≤ 3 段;每段时长须为 2–15 秒;总时长 ≤ 15 秒 - 音频: ≤ 3 段;音频必须伴随图像或视频输入,不能作为唯一输入;每段时长须为 2–15 秒;总时长 ≤ 15 秒 - 混合输入: 所有输入类型的文件总数上限为 12 |

完整的 H3 系统由以下三个模块组成:
H3-Context-IR 是一个托管式预处理与编排系统,专为自由形式的多模态输入而设计。
它负责解读文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成输出之间的关联。其内部工作流程包括指令解析、跨模态关联、时序理解和复杂逻辑推理。
H3-Context-IR 将其对上下文的理解序列化为 H3-Base 可接受的结构化表示。在不偏离用户原始意图的前提下,它还会在适当情况下补充缺失或描述不充分的语义细节。
由于 H3-Context-IR 依赖多阶段工作流程以及多个托管模型和服务,因此它未包含在本次开源发布中。我们提供了一个 API,使用户能够复现官方工作流程的行为。我们还提供了详细的教程,开发者可以按照提示指南构建自己的预处理系统。
有关详细的使用说明,请参见推荐工作流程 — 完整 2K 工作流程。
安全防护机制
用户提交的文本、图像和视频,以及增强后的提示词,均需经过自动化内容审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。我们采用行业标准的过滤措施,但无法完全消除误判(包括误拦和漏拦)。这些防护机制不影响被许可方在 MiniMax H3 社区许可证下的义务,特别是与合法使用和使用限制相关的义务。

H3-Base 使用相应的编码器或 VAE 对不同模态进行编码,并将编码后的表示组织成一个统一的打包多模态序列。在将整个序列传递给 H3-Omni-Transformer 之前,使用 RoPE 来捕捉 token 之间必要的空间和时间关系。
具体而言,文本由 H3-Encoder 编码;视觉输入由 H3-Encoder 和 H3-VisualVAE 共同编码;音频则仅由 H3-AudioVAE 编码。
H3-Omni-Transformer 联合预测视频和音频 latent,然后分别将其解码为视频和立体声音频。
为降低长多模态序列的计算成本,H3 原生支持稀疏注意力训练和推理。初始开源版本仅提供全注意力推理。我们的稀疏注意力实现将在未来的更新中发布。
H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,并将其第 50 层的隐藏状态提供给 H3-Omni-Transformer。
我们在分词器配置中添加了若干特殊 token,例如 <d>。使用 H3 时,必须使用 H3 仓库中提供的分词器及相关配置文件。
H3 使用分离的视觉和音频 latent 来表示各自的模态。
H3-VisualVAE 是一个时间因果视频自编码器,空间压缩因子为 16 倍,时间压缩因子为 4 倍,具有 24 个 latent 通道,记为 f16t4d24。我们应用了多种 latent 空间优化技术,以共同提升重建质量和 latent 的可学习性。
在传递给 H3-Omni-Transformer 之前,视觉 latent 会进一步以 1 × 2 × 2 的 patch 大小沿 (时间, 高度, 宽度) 维度进行分块。因此,进入 Transformer 的视觉 token 具有 32 倍的有效空间下采样因子,而时间下采样因子保持 4 倍。
H3-VisualVAE 的 latent 空间同时针对重建质量和生成模型的学习难度进行了优化。在训练其编码器之后,我们额外训练了一个基于 ViT 的解码器,以降低解码成本并进一步提高重建质量。
为了兼顾可扩展性和泛化能力,我们采用了相对简单的 Transformer 块设计。H3-Omni-Transformer 是一个具有 330 亿参数的密集型单流 Transformer,其中约 130 亿参数位于 AdaLN 相关分支。由于 AdaLN 调制输出可以预先计算并缓存,因此这些参数在仅推理部署时无需加载。我们发布完整的模型权重,以支持进一步的开发,包括微调。
注意力层和 FFN 层均不包含模态特定结构。模态特定参数仅限于输入/输出层和 AdaLN 分支。特别是,模态特定的 AdaLN 能够以相对较低的额外训练和推理成本提高生成质量。
该模型使用三维多模态旋转位置嵌入(MM-RoPE)来表示跨时间和两个空间维度 (t, h, w) 的位置关系。
在训练的最后阶段,我们引入了原生稀疏注意力,以降低长序列的计算成本。稀疏注意力的实现未包含在初始开源版本中,将在未来的更新中单独发布。
针对H3的2K分辨率输出,我们并未采用传统的专用超分辨率模块,而是利用H3基础模型,通过上下文内(in-context)方式对其自身生成的低分辨率结果进行重新生成。
这种方法具有两大优势:(1)再生过程能够最大程度复用H3基础模型的生成能力;(2)上下文内格式在生成高分辨率输出时可以复用原始的多模态上下文,使其能够恢复传统超分辨率方法不得不“猜测”的信息,例如小文本和精细细节。
上下文内再生也是任务泛化的一个实例。
由于系统的复杂性,该模块目前尚未开源。我们将在准备就绪后发布。 我们提供了一个用于验证官方结果的API;详见下方的“完整2K工作流程”。
为帮助社区正确部署MiniMax H3,我们提供了两种验证方法。
由于完整的H3系统由三个模块组成——H3-Context-IR、H3-Base和H3-Regenerate-2K,“完整2K工作流程”结合开放平台API与本地部署的H3-Base,提供了2K输出的端到端验证管道。“H3-Base本地部署”部分则提供了仅使用本地部署的H3-Base来验证768p输出的方法。
此外,“提示词指南”部分提供了详细教程,以帮助社区开发自己的提示词系统。
MiniMax H3以两个特定任务的检查点形式发布。每个检查点包含一个专用的Omni Transformer模型,以及所需的处理器、分词器、文本编码器、视觉VAE和独立的音频VAE组件。
| 检查点 | 支持任务 | 输入条件 | 输出 | 精度 |
|---|---|---|---|---|
| MiniMax-H3 Base FL2VA | 文本到音视频(t2va)、首帧/末帧到音视频(fl2va) | 文本;可选的首帧、末帧或两者皆有 | 视频和音频 | BF16 |
| MiniMax-H3 Base Ref2VA | 参考到音视频(ref2va) | 带有参考图像、视频和/或音频的文本 | 视频和音频 | BF16 |
发布的检查点是经过CFG蒸馏的Omni Transformer模型权重。
每个检查点均以自包含的Hugging Face风格仓库形式分发,包含以下组件:
<TASK>/
├── model_index.json
├── processor/
├── tokenizer/
├── text_encoder/
├── transformer/
├── visual_vae/
└── audio_vae/下载模型。该仓库同时托管原始检查点(FL2VA/、Ref2VA/)和 diffusers 格式文件,因此请根据您的框架需求选择下载内容:
model_index.json 是仓库级别的公共入口。特定任务族的 diffusers 索引仍位于 FL2VA/model_index.json 和 Ref2VA/model_index.json 下。
# Original checkpoint, both task families (SGLang, vLLM):
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3
# Or a single task family:
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" --local-dir MiniMax-H3diffusers 用户无需手动下载:ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") 会精确获取所需的组件。有关加载方法,请参阅 diffusers 文档。
我们推荐使用以下推理框架来部署模型:
diffusers - 详见 diffusers 文档
这里我们以 sglang 为例进行部署说明。有关其他部署配置,请参见 MiniMax-H3 部署指南。
FL2VA:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2vaRef2VA:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30011 \
--model-variant ref2va以下三个使用场景T2VA、FL2VA和Ref2VA展示了如何复现MiniMax-H3的视频-音频生成效果。
本节将说明如何将本地部署的SGLang服务与官方的H3-Context-IR和H3-Regenerate-2K API相结合,以复现MiniMax API直接生成的2K视频质量。 开始之前,请配置SGLang端点和您的MiniMax API凭证:
# URL of your SGLang deployment
SGLANG_DEPLOYMENT_URL="<sglang-deployment-url>"
# MiniMax API endpoint (choose one)
# CN
MINIMAX_API_BASE="https://api.minimaxi.com"
# Global
# MINIMAX_API_BASE="https://api.minimax.io"
# API token obtained from the MiniMax platform
TOKEN="<token>"MiniMax 平台:
API 文档:
以下示例将本地 H3-Base 输出文件编码为 Base64 数据 URL。对于生产环境使用,建议将视频上传至可公开访问的 URL,并将该 URL 作为 base_video 参数传入。
对于以下每个案例,我们均提供了通过开放平台 API 直接生成的 2K 和 768p 参考输出,以便更轻松地验证结果。
| 阶段 | 请求 | 结果 |
|---|---|---|
| H3-Context-IR | 查看脚本 | |
| H3-Base | 查看脚本 | t2va.mp4 |
| H3-Regenerate-2K | 查看脚本 | t2va_2k.mp4 |
| 通过直接调用开放平台 API 获得的 2K 参考结果 | 查看脚本 | h3_direct_2k.mp4 |
| 通过直接调用开放平台 API 获得的 768P 参考结果 | 查看脚本 | h3_direct_768p.mp4 |
| 阶段 | 请求 | 结果 |
|---|---|---|
| H3-Context-IR | 查看脚本 | |
| H3-Base | 查看脚本 | i2va.mp4 |
| H3-Regenerate-2K | 查看脚本 | i2va_2k.mp4 |
| 通过直接调用开放平台 API 获得的 2K 参考结果 | 查看脚本 | i2va_direct_2k.mp4 |
| 通过直接调用开放平台 API 获得的 768P 参考结果 | 查看脚本 | i2va_direct_768p.mp4 |
| 阶段 | 请求 | 结果 |
|---|---|---|
| H3-Context-IR | 查看脚本 | |
| H3-Base | 查看脚本 | r2va.mp4 |
| 通过直接调用开放平台 API 获得的 2K 参考结果 | 查看脚本 | r2va_2k.mp4 |
| 开放平台 H3 API 2K 参考 | 查看脚本 | r2va_direct_2k.mp4 |
| 通过直接调用开放平台 API 获得的 768P 参考结果 | 查看脚本 | r2va_direct_768p.mp4 |
VIDEO_PROMPT_WRITING_GUIDE_base_en.md
VIDEO_PROMPT_WRITING_GUIDE_ref_en.md
提升提示词技巧:https://github.com/MiniMax-AI/MiniMax-H3/tree/main/skills
MiniMax H3 根据 MiniMax H3 社区许可协议 发布。许可协议常见问题
请通过 model@minimax.io 与我们联系。