MiniMax-AI/MiniMax-H3
模型介绍
文件和版本
Pull Requests
讨论
分析
MiniMax

Hailuo AI API MiniMax Website GitHub Hugging Face
ModelScope MiniMax AI WeChat Discord LICENSE

MiniMax H3

在线 API

可通过 API 直接使用 MiniMax-H3。

  • 国际版:platform.minimax.io | 中国版:platform.minimaxi.com

在线应用

直接通过应用使用 MiniMax-H3。

  • 网页应用全球版:hailuoai.video | 中国版:hailuoai.com
  • 桌面应用全球版:hub.minimax.io | 中国版:hub.minimaxi.com

系统概述

MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解,并能生成分辨率高达 2K、时长可达 15 秒的带原生立体声音频的视频。得益于面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力,能够出色地执行复杂的多模态指令。

H3 支持以下输入输出规格:

类别规格
输出时长4–15 秒
输出宽高比支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16
输出分辨率支持多种分辨率尺寸。默认短边为 768 像素。通过 H3-Regenerate-2K 可实现 2K 生成
输出帧率24 FPS
输出音频32 kHz 立体声
支持的对话语言稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。对其他语言也有不同程度的支持

模型变体与输入规格

模型变体输入模式规格
H3-Base-FL2VA首尾帧模式支持零张、一张或两张输入图像。

- 无图像输入:文本生成视频模式
- 一张图像输入:首帧生成视频或尾帧生成视频
- 两张图像输入:首尾帧生成视频
H3-Base-Ref2VA全参考模式支持多模态参考输入:

- 图像: ≤ 9 张
- 视频: ≤ 3 段;每段时长须为 2–15 秒;总时长 ≤ 15 秒
- 音频: ≤ 3 段;音频必须伴随图像或视频输入,不能作为唯一输入;每段时长须为 2–15 秒;总时长 ≤ 15 秒
- 混合输入: 所有输入类型的文件总数上限为 12

Image

完整的 H3 系统由以下三个模块组成:

  • H3-Context-IR:随着输入日益复杂,我们构建了专门的系统来深度理解和优化输入的多模态指令,然后将其转换为 H3 易于理解的形式——上下文中间表示,以用于生成。H3-Context-IR 对最终输出质量至关重要,因此我们强烈建议将其整合到您的生成流程中,或遵循“提示词指南”构建您自己的上下文处理系统。
  • H3-Base:基于 H3-Context-IR 的输出生成音频和视频,产生 768p 分辨率的结果。
  • H3-Regenerate-2K:将 768p 结果与原始上下文一同反馈给 H3,以重新生成 2K 分辨率的输出。此过程既利用了 H3 强大的生成能力,又结合了原始上下文中包含的丰富信息,能够生成细节更准确、视觉保真度更高的高分辨率输出。

模型架构

H3-Context-IR

H3-Context-IR 是一个托管式预处理与编排系统,专为自由形式的多模态输入而设计。

它负责解读文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成输出之间的关联。其内部工作流程包括指令解析、跨模态关联、时序理解和复杂逻辑推理。

H3-Context-IR 将其对上下文的理解序列化为 H3-Base 可接受的结构化表示。在不偏离用户原始意图的前提下,它还会在适当情况下补充缺失或描述不充分的语义细节。

由于 H3-Context-IR 依赖多阶段工作流程以及多个托管模型和服务,因此它未包含在本次开源发布中。我们提供了一个 API,使用户能够复现官方工作流程的行为。我们还提供了详细的教程,开发者可以按照提示指南构建自己的预处理系统。

有关详细的使用说明,请参见推荐工作流程 — 完整 2K 工作流程。

安全防护机制

用户提交的文本、图像和视频,以及增强后的提示词,均需经过自动化内容审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。我们采用行业标准的过滤措施,但无法完全消除误判(包括误拦和漏拦)。这些防护机制不影响被许可方在 MiniMax H3 社区许可证下的义务,特别是与合法使用和使用限制相关的义务。

H3-Base

Image

架构概述

  • H3-Base 使用相应的编码器或 VAE 对不同模态进行编码,并将编码后的表示组织成一个统一的打包多模态序列。在将整个序列传递给 H3-Omni-Transformer 之前,使用 RoPE 来捕捉 token 之间必要的空间和时间关系。

  • 具体而言,文本由 H3-Encoder 编码;视觉输入由 H3-Encoder 和 H3-VisualVAE 共同编码;音频则仅由 H3-AudioVAE 编码。

  • H3-Omni-Transformer 联合预测视频和音频 latent,然后分别将其解码为视频和立体声音频。

  • 为降低长多模态序列的计算成本,H3 原生支持稀疏注意力训练和推理。初始开源版本仅提供全注意力推理。我们的稀疏注意力实现将在未来的更新中发布。

H3-Encoder

  • H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,并将其第 50 层的隐藏状态提供给 H3-Omni-Transformer。

  • 我们在分词器配置中添加了若干特殊 token,例如 <d>。使用 H3 时,必须使用 H3 仓库中提供的分词器及相关配置文件。

H3-VAE

H3 使用分离的视觉和音频 latent 来表示各自的模态。

H3-VisualVAE
  • H3-VisualVAE 是一个时间因果视频自编码器,空间压缩因子为 16 倍,时间压缩因子为 4 倍,具有 24 个 latent 通道,记为 f16t4d24。我们应用了多种 latent 空间优化技术,以共同提升重建质量和 latent 的可学习性。

  • 在传递给 H3-Omni-Transformer 之前,视觉 latent 会进一步以 1 × 2 × 2 的 patch 大小沿 (时间, 高度, 宽度) 维度进行分块。因此,进入 Transformer 的视觉 token 具有 32 倍的有效空间下采样因子,而时间下采样因子保持 4 倍。

  • H3-VisualVAE 的 latent 空间同时针对重建质量和生成模型的学习难度进行了优化。在训练其编码器之后,我们额外训练了一个基于 ViT 的解码器,以降低解码成本并进一步提高重建质量。

H3-AudioVAE
  • H3-AudioVAE 对左右音频通道使用相同的编码器和解码器,但对每个通道进行独立处理。解码后的通道随后重新组合,实现立体声音频的输入和输出。
  • 对于每个通道,H3-AudioVAE 将 32 kHz 音频压缩为时间速率为 40 Hz 的 latent token 序列。
  • 受 VA-VAE 的启发,我们优化了 latent 空间,以在保持音频重建质量的同时,使其更易于生成模型学习。

H3-Omni-Transformer

  • 为了兼顾可扩展性和泛化能力,我们采用了相对简单的 Transformer 块设计。H3-Omni-Transformer 是一个具有 330 亿参数的密集型单流 Transformer,其中约 130 亿参数位于 AdaLN 相关分支。由于 AdaLN 调制输出可以预先计算并缓存,因此这些参数在仅推理部署时无需加载。我们发布完整的模型权重,以支持进一步的开发,包括微调。

  • 注意力层和 FFN 层均不包含模态特定结构。模态特定参数仅限于输入/输出层和 AdaLN 分支。特别是,模态特定的 AdaLN 能够以相对较低的额外训练和推理成本提高生成质量。

  • 该模型使用三维多模态旋转位置嵌入(MM-RoPE)来表示跨时间和两个空间维度 (t, h, w) 的位置关系。

  • 在训练的最后阶段,我们引入了原生稀疏注意力,以降低长序列的计算成本。稀疏注意力的实现未包含在初始开源版本中,将在未来的更新中单独发布。

H3-Regenerate-2K

  • 针对H3的2K分辨率输出,我们并未采用传统的专用超分辨率模块,而是利用H3基础模型,通过上下文内(in-context)方式对其自身生成的低分辨率结果进行重新生成。

  • 这种方法具有两大优势:(1)再生过程能够最大程度复用H3基础模型的生成能力;(2)上下文内格式在生成高分辨率输出时可以复用原始的多模态上下文,使其能够恢复传统超分辨率方法不得不“猜测”的信息,例如小文本和精细细节。

  • 上下文内再生也是任务泛化的一个实例。

  • 由于系统的复杂性,该模块目前尚未开源。我们将在准备就绪后发布。 我们提供了一个用于验证官方结果的API;详见下方的“完整2K工作流程”。

推荐工作流程

为帮助社区正确部署MiniMax H3,我们提供了两种验证方法。

由于完整的H3系统由三个模块组成——H3-Context-IR、H3-Base和H3-Regenerate-2K,“完整2K工作流程”结合开放平台API与本地部署的H3-Base,提供了2K输出的端到端验证管道。“H3-Base本地部署”部分则提供了仅使用本地部署的H3-Base来验证768p输出的方法。

此外,“提示词指南”部分提供了详细教程,以帮助社区开发自己的提示词系统。

H3-Base本地部署

MiniMax H3以两个特定任务的检查点形式发布。每个检查点包含一个专用的Omni Transformer模型,以及所需的处理器、分词器、文本编码器、视觉VAE和独立的音频VAE组件。

检查点支持任务输入条件输出精度
MiniMax-H3 Base FL2VA文本到音视频(t2va)、首帧/末帧到音视频(fl2va)文本;可选的首帧、末帧或两者皆有视频和音频BF16
MiniMax-H3 Base Ref2VA参考到音视频(ref2va)带有参考图像、视频和/或音频的文本视频和音频BF16

发布的检查点是经过CFG蒸馏的Omni Transformer模型权重。

每个检查点均以自包含的Hugging Face风格仓库形式分发,包含以下组件:

<TASK>/
├── model_index.json
├── processor/
├── tokenizer/
├── text_encoder/
├── transformer/
├── visual_vae/
└── audio_vae/

下载模型。该仓库同时托管原始检查点(FL2VA/、Ref2VA/)和 diffusers 格式文件,因此请根据您的框架需求选择下载内容:

model_index.json 是仓库级别的公共入口。特定任务族的 diffusers 索引仍位于 FL2VA/model_index.json 和 Ref2VA/model_index.json 下。

# Original checkpoint, both task families (SGLang, vLLM):
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3

# Or a single task family:
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" --local-dir MiniMax-H3

diffusers 用户无需手动下载:ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") 会精确获取所需的组件。有关加载方法,请参阅 diffusers 文档。

我们推荐使用以下推理框架来部署模型:

  • SGLang - 详见 使用指南

  • vLLM - 详见 vllm 使用方法

  • diffusers - 详见 diffusers 文档

  • ComfyUI - 详见 Comfy 教程;使用 R2V 模板 / T2V 模板

Sglang 部署

这里我们以 sglang 为例进行部署说明。有关其他部署配置,请参见 MiniMax-H3 部署指南。

FL2VA:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

Ref2VA:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30011 \
  --model-variant ref2va

可复现的768p案例

以下三个使用场景T2VA、FL2VA和Ref2VA展示了如何复现MiniMax-H3的视频-音频生成效果。

使用场景请求结果
T2VA查看脚本t2va.mp4
FL2VA查看脚本fl2va.mp4
Ref2VA查看脚本ref2va.mp4

完整2K工作流

本节将说明如何将本地部署的SGLang服务与官方的H3-Context-IR和H3-Regenerate-2K API相结合,以复现MiniMax API直接生成的2K视频质量。 开始之前,请配置SGLang端点和您的MiniMax API凭证:

# URL of your SGLang deployment
SGLANG_DEPLOYMENT_URL="<sglang-deployment-url>"

# MiniMax API endpoint (choose one)
# CN
MINIMAX_API_BASE="https://api.minimaxi.com"
# Global
# MINIMAX_API_BASE="https://api.minimax.io"

# API token obtained from the MiniMax platform
TOKEN="<token>"

MiniMax 平台:

API 文档:

  • 创建 H3-2K:使用 /video-generation-v2-create 英文文档,中文文档
  • H3-Context-IR:使用 /video-generation-v2-h3-context-ir 英文文档,中文文档
  • H3-Regenerate-2K:使用 /video-generation-v2-regeneration 英文文档,中文文档

以下示例将本地 H3-Base 输出文件编码为 Base64 数据 URL。对于生产环境使用,建议将视频上传至可公开访问的 URL,并将该 URL 作为 base_video 参数传入。

对于以下每个案例,我们均提供了通过开放平台 API 直接生成的 2K 和 768p 参考输出,以便更轻松地验证结果。

case-T2VA

  • 类型:文本转视频
  • 时长:10 秒
  • 宽高比:16:9
阶段请求结果
H3-Context-IR查看脚本
{
  "task": {
    "id": "<task_id>",
    "model": "MiniMax-H3",
    "status": "succeeded",
    "created_at": "<created_at>",
    "updated_at": "<updated_at>",
    "content": {
      "prompt": "integrated_multimodal_description: [镜头 1] 电影感,中远景,缓慢推进。在星际飞船巨大、光线昏暗的舰桥内,光滑的金属控制台配有发光的琥珀色显示屏,两侧是巨大的弧形观察窗。一位40多岁、身材健硕、黑色短发中夹杂着几缕银丝的女舰长,站在画面中央的中景位置。她身着结构感十足、高领的深蓝色军装外套,胸前佩戴着银色徽章。她背对着镜头,在透过厚玻璃倾泻而入的清冷环境星光下形成剪影。她双手紧握在身后,纹丝不动地站立着。窗外,庞大的灰黑色无畏舰舰队呈密集阵型悬浮在深紫色的太空星云背景中。舰队巨大的尾部推进器开始发出强烈且不断增强的明亮蓝光。[镜头 2] 在 00:04.500 时刻,镜头切换至舰长脸部特写并剧烈晃动。舰队聚集能量时发出的明亮蓝白色光芒在她深色的眼眸中生动地反射。突然,一道耀眼的白色闪光从窗口涌入,完全淹没了背景,舰队跃入超空间。纯粹的空间力量猛烈地震动着舰桥,导致镜头 1 中的舰长微微向前踉跄,她绷紧肩膀,明显在抵抗物理震动。当强烈的白光突然消退,只留下紫色星云昏暗空旷的景象映照在她被强光照射的皮肤上时,她咬紧牙关,在这刚刚变得空旷的太空中缓缓闭上了眼睛。\noverall_soundscape: 飞船环境生命支持系统低沉而共振的嗡鸣声作为基线,很快被窗外舰队充能超光速引擎时发出的可听见的、不断升级的高频电子嗡鸣声所淹没。在耀眼闪光期间,爆发出巨大、震耳欲聋的低音轰鸣和尖锐的噼啪声,伴随着舰桥舱壁在巨大物理压力下发出的响亮金属 creaking 声、咔嗒声和深沉的撞击声。强烈的轰鸣声随后突然切回到空洞的、回荡的室内基调,只留下孤立舰桥微弱而稳定的嗡鸣声。\nnon_diegetic_music: 电影式太空歌剧管弦乐配乐,慢节奏,以孤独、哀伤的法国号旋律为主,伴随着深沉、持续的弦乐不和谐音,音量和强度迅速增强,在跳跃后达到巨大的管弦乐高潮,然后立即陷入寂静。"
    },
    "duration": 10,
    "usage": {
      "total_tokens": 8565,
      "prompt_tokens": 5650,
      "completion_tokens": 2915
    },
    "ratio": "16:9",
    "task_type": "h3_context_ir",
    "modality": "text"
  }
}
H3-Base查看脚本t2va.mp4
H3-Regenerate-2K查看脚本t2va_2k.mp4
通过直接调用开放平台 API 获得的 2K 参考结果查看脚本h3_direct_2k.mp4
通过直接调用开放平台 API 获得的 768P 参考结果查看脚本h3_direct_768p.mp4

case-I2VA

  • 类型:首帧图像转视频
  • 时长:8 秒
  • 宽高比:自适应
阶段请求结果
H3-Context-IR查看脚本
{
  "task": {
    "id": "<task_id>",
    "model": "MiniMax-H3",
    "status": "succeeded",
    "created_at": "<created_at>",
    "updated_at": "<updated_at>",
    "content": {
      "prompt": "对于目标视频,在目标视频的 0.00 秒处,完全参考了<图片 1>(来自[镜头 1])。\n\nintegrated_multimodal_description: [镜头 1] 这是一个真人实拍的电影感镜头,景深较浅。在整个 8 秒的时长内,镜头保持完美的静态,捕捉了传统日式餐厅内温馨的家庭聚会场景。画面以一个放在前景的、图案复杂的蓝白陶瓷大碗拉面开始,对焦清晰锐利。碗放在一张光滑的抛光长木桌上。碗内,浓郁油亮的金棕色汤汁环绕着黄色的波浪形面条,顶部放着两片厚厚的圆形叉烧肉,肉上有可见的脂肪纹理和明显的螺旋肉纹。中央是一堆新鲜切碎的亮绿色葱花,右侧边缘还卷着一片酥脆的深绿色海苔。碗的左侧,一双浅棕色的木筷横放在一个黑色的小长方形筷架上,旁边是一个带蓝色彩绘图案的圆柱形小陶瓷茶杯。桌子的右侧,一个带肋状竹架的球形纸灯笼放在黑色的木制底座上。背景中,七口之家围坐在桌旁,最初呈现为柔和模糊的景象。他们身后,带有木格框架的传统日式推拉门敞开着,露出外面阳光明媚、绿树成荫的景象。视频开始时,热拉面碗冒出的浓密白汽立即变得浓郁,在碗上方滚滚翻腾,不断舞动。随着视频进入中间几秒,镜头保持静态,而焦点开始有意识地、平滑地向房间深处转移。前景的拉面碗、其鲜艳的食材和上升的蒸汽逐渐柔化为朦胧的失焦状态。同时,背景中的家庭成员变得清晰锐利,细节分明。前景的浓密蒸汽继续上升,在镜头和家庭成员之间形成一道动态的半透明帷幕。当焦点牢固地锁定在背景上时,充满活力的家庭晚餐场景变得生动起来。左边那个穿着深蓝色长袖衬衫的男人身体前倾,嘴巴在无声的交流中生动地动着。他旁边那个穿着 crisp 白色短袖 T 恤的小女孩灿烂地笑着,看向桌子中央。最左边那个穿着柔和浅蓝色长袖上衣的女人微微转过头,温柔地微笑着。桌子对面,穿着浅灰色纽扣衬衫的女人笑容灿烂,眼睛眯成了一条缝,双手放在盘子附近。再往后一点,穿着深灰色上衣的女人用木筷从一个装满鲜红色腌菜的中央陶瓷盘子里夹起一小块食物。中间靠后的那个穿着浅灰色毛衣的女人温柔地微笑着,双手轻轻 clasped 在身前,观察着互动。在视频的剩余时间里,家庭成员继续他们热烈的身体互动,嘴巴在持续的、无声的对话节奏中移动,而前景中模糊的拉面碗冒出的浓密白汽从未停止,为这个温暖的聚会增添了舒适的氛围。\n\noverall_soundscape: 音景以安静的室内基调开始,混合着前景热拉面碗冒出的浓密白汽发出的微弱、轻盈的 rustle 声,伴随着浓郁汤汁发出的微妙、持续的嘶嘶声和 bubbling 声。当视觉焦点向房间深处转移时,热闹的家庭晚餐的物理声音成为前景的主导。家庭成员取食物时,陶瓷碗和木筷接触盘子发出的清晰、尖锐的 clinking 声清晰可闻。随后是杯子放在光滑木桌上发出的微弱、沉闷的撞击声,以及家庭成员身体前倾和打手势时棉毛衣物发出的微妙、有节奏的 rustle 声,完美捕捉了共享餐点时活跃的物理氛围。\n\nnon_diegetic_music: 一段温柔、暖心的原声吉他旋律在背景中轻轻播放,伴随着传统日本 koto 琴发出的微妙、共鸣的音符。音乐保持缓慢、舒适的节奏,增强了家庭聚会的温馨、怀旧和欢乐氛围。"
    },
    "duration": 8,
    "usage": {
      "total_tokens": 22822,
      "prompt_tokens": 12800,
      "completion_tokens": 10022
    },
    "ratio": "16:9",
    "task_type": "h3_context_ir",
    "modality": "text"
  }
}
H3-Base查看脚本i2va.mp4
H3-Regenerate-2K查看脚本i2va_2k.mp4
通过直接调用开放平台 API 获得的 2K 参考结果查看脚本i2va_direct_2k.mp4
通过直接调用开放平台 API 获得的 768P 参考结果查看脚本i2va_direct_768p.mp4

case-Ref2VA

  • 类型:多模态参考转视频(视频 + 音频)
  • 时长:5 秒
  • 宽高比:自适应
阶段请求结果
H3-Context-IR查看脚本
{
  "task": {
    "id": "<task_id>",
    "model": "MiniMax-H3",
    "status": "succeeded",
    "created_at": "<created_at>",
    "updated_at": "<updated_at>",
    "content": {
      "prompt": "subject_definitions:\n<主体 1> 是<视频 1>中那个留着短波浪金发、穿着亮粉色西装外套、配套粉色长裤、未扣纽扣的白色衬衫并戴着银戒指、怀里抱着一只小黑羊的年轻男子。\n<视频 1> 是用于编辑任务的源视频。\n<音频 1> 是<视频 1>的同步音轨,提供背景音乐。\n<音频 2> 是<主体 1>声音的音色参考,包含一个男性旁白。\n\nsummary:\n[视频编辑 + 音频参考 + 音频复用] 目标视频是<视频 1>的编辑版本。<主体 1>穿着亮粉色西装,抱着一只黑羊,站在草地上,背景中有其他白羊。编辑使<主体 1>的面部动起来,说出用户提供的对话。<音频 1>部分被复用为持续的背景音乐,而目标视频参考<音频 2>中沉稳的男性声音音色作为<主体 1>的台词。\n\nretention_analysis:\n<主体 1>(出现在[镜头 1]):fully_preserved - 该男子保留其身份、波浪金发、粉色西装、白色衬衫、配饰以及他怀抱的黑羊,其嘴巴被新制作为说话的动画。\n<视频 1>(源视频编辑):fully_preserved - 原始相机取景、温暖的黄金时刻光线、草地山丘场景和背景白羊得以保留,同时对中心人物进行了编辑。\n<音频 1>: partially_copy - <音频 1>中的氛围背景音乐在目标视频中被复用,混合在新添加的对话之下。\n<音频 2>: reference - 目标音频参考<音频 2>中的男性声音音色来生成<主体 1>的对话。\n\ndetailed_description:\n目标视频为写实摄影风格。\n[镜头 1] 镜头从源<视频 1>开始,展示<主体 1>,一个留着短波浪金发的年轻男子,穿着亮粉色西装外套、配套粉色长裤和随意解开纽扣的白色衬衫。他自信地站在阳光明媚的绿色牧场上,将一只小黑羊轻轻地抱在怀里。温暖的黄金时刻光线在他的脸上和亮粉色的西装面料上投下柔和的阴影。在他身后,几只白羊在起伏的草地上站立和吃草,背景是清澈的淡蓝色天空。<音频 1>中的氛围背景音乐在整个场景中持续播放。<主体 1>开口说话,他的嘴部动作自然地与新对话同步,其声音音色参考了<音频 2>中沉稳的男性语调。<主体 1>(S1)若有所思地向前看,轻声说道:<d>[English] Follow the wind, live free.</d> 在他说这句话时,他微妙地变换了重心,抱着正在休息的黑羊,同时镜头缓慢推进。<主体 1>(S1)继续他的思考:<d>[English] Leave worries behind, enjoy the moment.</d> 就在他的声音停止的那一刻,他的嘴唇放松地、平静地微笑着,下巴停止了说话动作。然后他将目光略微转向地平线,手指轻轻抚摸着黑羊的羊毛,镜头在这个宁静、阳光明媚的状态下一直保持到视频结束。\n\noverall_soundscape:\n音景由<音频 1>中持续的氛围背景音乐组成,叠加在主角清晰、沉稳的男性对话之上,并参考了<音频 2>的声音音色。\n\nnon_diegetic_music:\n<音频 1>中氛围的、持续的背景音乐被复用为连续的配乐,在对话下方轻柔地播放。"
    },
    "duration": 5,
    "usage": {
      "total_tokens": 39299,
      "prompt_tokens": 33323,
      "completion_tokens": 5976
    },
    "ratio": "16:9",
    "task_type": "h3_context_ir",
    "modality": "text"
  }
}
H3-Base查看脚本r2va.mp4
通过直接调用开放平台 API 获得的 2K 参考结果查看脚本r2va_2k.mp4
开放平台 H3 API 2K 参考查看脚本r2va_direct_2k.mp4
通过直接调用开放平台 API 获得的 768P 参考结果查看脚本r2va_direct_768p.mp4

提示词使用指南

VIDEO_PROMPT_WRITING_GUIDE_base_en.md

VIDEO_PROMPT_WRITING_GUIDE_ref_en.md

提升提示词技巧:https://github.com/MiniMax-AI/MiniMax-H3/tree/main/skills

许可协议

MiniMax H3 根据 MiniMax H3 社区许可协议 发布。许可协议常见问题

联系我们

请通过 model@minimax.io 与我们联系。