HuggingFace镜像/MiniMax-H3-Turbo-Lora
模型介绍
文件和版本
分析

MiniMax-H3 Turbo LoRA — 少步骤音视频生成

这是适用于 MiniMax-H3 的 LoRA 模型,能够仅用 4 个采样步骤(而非通常的约 20 个步骤)即可渲染出 视频 + 同步立体音频,采样速度提升约 5 倍,并且随着步骤的增加效果还会持续优化。

选择哪个 checkpoint — v4(600 步)还是 v1(850 步)?

对于 大多数 工作,建议使用 minimax_h3_turbo_v4_step600_ema.safetensors。这是我们发布的性能最强的 checkpoint:静态和小幅运动镜头的效果显著提升,微观细节(面部、手指、精细纹理)明显改善,并且早期 v1(约 850 步)版本存在的过度锐化/塑料感问题已 完全解决。

v4 版本引入了 静态帧增强 功能,这对静态和小幅运动内容来说是一大优势。唯一的权衡仅在 4 步且存在大幅快速运动 时出现,此时 v4 可能会产生 运动模糊/拖尾鬼影(我们正在积极修复此问题)。以下两种方法可解决此问题:

  • 使用 6–8 个步骤。 这能 大幅减少模糊,也是 v4 表现最佳的区间。v4 对更高步数的容忍度也优于 v1,后者在高步数 + 强度 1.0 的情况下往往会过度锐化。
  • 对于 4 步且运动剧烈 的特定场景,较旧的 v1 ~850 checkpoint 仍然是更合适的选择。
Using 6–8 steps?        ── yes ──►  v4-600  (recommended)
   │ no (4 steps)
   ▼
Heavy / fast motion?    ── no  ──►  v4-600  (recommended)
   │ yes
   ▼
                                    v1-850  (friendlier at 4-step heavy motion)

仍处于预览阶段——训练仍在进行中;目前仍在改进的两个方面是音频和快速、剧烈运动下的表现。

步数和强度 — 请阅读此部分

  • 建议的最低步数为 4 步;4–8 步是实用范围。 6–8 步的效果明显优于 4 步,因此如果条件允许,请增加步数。超过8 步后,不仅没有帮助,还可能开始引入过度锐化的伪影——进一步增加步数没有任何益处,因此请保持在4–8 步范围内。
  • 将强度保持在 1.0。 模型针对 1.0 进行了优化,并且在 4–8 步的范围内表现良好。只有当特定片段出现问题时,才需要调整强度:模糊重影/拖影 → 略微调高(~1.05–1.2),过度锐化的噪点 → 略微调低(~0.8–0.95)。
  • 调度器保持为 simple。

在 ComfyUI 中使用(推荐)

自定义节点:Larryvrh/ComfyUI-MiniMax-H3-Turbo —— 或在 ComfyUI-Manager 中搜索 "MiniMax-H3 Turbo"。(请保持节点更新;它会随着这些权重一同迭代。)

  1. 安装节点(通过 Manager,或 git clone 到 ComfyUI/custom_nodes 目录),并将本仓库中的 .safetensors 文件放入 ComfyUI/models/loras/ 目录。您还需要基础的 MiniMax-H3 模型、VAEs 和文本编码器 — 请参阅 MiniMax-H3 教程。
  2. 从官方的 MiniMax-H3 工作流(t2v 或 i2v)开始,并进行两项更改:
    • 在模型加载器和采样器之间插入 MiniMax-H3 Turbo LoRA;
    • 将 MiniMax-H3 Turbo Sampler 中的 SamplerCustomAdvanced 连接起来,并将调度器设置为 simple,步数**≥ 4**。

工作流的其他所有部分均与官方图表保持一致,因此文本生成视频(text-to-video)和图像生成视频(image-to-video)均可正常工作。一个现成的 t2v 工作流已包含在节点仓库中(本仓库中也提供了 minimax_h3_t2v_turbo.json 文件)—— 直接拖入即可使用。

  • 基础模型:任何 MiniMax-H3 基础模型 — 完整模型(bf16、int8_convrot)以及剪枝/曲线变体(pruned_int8、pruned_fp8)。节点会自动检测剪枝基础模型,并在运行时重新注入时间条件,因此一个 LoRA 文件适用于所有基础模型。
  • low_vram 开关:关闭时在运行时应用 LoRA(最清晰,推荐);开启时将 LoRA 合并到权重中,以实现最低的峰值显存占用(在量化基础模型上效果会稍柔和一些)。仅在内存不足时开启此选项。
  • 自定义采样器会自动适配您的 ComfyUI 版本:MiniMax-H3 在视频和音频上使用两种不同的流调度;较新版本的 ComfyUI 原生支持此功能(ModelSamplingAV),而旧版本则不支持 — Turbo Sampler 会检测您的版本并自动做出正确处理,因此更新 ComfyUI 时无需进行任何额外更改。

权重

所有权重均为bf16格式,大小约744 MB,以普通低秩更新方式应用(W_eff = W + lora_B @ lora_A,alpha = rank,因此无需额外缩放)。建议优先使用EMA文件;非EMA文件仅用于对比。

文件说明
minimax_h3_turbo_v4_step600_ema.safetensors推荐使用 — 当前最佳版本。 静态/小幅动态表现出色,微细节丰富,无过度锐化问题。
minimax_h3_turbo_v4_step600.safetensorsv4-600 非EMA版本(用于对比)。
minimax_h3_turbo_v4_step150_ema.safetensors早期v4检查点。
minimax_h3_turbo_4step_ema_ckpt850.safetensorsv1 系列(约850步)— 整体存在过度锐化/塑料感问题,但对于4步大幅动态场景是更友好的选择(见上文)。
minimax_h3_turbo_4step_ema_ckpt500.safetensors较早的v1版本(约500步),效果更柔和。
minimax_h3_turbo_4step_ema.safetensors初始发布版本(约200步)。

命名规则: v4 代表当前训练方案,stepN 表示训练步数。旧版文件采用先前的 4step_ckptN 命名方式,其中 4step 指采样器步数。

独立运行(无需ComfyUI流程图)

generate.py 是一个独立的文件 — 它加载基础DiT模型和LoRA,对提示词进行编码,运行少步双调度采样器,解码并合成为mp4文件。仍需检出ComfyUI以获取H3模型/VAE/文本编码器的定义:

git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI && pip install -r requirements.txt && cd ..
pip install -r requirements.txt          # this repo: torch, safetensors, imageio-ffmpeg

# base weights from Comfy-Org/MiniMax-H3 into a models/ tree, then:
python generate.py \
  --comfyui ./ComfyUI \
  --base   models/diffusion_models/minimax_h3_fl2va_bf16.safetensors \
  --lora   minimax_h3_turbo_v4_step600_ema.safetensors \
  --te     models/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors \
  --video-vae models/vae/minimax_h3_video_vae_fp16.safetensors \
  --audio-vae models/vae/minimax_h3_audio_vae_fp32.safetensors \
  --prompt "A corgi in a chef hat flipping a pancake, sizzling sounds and a cheerful bark." \
  --width 1344 --height 768 --frames 124 --steps 6 --out corgi.mp4

注意事项

  • 分辨率/时长:宽度和高度需为32的倍数(短边通常为768)。帧率为24 fps,并匹配模型的17·k+5网格(124帧≈5秒)。已验证的有效范围约为124–362帧(≈5–15秒)。
  • 显存(VRAM):基础模型较大(≈33 B);在最高分辨率下,80 GB GPU运行起来会比较流畅。ComfyUI节点会流式加载基础模型并添加low_vram开关,因此可在显存小得多的GPU上运行。在独立脚本中,--offload-adaln参数可将约13 GB的显存占用转移到CPU内存。
  • 音频:32 kHz立体声,与视频对齐;两个流采用不同的流动调度,并按各自的时钟进行整合。(音频是仍在改进的两个方面之一——详见顶部说明。)