这是适用于 MiniMax-H3 的 LoRA 模型,能够仅用 4 个采样步骤(而非通常的约 20 个步骤)即可渲染出 视频 + 同步立体音频,采样速度提升约 5 倍,并且随着步骤的增加效果还会持续优化。
v4(600 步)还是 v1(850 步)?对于 大多数 工作,建议使用 minimax_h3_turbo_v4_step600_ema.safetensors。这是我们发布的性能最强的 checkpoint:静态和小幅运动镜头的效果显著提升,微观细节(面部、手指、精细纹理)明显改善,并且早期 v1(约 850 步)版本存在的过度锐化/塑料感问题已 完全解决。
v4 版本引入了 静态帧增强 功能,这对静态和小幅运动内容来说是一大优势。唯一的权衡仅在 4 步且存在大幅快速运动 时出现,此时 v4 可能会产生 运动模糊/拖尾鬼影(我们正在积极修复此问题)。以下两种方法可解决此问题:
v1 ~850 checkpoint 仍然是更合适的选择。Using 6–8 steps? ── yes ──► v4-600 (recommended)
│ no (4 steps)
▼
Heavy / fast motion? ── no ──► v4-600 (recommended)
│ yes
▼
v1-850 (friendlier at 4-step heavy motion)仍处于预览阶段——训练仍在进行中;目前仍在改进的两个方面是音频和快速、剧烈运动下的表现。
1.0。 模型针对 1.0 进行了优化,并且在 4–8 步的范围内表现良好。只有当特定片段出现问题时,才需要调整强度:模糊重影/拖影 → 略微调高(~1.05–1.2),过度锐化的噪点 → 略微调低(~0.8–0.95)。simple。自定义节点:Larryvrh/ComfyUI-MiniMax-H3-Turbo —— 或在 ComfyUI-Manager 中搜索 "MiniMax-H3 Turbo"。(请保持节点更新;它会随着这些权重一同迭代。)
git clone 到 ComfyUI/custom_nodes 目录),并将本仓库中的 .safetensors 文件放入 ComfyUI/models/loras/ 目录。您还需要基础的 MiniMax-H3 模型、VAEs 和文本编码器 — 请参阅 MiniMax-H3 教程。SamplerCustomAdvanced 连接起来,并将调度器设置为 simple,步数**≥ 4**。工作流的其他所有部分均与官方图表保持一致,因此文本生成视频(text-to-video)和图像生成视频(image-to-video)均可正常工作。一个现成的 t2v 工作流已包含在节点仓库中(本仓库中也提供了 minimax_h3_t2v_turbo.json 文件)—— 直接拖入即可使用。
bf16、int8_convrot)以及剪枝/曲线变体(pruned_int8、pruned_fp8)。节点会自动检测剪枝基础模型,并在运行时重新注入时间条件,因此一个 LoRA 文件适用于所有基础模型。low_vram 开关:关闭时在运行时应用 LoRA(最清晰,推荐);开启时将 LoRA 合并到权重中,以实现最低的峰值显存占用(在量化基础模型上效果会稍柔和一些)。仅在内存不足时开启此选项。ModelSamplingAV),而旧版本则不支持 — Turbo Sampler 会检测您的版本并自动做出正确处理,因此更新 ComfyUI 时无需进行任何额外更改。所有权重均为bf16格式,大小约744 MB,以普通低秩更新方式应用(W_eff = W + lora_B @ lora_A,alpha = rank,因此无需额外缩放)。建议优先使用EMA文件;非EMA文件仅用于对比。
| 文件 | 说明 |
|---|---|
minimax_h3_turbo_v4_step600_ema.safetensors | 推荐使用 — 当前最佳版本。 静态/小幅动态表现出色,微细节丰富,无过度锐化问题。 |
minimax_h3_turbo_v4_step600.safetensors | v4-600 非EMA版本(用于对比)。 |
minimax_h3_turbo_v4_step150_ema.safetensors | 早期v4检查点。 |
minimax_h3_turbo_4step_ema_ckpt850.safetensors | v1 系列(约850步)— 整体存在过度锐化/塑料感问题,但对于4步大幅动态场景是更友好的选择(见上文)。 |
minimax_h3_turbo_4step_ema_ckpt500.safetensors | 较早的v1版本(约500步),效果更柔和。 |
minimax_h3_turbo_4step_ema.safetensors | 初始发布版本(约200步)。 |
命名规则: v4 代表当前训练方案,stepN 表示训练步数。旧版文件采用先前的 4step_ckptN 命名方式,其中 4step 指采样器步数。
generate.py 是一个独立的文件 — 它加载基础DiT模型和LoRA,对提示词进行编码,运行少步双调度采样器,解码并合成为mp4文件。仍需检出ComfyUI以获取H3模型/VAE/文本编码器的定义:
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI && pip install -r requirements.txt && cd ..
pip install -r requirements.txt # this repo: torch, safetensors, imageio-ffmpeg
# base weights from Comfy-Org/MiniMax-H3 into a models/ tree, then:
python generate.py \
--comfyui ./ComfyUI \
--base models/diffusion_models/minimax_h3_fl2va_bf16.safetensors \
--lora minimax_h3_turbo_v4_step600_ema.safetensors \
--te models/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors \
--video-vae models/vae/minimax_h3_video_vae_fp16.safetensors \
--audio-vae models/vae/minimax_h3_audio_vae_fp32.safetensors \
--prompt "A corgi in a chef hat flipping a pancake, sizzling sounds and a cheerful bark." \
--width 1344 --height 768 --frames 124 --steps 6 --out corgi.mp4low_vram开关,因此可在显存小得多的GPU上运行。在独立脚本中,--offload-adaln参数可将约13 GB的显存占用转移到CPU内存。