我发起这个项目,是因为我一直难以找到适合 H3 参考的高质量、准确图像,因此意识到该模型具有出色的角色一致性,并且可以接受最多 9 张参考图。
投入几张粗略的参考图,就能得到一张可以长期复用的角色设定图。
和你们很多人一样,我也一直在研究 H3,并对它的多图 参考功能有些着迷。你可以输入最多 9 张图片,这意味着你可以用零散素材拼出一个角色 —— 脸取自这里,盔甲取自那里,帽子取自别处 —— 而它真的能 把它们整合在一起。
所以这个工作流就是做这件事,让角色旋转 360 度(如果使用 4 格版本则为 180 度),并生成一张参考图,你可以用它 在之后制作的所有内容中保持角色一致。
如果你把同一角色单独生成六张图,它们很容易互相矛盾:下颌会移位,外套会变化,颜色也会漂移。这种问题你肯定见怪不怪了。
一次视频生成得到的六帧画面不会这样——它们出自同一次生成过程。这就是全部诀窍。镜头做一次慢速环绕,没有任何硬切;角色像雕像一样保持静止;随后工作流抓取六帧,并将它们拼接起来。
你也可以选择把 360 度旋转视频和每一帧单独画面作为可选输出,方便之后自行挑选角度,或将单帧用作参考。
| 文件 | 内容 |
|---|---|
H3_CharSheetMaker_6_Panel.json | 正面、左右两侧、背面,外加两张面部特写 |
H3_CharSheetMaker_4_Panel__Faster_.json | 四个视角,帧数少约 40%,速度明显更快 |
同一个骑士,4 格图:
模型 — 每个加载节点都已内置下载链接,因此打开工作流时,ComfyUI 应该会直接提示下载缺失的模型。
| 槽位 | 文件 | 放置目录 |
|---|---|---|
| Diffusion | minimax_h3_ref2va_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| Text encoder | qwen3vl_32b_minimax_h3_int8_convrot.safetensors | models/text_encoders/ |
| Video VAE | minimax_h3_video_vae_int8_convrot.safetensors | models/vae/ |
| Audio VAE | minimax_h3_audio_vae_fp32.safetensors | models/vae/ |
| Turbo LoRA(可选) | minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensors | models/loras/ |
这些是 INT8 低显存构建版本。如果你还有显存余量,更高精度的版本能带来更好的细节——尤其是文本编码器,提示词遵循能力主要取决于它。
自定义节点 — 我尽量让它保持原生体验。唯一的第三方组件都在可选的 Speed Ups 分组中:
如果你不需要,可以删除该分组。
每张图像一行。写明应保留的内容,并且——这一点比人们想象的更为重要——写明应 忽略的内容:
<Picture 1> - keep the photo style. Use the bald head, facial hair, physique.
<Picture 2> - keep only the black outfit. Remove the hair, remove accessories.
<Picture 3> - use the shield. It is attached to the man's back.如果不按名字把不需要的内容排除掉,背景和错误人物的头发就会偷偷混进来。
也值得用文字描述服装,而不只是展示它。脸部能自然保持一致,但服装容易跑偏。“黑色高领外套配银色扣饰”会保持稳定。“图 2 里的外套”则会跑偏。
有人问能不能做动画转写实,所以还有一个修改过的 B 提示词,专门用于这个。效果出奇地好。
Haruhi:
Sanji:
这里就是实际生成的视频,你可以看看它是如何运作的——缓慢旋转,不切镜头,最后加几张脸部特写:
这六个面板只是从里面抽出来的帧。
该模型在生成物体方面也非常出色,但建议使用更多角度的图片作为参考。
速度有一点点慢。 你生成了 124 帧,却只用 6 帧,这种思路本质上就是这么荒谬。4 面板版本会好一些:只需生成 73 帧并取 4 帧(提速 40%)。
提速会付出一些代价。 Turbo LoRAs 和缓存确实能加快速度,但提示词遵循度和质量会有轻微下降。除了最后一遍出图,大多数时候都值得。
质量上限有限。 它是一个视频模型,视频表现比静帧更好。如果在意,可以把分辨率和采样步数拉高,代价就是更长的生成时间。
只靠角色表可能不够做特写。 每个面板的分辨率就是那样。做近距离画面时,我会用角色表加上一些细节图——脸部、服装质感,或者其他重要的部分。说实话,对于一次性视频,你也许最好跳过角色表,直接使用原图。
工作流文件是我的,你可以随意使用它们。
模型就不一样了。 MiniMax H3 采用社区许可证,该许可证排除欧盟、英国、韩国和美国,并且同时覆盖输出和模型权重。如果你有任何商业计划,请直接阅读 实际许可证,而不是听我的一面之词。我不是律师。
基于 Comfy-Org/MiniMax-H3。如果你弄坏了它或改进了它,请尽管反馈。
作者:C_Nugget