HuggingFace镜像/H3_Character_Sheet_Generator
模型介绍
文件和版本
分析

更新 - 2026年8月31日

  • 修复了 Anime2Real 的提示词部分。

更新 - 2026年8月29日

  • 修复了 4 格版本,现在它实际生成 73 帧,而不是 6 格版本原来的 124 帧(我的失误!!)
  • 更新了可选加速节点,现在运行快了很多
  • 添加了关于步数的说明,如果启用加速,请使用 8 步而不是 25 步
  • 移除了 B prompt 中关于头发和裙子的一段描述,因为这会给部分用户造成问题
  • 如果你想尝试将背景/房间转换为环绕视角,可以看看 ethanfel 的工作流,它应用了与本工作流相同的逻辑,但针对的是房间
  • anime2real 提示词还需要稍作完善(我会很快更新这部分)
  • 如果你有任何问题或疑问,欢迎告诉我

H3 Character Sheet Generator

我发起这个项目,是因为我一直难以找到适合 H3 参考的高质量、准确图像,因此意识到该模型具有出色的角色一致性,并且可以接受最多 9 张参考图。

投入几张粗略的参考图,就能得到一张可以长期复用的角色设定图。

Celtic Knight character sheet

和你们很多人一样,我也一直在研究 H3,并对它的多图 参考功能有些着迷。你可以输入最多 9 张图片,这意味着你可以用零散素材拼出一个角色 —— 脸取自这里,盔甲取自那里,帽子取自别处 —— 而它真的能 把它们整合在一起。

所以这个工作流就是做这件事,让角色旋转 360 度(如果使用 4 格版本则为 180 度),并生成一张参考图,你可以用它 在之后制作的所有内容中保持角色一致。

Celtic Knight inputs

为什么还要用视频模型做这件事

如果你把同一角色单独生成六张图,它们很容易互相矛盾:下颌会移位,外套会变化,颜色也会漂移。这种问题你肯定见怪不怪了。

一次视频生成得到的六帧画面不会这样——它们出自同一次生成过程。这就是全部诀窍。镜头做一次慢速环绕,没有任何硬切;角色像雕像一样保持静止;随后工作流抓取六帧,并将它们拼接起来。


工作原理

  1. 你放入图片,并在 Input Text (A Prompt) 框中描述它们
  2. 这些内容会与 B Prompt 一起提交,由后者负责旋转、姿态、光照等
  3. 它会生成一个慢速 360 度环绕,且没有硬切,因此角色能保持一致
  4. 抓取 6 帧或 4 帧,并将其拼接成角色表

你也可以选择把 360 度旋转视频和每一帧单独画面作为可选输出,方便之后自行挑选角度,或将单帧用作参考。


两个版本

文件内容
H3_CharSheetMaker_6_Panel.json正面、左右两侧、背面,外加两张面部特写
H3_CharSheetMaker_4_Panel__Faster_.json四个视角,帧数少约 40%,速度明显更快

同一个骑士,4 格图:

Celtic Knight 4 格图

你需要什么

模型 — 每个加载节点都已内置下载链接,因此打开工作流时,ComfyUI 应该会直接提示下载缺失的模型。

槽位文件放置目录
Diffusionminimax_h3_ref2va_pruned_int8_convrot.safetensorsmodels/diffusion_models/
Text encoderqwen3vl_32b_minimax_h3_int8_convrot.safetensorsmodels/text_encoders/
Video VAEminimax_h3_video_vae_int8_convrot.safetensorsmodels/vae/
Audio VAEminimax_h3_audio_vae_fp32.safetensorsmodels/vae/
Turbo LoRA(可选)minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensorsmodels/loras/

这些是 INT8 低显存构建版本。如果你还有显存余量,更高精度的版本能带来更好的细节——尤其是文本编码器,提示词遵循能力主要取决于它。

自定义节点 — 我尽量让它保持原生体验。唯一的第三方组件都在可选的 Speed Ups 分组中:

  • KJNodes
  • rgthree(仅用于切换面板)

如果你不需要,可以删除该分组。


编写 A Prompt

每张图像一行。写明应保留的内容,并且——这一点比人们想象的更为重要——写明应 忽略的内容:

<Picture 1> - keep the photo style. Use the bald head, facial hair, physique.
<Picture 2> - keep only the black outfit. Remove the hair, remove accessories.
<Picture 3> - use the shield. It is attached to the man's back.

如果不按名字把不需要的内容排除掉,背景和错误人物的头发就会偷偷混进来。

也值得用文字描述服装,而不只是展示它。脸部能自然保持一致,但服装容易跑偏。“黑色高领外套配银色扣饰”会保持稳定。“图 2 里的外套”则会跑偏。


动画转写实

有人问能不能做动画转写实,所以还有一个修改过的 B 提示词,专门用于这个。效果出奇地好。

Haruhi:

Haruhi 动画转写实

Sanji:

Sanji 动画转写实

这里就是实际生成的视频,你可以看看它是如何运作的——缓慢旋转,不切镜头,最后加几张脸部特写:

这六个面板只是从里面抽出来的帧。


物体

该模型在生成物体方面也非常出色,但建议使用更多角度的图片作为参考。

网上随便找的一张盾牌图

注意事项(说实话)

速度有一点点慢。 你生成了 124 帧,却只用 6 帧,这种思路本质上就是这么荒谬。4 面板版本会好一些:只需生成 73 帧并取 4 帧(提速 40%)。

提速会付出一些代价。 Turbo LoRAs 和缓存确实能加快速度,但提示词遵循度和质量会有轻微下降。除了最后一遍出图,大多数时候都值得。

质量上限有限。 它是一个视频模型,视频表现比静帧更好。如果在意,可以把分辨率和采样步数拉高,代价就是更长的生成时间。

只靠角色表可能不够做特写。 每个面板的分辨率就是那样。做近距离画面时,我会用角色表加上一些细节图——脸部、服装质感,或者其他重要的部分。说实话,对于一次性视频,你也许最好跳过角色表,直接使用原图。


技巧

  • 更多步数 = 如果你愿意等待,质量会略有提升
  • B prompt 中写着 "neutral A pose" —— 如果你想要特定姿势,请删除该部分
  • 使用同一角色的多个不同镜头。 输入的角度越多,360 输出越好
  • 也适用于物体和道具。 你需要调整 B prompt,主要是将面部 特写替换为细节镜头
  • 帧时序在不同运行之间会变化。如果某个分镜看起来不对,开启 “save all frames” 输出,找到 更好的帧编号并插入子图。重新拼接已缓存,因此瞬间完成

许可事项

工作流文件是我的,你可以随意使用它们。

模型就不一样了。 MiniMax H3 采用社区许可证,该许可证排除欧盟、英国、韩国和美国,并且同时覆盖输出和模型权重。如果你有任何商业计划,请直接阅读 实际许可证,而不是听我的一面之词。我不是律师。


基于 Comfy-Org/MiniMax-H3。如果你弄坏了它或改进了它,请尽管反馈。

作者:C_Nugget