tencent_hunyuan/HunyuanVideo-Avatar
模型介绍文件和版本Pull Requests讨论分析

image

HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters

摘要

近年来,音频驱动的人像动画技术取得了显著进展。然而,仍存在以下关键挑战:(i) 生成高动态视频的同时保持角色一致性;(ii) 实现角色与音频之间精确的情感对齐;(iii) 支持多角色音频驱动动画。为解决这些挑战,我们提出了HunyuanVideo-Avatar,这是一种基于多模态扩散Transformer(MM-DiT)的模型,能够同时生成动态、情感可控的多角色对话视频。具体而言,HunyuanVideo-Avatar引入了三项关键创新:(i) 设计了角色图像注入模块,取代了传统的基于加法的角色条件方案,消除了训练与推理之间固有的条件不匹配问题,确保了动态运动和强大的角色一致性;(ii) 引入了音频情感模块(AEM),用于从情感参考图像中提取情感线索并将其传递到目标生成视频,实现细粒度且准确的情感风格控制;(iii) 提出了人脸感知音频适配器(FAA),通过 latent 级别的人脸掩码隔离音频驱动的角色,支持在多角色场景中通过交叉注意力进行独立的音频注入。这些创新使HunyuanVideo-Avatar在基准数据集和新提出的野生数据集上超越了最先进的方法,能够在动态、沉浸式场景中生成逼真的虚拟形象。源代码和模型权重将公开发布。

HunyuanVideo-Avatar 整体架构

image

我们提出了HunyuanVideo-Avatar,这是一种基于多模态扩散Transformer(MM-DiT)的模型,能够生成动态、情感可控且支持多角色对话的视频。

🎉 HunyuanVideo-Avatar 核心特性

image

高动态与情感可控的视频生成

HunyuanVideo-Avatar支持将任意输入的头像图片通过简单的音频条件,生成为高动态且情感可控的视频。具体而言,它接受多风格、任意尺寸和分辨率的头像图片作为输入。该系统支持多种风格的头像,包括写实风格、卡通风格、3D渲染风格以及拟人化角色。支持从肖像、上半身到全身的多尺度生成。它能生成具有高动态前景和背景的视频,实现卓越的真实感与自然度。此外,系统支持根据输入音频来控制角色的面部情绪。

丰富的应用场景

HunyuanVideo-Avatar支持多种下游任务和应用。例如,系统可生成会说话的虚拟人视频,适用于电商、直播、社交媒体视频制作等场景。此外,其多角色动画功能进一步拓展了应用范围,如视频内容创作、编辑等。

🚀 多GPU并行推理

例如,要使用8块GPU生成视频,您可以使用以下命令:

cd HunyuanVideo-Avatar

JOBS_DIR=$(dirname $(dirname "$0"))
export PYTHONPATH=./
export MODEL_BASE="./weights"
checkpoint_path=${MODEL_BASE}/ckpts/hunyuan-video-t2v-720p/transformers/mp_rank_00_model_states.pt

torchrun --nnodes=1 --nproc_per_node=8 --master_port 29605 hymm_sp/sample_batch.py \
    --input 'assets/test.csv' \
    --ckpt ${checkpoint_path} \
    --sample-n-frames 129 \
    --seed 128 \
    --image-size 704 \
    --cfg-scale 7.5 \
    --infer-steps 50 \
    --use-deepcache 1 \
    --flow-shift-eval-video 5.0 \
    --save-path ${OUTPUT_BASEPATH} 

🔑 单GPU推理

例如,若要使用1块GPU生成视频,可执行以下命令:

cd HunyuanVideo-Avatar

JOBS_DIR=$(dirname $(dirname "$0"))
export PYTHONPATH=./

export MODEL_BASE=./weights
OUTPUT_BASEPATH=./results-single
checkpoint_path=${MODEL_BASE}/ckpts/hunyuan-video-t2v-720p/transformers/mp_rank_00_model_states_fp8.pt

export DISABLE_SP=1 
CUDA_VISIBLE_DEVICES=0 python3 hymm_sp/sample_gpu_poor.py \
    --input 'assets/test.csv' \
    --ckpt ${checkpoint_path} \
    --sample-n-frames 129 \
    --seed 128 \
    --image-size 704 \
    --cfg-scale 7.5 \
    --infer-steps 50 \
    --use-deepcache 1 \
    --flow-shift-eval-video 5.0 \
    --save-path ${OUTPUT_BASEPATH} \
    --use-fp8 \
    --infer-min

在极低显存环境下运行

cd HunyuanVideo-Avatar

JOBS_DIR=$(dirname $(dirname "$0"))
export PYTHONPATH=./

export MODEL_BASE=./weights
OUTPUT_BASEPATH=./results-poor

checkpoint_path=${MODEL_BASE}/ckpts/hunyuan-video-t2v-720p/transformers/mp_rank_00_model_states_fp8.pt

export CPU_OFFLOAD=1
CUDA_VISIBLE_DEVICES=0 python3 hymm_sp/sample_gpu_poor.py \
    --input 'assets/test.csv' \
    --ckpt ${checkpoint_path} \
    --sample-n-frames 129 \
    --seed 128 \
    --image-size 704 \
    --cfg-scale 7.5 \
    --infer-steps 50 \
    --use-deepcache 1 \
    --flow-shift-eval-video 5.0 \
    --save-path ${OUTPUT_BASEPATH} \
    --use-fp8 \
    --cpu-offload \
    --infer-min

启动 Gradio 服务器

cd HunyuanVideo-Avatar

bash ./scripts/run_gradio.sh

🔗 BibTeX

如果您发现 HunyuanVideo-Avatar 对您的研究和应用有所帮助,请使用以下 BibTeX 进行引用:

@misc{hu2025HunyuanVideo-Avatar,
      title={HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters}, 
      author={Yi Chen and Sen Liang and Zixiang Zhou and Ziyao Huang and Yifeng Ma and Junshu Tang and Qin Lin and Yuan Zhou and Qinglin Lu},
      year={2025},
      eprint={2505.20156},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/pdf/2505.20156}, 
}

致谢

感谢 HunyuanVideo、SD3、FLUX、Llama、LLaVA、Xtuner、diffusers 和 HuggingFace 等项目的贡献者们所开展的开放研究与探索工作。