![]()
HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters
近年来,音频驱动的人像动画技术取得了显著进展。然而,仍存在以下关键挑战:(i) 生成高动态视频的同时保持角色一致性;(ii) 实现角色与音频之间精确的情感对齐;(iii) 支持多角色音频驱动动画。为解决这些挑战,我们提出了HunyuanVideo-Avatar,这是一种基于多模态扩散Transformer(MM-DiT)的模型,能够同时生成动态、情感可控的多角色对话视频。具体而言,HunyuanVideo-Avatar引入了三项关键创新:(i) 设计了角色图像注入模块,取代了传统的基于加法的角色条件方案,消除了训练与推理之间固有的条件不匹配问题,确保了动态运动和强大的角色一致性;(ii) 引入了音频情感模块(AEM),用于从情感参考图像中提取情感线索并将其传递到目标生成视频,实现细粒度且准确的情感风格控制;(iii) 提出了人脸感知音频适配器(FAA),通过 latent 级别的人脸掩码隔离音频驱动的角色,支持在多角色场景中通过交叉注意力进行独立的音频注入。这些创新使HunyuanVideo-Avatar在基准数据集和新提出的野生数据集上超越了最先进的方法,能够在动态、沉浸式场景中生成逼真的虚拟形象。源代码和模型权重将公开发布。
![]()
我们提出了HunyuanVideo-Avatar,这是一种基于多模态扩散Transformer(MM-DiT)的模型,能够生成动态、情感可控且支持多角色对话的视频。
![]()
HunyuanVideo-Avatar支持将任意输入的头像图片通过简单的音频条件,生成为高动态且情感可控的视频。具体而言,它接受多风格、任意尺寸和分辨率的头像图片作为输入。该系统支持多种风格的头像,包括写实风格、卡通风格、3D渲染风格以及拟人化角色。支持从肖像、上半身到全身的多尺度生成。它能生成具有高动态前景和背景的视频,实现卓越的真实感与自然度。此外,系统支持根据输入音频来控制角色的面部情绪。
HunyuanVideo-Avatar支持多种下游任务和应用。例如,系统可生成会说话的虚拟人视频,适用于电商、直播、社交媒体视频制作等场景。此外,其多角色动画功能进一步拓展了应用范围,如视频内容创作、编辑等。
例如,要使用8块GPU生成视频,您可以使用以下命令:
cd HunyuanVideo-Avatar
JOBS_DIR=$(dirname $(dirname "$0"))
export PYTHONPATH=./
export MODEL_BASE="./weights"
checkpoint_path=${MODEL_BASE}/ckpts/hunyuan-video-t2v-720p/transformers/mp_rank_00_model_states.pt
torchrun --nnodes=1 --nproc_per_node=8 --master_port 29605 hymm_sp/sample_batch.py \
--input 'assets/test.csv' \
--ckpt ${checkpoint_path} \
--sample-n-frames 129 \
--seed 128 \
--image-size 704 \
--cfg-scale 7.5 \
--infer-steps 50 \
--use-deepcache 1 \
--flow-shift-eval-video 5.0 \
--save-path ${OUTPUT_BASEPATH} 例如,若要使用1块GPU生成视频,可执行以下命令:
cd HunyuanVideo-Avatar
JOBS_DIR=$(dirname $(dirname "$0"))
export PYTHONPATH=./
export MODEL_BASE=./weights
OUTPUT_BASEPATH=./results-single
checkpoint_path=${MODEL_BASE}/ckpts/hunyuan-video-t2v-720p/transformers/mp_rank_00_model_states_fp8.pt
export DISABLE_SP=1
CUDA_VISIBLE_DEVICES=0 python3 hymm_sp/sample_gpu_poor.py \
--input 'assets/test.csv' \
--ckpt ${checkpoint_path} \
--sample-n-frames 129 \
--seed 128 \
--image-size 704 \
--cfg-scale 7.5 \
--infer-steps 50 \
--use-deepcache 1 \
--flow-shift-eval-video 5.0 \
--save-path ${OUTPUT_BASEPATH} \
--use-fp8 \
--infer-mincd HunyuanVideo-Avatar
JOBS_DIR=$(dirname $(dirname "$0"))
export PYTHONPATH=./
export MODEL_BASE=./weights
OUTPUT_BASEPATH=./results-poor
checkpoint_path=${MODEL_BASE}/ckpts/hunyuan-video-t2v-720p/transformers/mp_rank_00_model_states_fp8.pt
export CPU_OFFLOAD=1
CUDA_VISIBLE_DEVICES=0 python3 hymm_sp/sample_gpu_poor.py \
--input 'assets/test.csv' \
--ckpt ${checkpoint_path} \
--sample-n-frames 129 \
--seed 128 \
--image-size 704 \
--cfg-scale 7.5 \
--infer-steps 50 \
--use-deepcache 1 \
--flow-shift-eval-video 5.0 \
--save-path ${OUTPUT_BASEPATH} \
--use-fp8 \
--cpu-offload \
--infer-mincd HunyuanVideo-Avatar
bash ./scripts/run_gradio.sh
如果您发现 HunyuanVideo-Avatar 对您的研究和应用有所帮助,请使用以下 BibTeX 进行引用:
@misc{hu2025HunyuanVideo-Avatar,
title={HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters},
author={Yi Chen and Sen Liang and Zixiang Zhou and Ziyao Huang and Yifeng Ma and Junshu Tang and Qin Lin and Yuan Zhou and Qinglin Lu},
year={2025},
eprint={2505.20156},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/pdf/2505.20156},
}感谢 HunyuanVideo、SD3、FLUX、Llama、LLaVA、Xtuner、diffusers 和 HuggingFace 等项目的贡献者们所开展的开放研究与探索工作。