VoxCPM2 是一款免分词器的扩散自回归语音合成模型——20亿参数、支持30种语言、48kHz 音频输出,基于超过200万小时的多语种语音数据训练而成。
阿拉伯语、缅甸语、中文、丹麦语、荷兰语、英语、芬兰语、法语、德语、希腊语、希伯来语、印地语、印尼语、意大利语、日语、高棉语、韩语、老挝语、马来语、挪威语、波兰语、葡萄牙语、俄语、西班牙语、斯瓦希里语、瑞典语、他加禄语、泰语、土耳其语、越南语
中文方言:四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话
pip install voxcpm环境要求: Python ≥ 3.10,PyTorch ≥ 2.5.0,CUDA ≥ 12.0 · 完整快速入门 →
from voxcpm import VoxCPM
import soundfile as sf
model = VoxCPM.from_pretrained("openbmb/VoxCPM2", load_denoiser=False)
wav = model.generate(
text="VoxCPM2 brings multilingual support, creative voice design, and controllable voice cloning.",
cfg_value=2.0,
inference_timesteps=10,
)
sf.write("output.wav", wav, model.tts_model.sample_rate)在 text 的开头用括号注明声音描述,后接需合成的文本内容:
wav = model.generate(
text="(A young woman, gentle and sweet voice)Hello, welcome to VoxCPM2!",
cfg_value=2.0,
inference_timesteps=10,
)
sf.write("voice_design.wav", wav, model.tts_model.sample_rate)# Basic cloning
wav = model.generate(
text="This is a cloned voice generated by VoxCPM2.",
reference_wav_path="speaker.wav",
)
sf.write("clone.wav", wav, model.tts_model.sample_rate)
# Cloning with style control
wav = model.generate(
text="(slightly faster, cheerful tone)This is a cloned voice with style control.",
reference_wav_path="speaker.wav",
cfg_value=2.0,
inference_timesteps=10,
)
sf.write("controllable_clone.wav", wav, model.tts_model.sample_rate)同时提供参考音频及其精确转写文本,以获得最高保真度。将同一片段同时传入 reference_wav_path 和 prompt_wav_path,即可实现最高相似度:
wav = model.generate(
text="This is an ultimate cloning demonstration using VoxCPM2.",
prompt_wav_path="speaker_reference.wav",
prompt_text="The transcript of the reference audio.",
reference_wav_path="speaker_reference.wav",
)
sf.write("hifi_clone.wav", wav, model.tts_model.sample_rate)import numpy as np
chunks = []
for chunk in model.generate_streaming(text="Streaming is easy with VoxCPM!"):
chunks.append(chunk)
wav = np.concatenate(chunks)
sf.write("streaming.wav", wav, model.tts_model.sample_rate)| 属性 | 数值 |
|---|---|
| 架构 | 无分词器扩散自回归模型(LocEnc → TSLM → RALM → LocDiT) |
| 主干网络 | 基于 MiniCPM-4,总计 2B 参数 |
| 音频 VAE | AudioVAE V2(非对称编解码,16kHz 输入 → 48kHz 输出) |
| 训练数据 | 200 万小时以上的多语种语音 |
| LM 令牌速率 | 6.25 Hz |
| 最大序列长度 | 8192 个令牌 |
| 数据类型 | bfloat16 |
| 显存占用 | 约 8 GB |
| RTF(RTX 4090) | 约 0.30(标准)/ 约 0.13(Nano-vLLM) |
VoxCPM2 在主流零样本和可控 TTS 基准测试中达到了领先或具有竞争力的水平。
完整的基准测试表格请参阅 GitHub 仓库(Seed-TTS-eval、CV3-eval、InstructTTSEval、MiniMax 多语种测试)。
VoxCPM2 支持完整 SFT 和 LoRA 微调,仅需 5–10 分钟的音频数据即可完成:
# LoRA fine-tuning (recommended)
python scripts/train_voxcpm_finetune.py \
--config_path conf/voxcpm_v2/voxcpm_finetune_lora.yaml
# Full fine-tuning
python scripts/train_voxcpm_finetune.py \
--config_path conf/voxcpm_v2/voxcpm_finetune_all.yaml请参阅微调指南获取完整说明。
@article{voxcpm2_2026,
title = {VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning},
author = {VoxCPM Team},
journal = {GitHub},
year = {2026},
}
@article{voxcpm2025,
title = {VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning},
author = {Zhou, Yixuan and Zeng, Guoyang and Liu, Xin and Li, Xiang and
Yu, Renjie and Wang, Ziyang and Ye, Runchuan and Sun, Weiyue and
Gui, Jiancheng and Li, Kehan and Wu, Zhiyong and Liu, Zhiyuan},
journal = {arXiv preprint arXiv:2509.24650},
year = {2025},
}基于 Apache-2.0 许可证发布,可免费用于商业用途。在生产环境部署时,建议根据您的具体使用场景进行充分的测试与安全性评估。