OpenBMB 开源社区/VoxCPM2
模型介绍
文件和版本
Pull Requests
讨论
分析

VoxCPM2

VoxCPM2 是一款免分词器的扩散自回归语音合成模型——20亿参数、支持30种语言、48kHz 音频输出,基于超过200万小时的多语种语音数据训练而成。

GitHub Docs Demo Audio Samples Discord Lark MiniCPM Wiki

核心亮点

  • 🌍 30种语言多语种支持 — 无需指定语言标签,直接输入任意支持语言的文本即可
  • 🎨 声音设计 — 仅凭自然语言描述(性别、年龄、音色、情感、语速等)即可生成全新声音,无需参考音频
  • 🎛️ 可控克隆 — 从短音频片段克隆任意音色,并可通过风格引导调控情感、语速与表现力,同时保持音色不变
  • 🎙️ 极致克隆 — 提供参考音频及其转写文本,实现音频延续式克隆,忠实还原每一个发音细节
  • 🔊 48kHz 录音室级输出 — 接受16kHz参考音频,通过 AudioVAE V2 内置超分辨率技术直接输出48kHz,无需外部升采样器
  • 🧠 上下文感知合成 — 自动从文本内容中推断恰当的韵律与表现力
  • ⚡ 实时流式生成 — 在 NVIDIA RTX 4090 上 RTF 低至约0.3,经 Nano-VLLM 加速后可达约0.13
  • 📜 完全开源,商用无忧 — Apache-2.0 许可证,可免费商用
支持语言(30种)

阿拉伯语、缅甸语、中文、丹麦语、荷兰语、英语、芬兰语、法语、德语、希腊语、希伯来语、印地语、印尼语、意大利语、日语、高棉语、韩语、老挝语、马来语、挪威语、波兰语、葡萄牙语、俄语、西班牙语、斯瓦希里语、瑞典语、他加禄语、泰语、土耳其语、越南语

中文方言:四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话

快速开始

安装

pip install voxcpm

环境要求: Python ≥ 3.10,PyTorch ≥ 2.5.0,CUDA ≥ 12.0 · 完整快速入门 →

文本转语音

from voxcpm import VoxCPM
import soundfile as sf

model = VoxCPM.from_pretrained("openbmb/VoxCPM2", load_denoiser=False)

wav = model.generate(
    text="VoxCPM2 brings multilingual support, creative voice design, and controllable voice cloning.",
    cfg_value=2.0,
    inference_timesteps=10,
)
sf.write("output.wav", wav, model.tts_model.sample_rate)

声音设计

在 text 的开头用括号注明声音描述,后接需合成的文本内容:

wav = model.generate(
    text="(A young woman, gentle and sweet voice)Hello, welcome to VoxCPM2!",
    cfg_value=2.0,
    inference_timesteps=10,
)
sf.write("voice_design.wav", wav, model.tts_model.sample_rate)

可控语音克隆

# Basic cloning
wav = model.generate(
    text="This is a cloned voice generated by VoxCPM2.",
    reference_wav_path="speaker.wav",
)
sf.write("clone.wav", wav, model.tts_model.sample_rate)

# Cloning with style control
wav = model.generate(
    text="(slightly faster, cheerful tone)This is a cloned voice with style control.",
    reference_wav_path="speaker.wav",
    cfg_value=2.0,
    inference_timesteps=10,
)
sf.write("controllable_clone.wav", wav, model.tts_model.sample_rate)

极致克隆

同时提供参考音频及其精确转写文本,以获得最高保真度。将同一片段同时传入 reference_wav_path 和 prompt_wav_path,即可实现最高相似度:

wav = model.generate(
    text="This is an ultimate cloning demonstration using VoxCPM2.",
    prompt_wav_path="speaker_reference.wav",
    prompt_text="The transcript of the reference audio.",
    reference_wav_path="speaker_reference.wav",
)
sf.write("hifi_clone.wav", wav, model.tts_model.sample_rate)

流式传输

import numpy as np

chunks = []
for chunk in model.generate_streaming(text="Streaming is easy with VoxCPM!"):
    chunks.append(chunk)
wav = np.concatenate(chunks)
sf.write("streaming.wav", wav, model.tts_model.sample_rate)

模型详情

属性数值
架构无分词器扩散自回归模型(LocEnc → TSLM → RALM → LocDiT)
主干网络基于 MiniCPM-4,总计 2B 参数
音频 VAEAudioVAE V2(非对称编解码,16kHz 输入 → 48kHz 输出)
训练数据200 万小时以上的多语种语音
LM 令牌速率6.25 Hz
最大序列长度8192 个令牌
数据类型bfloat16
显存占用约 8 GB
RTF(RTX 4090)约 0.30(标准)/ 约 0.13(Nano-vLLM)

性能表现

VoxCPM2 在主流零样本和可控 TTS 基准测试中达到了领先或具有竞争力的水平。

完整的基准测试表格请参阅 GitHub 仓库(Seed-TTS-eval、CV3-eval、InstructTTSEval、MiniMax 多语种测试)。

微调

VoxCPM2 支持完整 SFT 和 LoRA 微调,仅需 5–10 分钟的音频数据即可完成:

# LoRA fine-tuning (recommended)
python scripts/train_voxcpm_finetune.py \
    --config_path conf/voxcpm_v2/voxcpm_finetune_lora.yaml

# Full fine-tuning
python scripts/train_voxcpm_finetune.py \
    --config_path conf/voxcpm_v2/voxcpm_finetune_all.yaml

请参阅微调指南获取完整说明。

局限性

  • 音色设计与风格控制的效果可能因运行次数而异;建议生成1至3次以获得理想输出。
  • 不同语言的表现取决于训练数据的可用性,效果会有所差异。
  • 极长或高度表现力的输入偶尔可能引发不稳定的情况。
  • 严禁将本工具用于冒充他人、欺诈或虚假信息传播。AI生成的内容应明确标注。

引用

@article{voxcpm2_2026,
  title   = {VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning},
  author  = {VoxCPM Team},
  journal = {GitHub},
  year    = {2026},
}

@article{voxcpm2025,
  title   = {VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning},
  author  = {Zhou, Yixuan and Zeng, Guoyang and Liu, Xin and Li, Xiang and
             Yu, Renjie and Wang, Ziyang and Ye, Runchuan and Sun, Weiyue and
             Gui, Jiancheng and Li, Kehan and Wu, Zhiyong and Liu, Zhiyuan},
  journal = {arXiv preprint arXiv:2509.24650},
  year    = {2025},
}

许可证

基于 Apache-2.0 许可证发布,可免费用于商业用途。在生产环境部署时,建议根据您的具体使用场景进行充分的测试与安全性评估。