HuggingFace镜像/chatterbox
模型介绍
文件和版本
分析
cb-big2

Chatterbox TTS

Listen to Demo Samples Open in HF Spaces Insight on Podos
Made with ❤️ by resemble-logo-horizontal

最新版本:Chatterbox 多语言 V3

Chatterbox 多语言 V3 是 Chatterbox 系列中最新的通用型多语言 TTS 模型。它保持了 0.5B 的模型规模,同时提升了说话人相似度,减少了幻觉现象,并能在多种语言中生成更自然、更具对话感的语音。

V3 延续了 V2 广泛的语言覆盖能力,但在稳定性和表达性生成方面更胜一筹。对于希望使用单一语音克隆模型就能支持多种语言的用户,V3 是推荐的多语言模型。可在 Chatterbox 多语言 TTS V3 空间 中体验。

除 V3 外,我们还发布了 单语言包:针对重点语言的专用微调版本,在需要更严格质量控制、更优特定语言表现以及更专业语音生成的场景中价值显著。

  • 广泛的多语言覆盖:作为 Chatterbox 的主要通用多语言模型,支持与 V2 相当的广泛语言范围。
  • 单语言包:专用单语言模型在语言及区域方言特定性能至关重要的场景下,提供更强的专业性和质量控制。
  • 更一致的说话人相似度:提升了跨语言的语音身份和口音保留能力,使跨语言语音克隆更加稳定可靠。
  • 减少幻觉现象:V3 经过优化,减少了不必要的内容延续、重复以及偏离提示文本的语音,尤其是在早期多语言模型稳定性欠佳的情况下。

模型库

为您的应用选择合适的 Chatterbox 模型。

模型规模语言核心特性适用场景演示
Chatterbox Multilingual V35亿23+提升说话人相似度,减少幻觉现象,更自然的多语言语音全球化应用、本地化、跨语言语音克隆演示
单语言包每个5亿6种专属微调语言针对特定语言和地区的质量控制优先语言及对 dialect 敏感的应用演示
Chatterbox5亿英语CFG 与情感夸张调节具有创意控制的通用零样本 TTS演示

09/04 🔥 推出支持23种语言的 Chatterbox Multilingual!

我们激动地推出 Chatterbox 和 Chatterbox Multilingual,它们是 Resemble AI 的生产级开源 TTS 模型。Chatterbox Multilingual 开箱即支持 阿拉伯语、丹麦语、德语、希腊语、英语、西班牙语、芬兰语、法语、希伯来语、印地语、意大利语、日语、韩语、马来语、荷兰语、挪威语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、土耳其语、中文。Chatterbox 采用 MIT 许可证,已与 ElevenLabs 等领先闭源系统进行基准测试,并在对比评估中持续获得青睐。

无论您是制作表情包、视频、游戏还是 AI 智能体,Chatterbox 都能让您的内容焕发生机。它也是首个支持 情感夸张控制 的开源 TTS 模型,这一强大功能能让您的语音脱颖而出。立即在我们的 Hugging Face Gradio 应用 中试用。

如果您喜欢该模型,但需要扩展规模或进行微调以获得更高精度,请查看我们价格极具竞争力的 TTS 服务(链接)。它能提供可靠的性能和低于 200 毫秒的超低延迟,非常适合智能体、应用程序或交互式媒体的生产环境使用。

核心详情

  • Chatterbox Multilingual V3,一款 0.5B 通用型多语言 TTS 模型,支持 23 种语言
  • 针对中文、拉丁美洲西班牙语、巴西葡萄牙语、西班牙西班牙语、葡萄牙葡萄牙语和印地语的专用单语言微调版本
  • 最先进的零样本英语 TTS
  • 0.5B Llama 基础模型
  • 独特的夸张度/强度控制
  • 采用对齐感知推理,稳定性极佳
  • 在 50 万小时清洗数据上训练
  • 输出内容带水印
  • 简易的声音转换脚本
  • 性能优于 ElevenLabs

使用技巧

  • 通用场景(TTS 和语音助手):

    • 默认设置(exaggeration=0.5,cfg=0.5)适用于大多数提示文本。
    • 如果参考说话人语速较快,将 cfg 降低至 0.3 左右可改善节奏。
  • 富有表现力或戏剧性的语音:

    • 尝试降低 cfg 值(例如 ~0.3)并将 exaggeration 提高到 0.7 左右或更高。
    • 较高的 exaggeration 往往会加快语速;降低 cfg 有助于以更慢、更从容的节奏进行补偿。

注意: 确保参考音频片段与指定的语言标签相匹配。否则,语言迁移输出可能会继承参考片段语言的口音。
为缓解此问题,请将 CFG 权重设为 0。

安装

pip install chatterbox-tts

使用说明

import torchaudio as ta
from chatterbox.tts import ChatterboxTTS

model = ChatterboxTTS.from_pretrained(device="cuda")

text = "Ezreal and Jinx teamed up with Ahri, Yasuo, and Teemo to take down the enemy's Nexus in an epic late-game pentakill."
wav = model.generate(text)
ta.save("test-1.wav", wav, model.sr)

# If you want to synthesize with a different voice, specify the audio prompt
AUDIO_PROMPT_PATH="YOUR_FILE.wav"
wav = model.generate(text, audio_prompt_path=AUDIO_PROMPT_PATH)
ta.save("test-2.wav", wav, model.sr)

多语言快速入门

import torchaudio as ta
from chatterbox.mtl_tts import ChatterboxMultilingualTTS

multilingual_model = ChatterboxMultilingualTTS.from_pretrained(
    device="cuda",
    t3_model="v3",
)
# To use the legacy V2 multilingual checkpoint, omit t3_model or pass t3_model="v2".

french_text = "Bonjour, comment ça va? Ceci est le modèle de synthèse vocale multilingue Chatterbox, il prend en charge 23 langues."
wav_french = multilingual_model.generate(french_text, language_id="fr")
ta.save("test-french.wav", wav_french, multilingual_model.sr)

chinese_text = "你好,今天天气真不错,希望你有一个愉快的周末。"
wav_chinese = multilingual_model.generate(chinese_text, language_id="zh")
ta.save("test-chinese.wav", wav_chinese, multilingual_model.sr)

更多示例请参见 example_tts.py。

单语言包

单语言包为重点语言及地区变体提供专门的微调版本。当您需要更强的特定语言表现、更严格的质量控制,或超越通用多语言模型的方言感知生成能力时,请使用这些包。

语言模型卡片演示空间
中文ResembleAI/Chatterbox-Multilingual-zh-cmnDemo
拉丁美洲西班牙语ResembleAI/Chatterbox-Multilingual-es-mx-latamDemo
巴西葡萄牙语ResembleAI/Chatterbox-Multilingual-pt-brDemo
西班牙西班牙语ResembleAI/Chatterbox-Multilingual-es-esDemo
葡萄牙葡萄牙语ResembleAI/Chatterbox-Multilingual-pt-ptDemo
印地语ResembleAI/Chatterbox-Multilingual-hiDemo

致谢

  • Cosyvoice
  • HiFT-GAN
  • Llama 3

内置 PerTh 水印技术,助力负责任 AI

Chatterbox 生成的每个音频文件均包含 Resemble AI 的 Perth(感知阈值)水印器——这种不可感知的神经水印能够经受 MP3 压缩、音频编辑和常见操作的考验,同时保持近 100% 的检测准确率。

免责声明

请勿使用本模型从事不良行为。提示词来源于互联网上可免费获取的数据。