Chatterbox 多语言 V3 是 Chatterbox 系列中最新的通用型多语言 TTS 模型。它保持了 0.5B 的模型规模,同时提升了说话人相似度,减少了幻觉现象,并能在多种语言中生成更自然、更具对话感的语音。
V3 延续了 V2 广泛的语言覆盖能力,但在稳定性和表达性生成方面更胜一筹。对于希望使用单一语音克隆模型就能支持多种语言的用户,V3 是推荐的多语言模型。可在 Chatterbox 多语言 TTS V3 空间 中体验。
除 V3 外,我们还发布了 单语言包:针对重点语言的专用微调版本,在需要更严格质量控制、更优特定语言表现以及更专业语音生成的场景中价值显著。
为您的应用选择合适的 Chatterbox 模型。
| 模型 | 规模 | 语言 | 核心特性 | 适用场景 | 演示 |
|---|---|---|---|---|---|
| Chatterbox Multilingual V3 | 5亿 | 23+ | 提升说话人相似度,减少幻觉现象,更自然的多语言语音 | 全球化应用、本地化、跨语言语音克隆 | 演示 |
| 单语言包 | 每个5亿 | 6种专属微调语言 | 针对特定语言和地区的质量控制 | 优先语言及对 dialect 敏感的应用 | 演示 |
| Chatterbox | 5亿 | 英语 | CFG 与情感夸张调节 | 具有创意控制的通用零样本 TTS | 演示 |
09/04 🔥 推出支持23种语言的 Chatterbox Multilingual!
我们激动地推出 Chatterbox 和 Chatterbox Multilingual,它们是 Resemble AI 的生产级开源 TTS 模型。Chatterbox Multilingual 开箱即支持 阿拉伯语、丹麦语、德语、希腊语、英语、西班牙语、芬兰语、法语、希伯来语、印地语、意大利语、日语、韩语、马来语、荷兰语、挪威语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、土耳其语、中文。Chatterbox 采用 MIT 许可证,已与 ElevenLabs 等领先闭源系统进行基准测试,并在对比评估中持续获得青睐。
无论您是制作表情包、视频、游戏还是 AI 智能体,Chatterbox 都能让您的内容焕发生机。它也是首个支持 情感夸张控制 的开源 TTS 模型,这一强大功能能让您的语音脱颖而出。立即在我们的 Hugging Face Gradio 应用 中试用。
如果您喜欢该模型,但需要扩展规模或进行微调以获得更高精度,请查看我们价格极具竞争力的 TTS 服务(链接)。它能提供可靠的性能和低于 200 毫秒的超低延迟,非常适合智能体、应用程序或交互式媒体的生产环境使用。
通用场景(TTS 和语音助手):
exaggeration=0.5,cfg=0.5)适用于大多数提示文本。cfg 降低至 0.3 左右可改善节奏。富有表现力或戏剧性的语音:
cfg 值(例如 ~0.3)并将 exaggeration 提高到 0.7 左右或更高。exaggeration 往往会加快语速;降低 cfg 有助于以更慢、更从容的节奏进行补偿。注意: 确保参考音频片段与指定的语言标签相匹配。否则,语言迁移输出可能会继承参考片段语言的口音。
为缓解此问题,请将 CFG 权重设为 0。
pip install chatterbox-ttsimport torchaudio as ta
from chatterbox.tts import ChatterboxTTS
model = ChatterboxTTS.from_pretrained(device="cuda")
text = "Ezreal and Jinx teamed up with Ahri, Yasuo, and Teemo to take down the enemy's Nexus in an epic late-game pentakill."
wav = model.generate(text)
ta.save("test-1.wav", wav, model.sr)
# If you want to synthesize with a different voice, specify the audio prompt
AUDIO_PROMPT_PATH="YOUR_FILE.wav"
wav = model.generate(text, audio_prompt_path=AUDIO_PROMPT_PATH)
ta.save("test-2.wav", wav, model.sr)import torchaudio as ta
from chatterbox.mtl_tts import ChatterboxMultilingualTTS
multilingual_model = ChatterboxMultilingualTTS.from_pretrained(
device="cuda",
t3_model="v3",
)
# To use the legacy V2 multilingual checkpoint, omit t3_model or pass t3_model="v2".
french_text = "Bonjour, comment ça va? Ceci est le modèle de synthèse vocale multilingue Chatterbox, il prend en charge 23 langues."
wav_french = multilingual_model.generate(french_text, language_id="fr")
ta.save("test-french.wav", wav_french, multilingual_model.sr)
chinese_text = "你好,今天天气真不错,希望你有一个愉快的周末。"
wav_chinese = multilingual_model.generate(chinese_text, language_id="zh")
ta.save("test-chinese.wav", wav_chinese, multilingual_model.sr)更多示例请参见 example_tts.py。
单语言包为重点语言及地区变体提供专门的微调版本。当您需要更强的特定语言表现、更严格的质量控制,或超越通用多语言模型的方言感知生成能力时,请使用这些包。
Chatterbox 生成的每个音频文件均包含 Resemble AI 的 Perth(感知阈值)水印器——这种不可感知的神经水印能够经受 MP3 压缩、音频编辑和常见操作的考验,同时保持近 100% 的检测准确率。
请勿使用本模型从事不良行为。提示词来源于互联网上可免费获取的数据。