HuggingFace镜像/XTTS-v2
模型介绍
文件和版本
分析

ⓍTTS

ⓍTTS 是一款语音生成模型,仅需 6 秒的音频片段,就能将声音克隆成不同语言。无需长达数小时的海量训练数据。

该模型与为 Coqui Studio 和 Coqui API 提供支持的模型相同或类似。

特性

  • 支持 17 种语言。
  • 仅需 6 秒音频片段即可实现声音克隆。
  • 通过克隆实现情感与风格迁移。
  • 跨语言声音克隆。
  • 多语言语音生成。
  • 24khz 采样率。

相较于 XTTS-v1 的更新

  • 新增 2 种语言:匈牙利语和韩语
  • 扬声器条件控制的架构改进。
  • 支持使用多个扬声器参考并在扬声器之间进行插值。
  • 稳定性提升。
  • 全面改善韵律和音频质量。

语言

XTTS-v2 支持 17 种语言:英语(en)、西班牙语(es)、法语(fr)、德语(de)、意大利语(it)、葡萄牙语(pt)、波兰语(pl)、土耳其语(tr)、俄语(ru)、荷兰语(nl)、捷克语(cs)、阿拉伯语(ar)、中文(zh-cn)、日语(ja)、匈牙利语(hu)、韩语(ko)、印地语(hi)。

我们将持续添加更多语言支持,敬请期待。如果您有任何语言需求,欢迎随时与我们联系!

代码

代码库 支持推理和微调。

演示空间

  • XTTS Space:您可以查看模型在支持语言上的表现,并尝试使用自己的参考音频或麦克风输入
  • XTTS 与 Mistral 或 Zephyr 的语音聊天:您可以体验与 Mistral 7B Instruct 或 Zephyr 7B Beta 的流式语音聊天
🐸💬 CoquiTTScoqui/TTS on Github
💼 DocumentationReadTheDocs
👩‍💻 QuestionsGitHub Discussions
🗯 CommunityDiscord

许可协议

本模型根据 Coqui 公共模型许可协议 进行许可。生成式模型的许可协议涉及诸多方面,您可以通过 此处 了解更多关于 CPML 的起源故事。

联系方式

欢迎加入我们的 🐸社区。我们在 Discord 和 Twitter 上都很活跃。 您也可以通过 info@coqui.ai 给我们发送邮件。

使用 🐸TTS API:

from TTS.api import TTS
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2", gpu=True)

# generate speech by cloning a voice using default settings
tts.tts_to_file(text="It took me quite a long time to develop a voice, and now that I have it I'm not going to be silent.",
                file_path="output.wav",
                speaker_wav="/path/to/target/speaker.wav",
                language="en")

使用🐸TTS命令行:

 tts --model_name tts_models/multilingual/multi-dataset/xtts_v2 \
     --text "Bugün okula gitmek istemiyorum." \
     --speaker_wav /path/to/target/speaker.wav \
     --language_idx tr \
     --use_cuda true

直接使用模型:

from TTS.tts.configs.xtts_config import XttsConfig
from TTS.tts.models.xtts import Xtts

config = XttsConfig()
config.load_json("/path/to/xtts/config.json")
model = Xtts.init_from_config(config)
model.load_checkpoint(config, checkpoint_dir="/path/to/xtts/", eval=True)
model.cuda()

outputs = model.synthesize(
    "It took me quite a long time to develop a voice and now that I have it I am not going to be silent.",
    config,
    speaker_wav="/data/TTS-public/_refclips/3.wav",
    gpt_cond_len=3,
    language="en",
)