ⓍTTS 是一款语音生成模型,仅需 6 秒的音频片段,就能将声音克隆成不同语言。无需长达数小时的海量训练数据。
该模型与为 Coqui Studio 和 Coqui API 提供支持的模型相同或类似。
XTTS-v2 支持 17 种语言:英语(en)、西班牙语(es)、法语(fr)、德语(de)、意大利语(it)、葡萄牙语(pt)、波兰语(pl)、土耳其语(tr)、俄语(ru)、荷兰语(nl)、捷克语(cs)、阿拉伯语(ar)、中文(zh-cn)、日语(ja)、匈牙利语(hu)、韩语(ko)、印地语(hi)。
我们将持续添加更多语言支持,敬请期待。如果您有任何语言需求,欢迎随时与我们联系!
| 🐸💬 CoquiTTS | coqui/TTS on Github |
| 💼 Documentation | ReadTheDocs |
| 👩💻 Questions | GitHub Discussions |
| 🗯 Community | Discord |
本模型根据 Coqui 公共模型许可协议 进行许可。生成式模型的许可协议涉及诸多方面,您可以通过 此处 了解更多关于 CPML 的起源故事。
欢迎加入我们的 🐸社区。我们在 Discord 和 Twitter 上都很活跃。 您也可以通过 info@coqui.ai 给我们发送邮件。
使用 🐸TTS API:
from TTS.api import TTS
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2", gpu=True)
# generate speech by cloning a voice using default settings
tts.tts_to_file(text="It took me quite a long time to develop a voice, and now that I have it I'm not going to be silent.",
file_path="output.wav",
speaker_wav="/path/to/target/speaker.wav",
language="en")
使用🐸TTS命令行:
tts --model_name tts_models/multilingual/multi-dataset/xtts_v2 \
--text "Bugün okula gitmek istemiyorum." \
--speaker_wav /path/to/target/speaker.wav \
--language_idx tr \
--use_cuda true直接使用模型:
from TTS.tts.configs.xtts_config import XttsConfig
from TTS.tts.models.xtts import Xtts
config = XttsConfig()
config.load_json("/path/to/xtts/config.json")
model = Xtts.init_from_config(config)
model.load_checkpoint(config, checkpoint_dir="/path/to/xtts/", eval=True)
model.cuda()
outputs = model.synthesize(
"It took me quite a long time to develop a voice and now that I have it I am not going to be silent.",
config,
speaker_wav="/data/TTS-public/_refclips/3.wav",
gpt_cond_len=3,
language="en",
)