🎬 预告视频
Audio8 TTS 0.1B 支持语音生成和零样本语音克隆。该仓库包含完整的 v4 混合检查点,以及其神经音频 Codec、分词器、处理器和 Hugging Face 远程代码。
此次发布的核心特点是其规模。主生成模型约为 1.7 亿参数,而 Codec 解码器是一个独立的约 1.2 亿参数组件。即使将 Codec 解码器计算在内,完整音频生成技术栈仍然远小于大多数现代多语言 TTS 系统。
| 模型 | 报告的主模型规模 |
|---|---|
| Audio8 TTS Preview 0.1B | ~0.17B |
| Audio8 TTS Preview 0.6B | ~0.6B |
| IndexTTS2.5 | ~0.8B |
| CosyVoice3 | ~1.5B |
| VoxCPM2 | ~2.3B |
| Fish S2 Pro | ~4.6B |
| Higgs Audio v2 | ~4.7B |
| MOSS-TTS | ~8.5B |
这些数值是从相应模型报告中收集的大致参考规模,并非严格对齐的参数规模审计。0.1B 检查点旨在以更小的语言/音频模型占用,使零样本 TTS 变得实用,而非声称在所有语言或基准测试上具有相同质量。
该模型采用 Audio8 Falcon H1 架构,包含慢速与快速自回归分支。慢速分支预测语义 token,快速分支则以慢速隐藏状态为条件预测 codec 码本。
| 组件 | 配置 |
|---|---|
| 主模型 | 约 170M 参数,不含 codec 解码器 |
| 慢速 AR | 24 层,宽度 512,8 个注意力头,2 个 KV 头 |
| 快速 AR | 4 层,宽度 512,8 个注意力头,2 个 KV 头 |
| 声学 token | 10 个码本,每个码本 4,096 个条目 |
| Codec | 44.1 kHz,每个模型帧 2,048 个采样点(约 21.5 帧/秒) |
| Codec 解码器 | 约 120M 参数;打包在 codec.pth 中 |
| 上下文 | 最多 2,048 个打包的文本/音频位置 |
本仓库已包含该 codec。无需额外的 codec 检查点。
Audio8-TTS-Preview-0.1B-ONNX-INT8 使用 ONNX Runtime 将 Audio8 TTS 封装用于低资源 CPU 推理。慢速 AR 和快速 AR 使用逐 token 的 INT8 计算图,神经音频 codec 则使用 FP16。
| 优势 | 详情 |
|---|---|
| 原生 CPU | 可在 ONNX Runtime 的 CPUExecutionProvider 上运行;无需 CUDA |
| 低内存 | 在测试的 Linux x86_64 配置下,加载后约 0.4 GiB |
| 轻量运行时 | 下载模型后无需依赖 PyTorch 或 Transformers |
| 完整工作流 | 支持 CLI、Web 和 HTTP 服务、流式 PCM 以及语音注册 |
常规合成仅加载慢速 AR、快速 AR 和 codec 解码器会话。 语音注册在加载可选的 codec 编码器之前会释放这些会话,从而控制峰值内存。
获取 ONNX INT8 模型 并按照 CPU ONNX Runtime 指南 进行操作。
建议使用 Python 3.11 或更高版本,并配备支持 CUDA 的 GPU。
pip install "torch>=2.5.0" "torchaudio>=2.5.0" \
"transformers>=4.57.0,<5" "soundfile>=0.12" "safetensors>=0.4"该模型包含自定义 Transformers 代码。加载时使用
trust_remote_code=True。
此检查点的主要用途是零样本语音克隆。请将
reference.wav 和参考转录文本替换为您自己的音频和文本。
参考转录文本应与参考音频中的语音内容一致。
import soundfile as sf
import torch
from transformers import AutoModel, AutoProcessor
model_id = "Audio8/Audio8-TTS-Preview-0.1b"
device = "cuda" if torch.cuda.is_available() else "cpu"
dtype = torch.bfloat16 if device == "cuda" else torch.float32
processor = AutoProcessor.from_pretrained(
model_id,
trust_remote_code=True,
)
model = AutoModel.from_pretrained(
model_id,
trust_remote_code=True,
dtype=dtype,
).eval().to(device)
inputs = processor(
text=["这是一个语音合成测试。"],
reference_audio=["reference.wav"],
reference_text=["参考音频对应的完整文本。"],
return_tensors="pt",
)
inputs = {name: value.to(device) for name, value in inputs.items()}
with torch.inference_mode():
output = model.generate(
**inputs,
max_new_tokens=512,
temperature=0.7,
top_p=0.9,
top_k=50,
do_sample=True,
return_dict_in_generate=True,
)
waveforms, waveform_lengths = model.decode_audio(output.codes)
audio = waveforms[0, : int(waveform_lengths[0])].float().cpu().numpy()
sf.write("output.wav", audio, model.config.codec_sample_rate)若不进行声音克隆合成,请省略 reference_audio 和 reference_text。
若需使用音频或预编码参考代码进行批量推理,请参见 Audio8
TTS 训练与推理仓库。
WER/CER 越低越好;SIM(相似度)越高越好。
越低越好。以下对比数值参照针对 Audio8 TTS Preview 0.6B 发布的评估表; 它们属于参考性对比,并非严格对齐后的重新评估。
| 模型 | 参数量 | zh | en | ja | ko | de | es | fr | it |
|---|---|---|---|---|---|---|---|---|---|
| Audio8 TTS Preview 0.1B | ~0.17B | 3.619 | 3.307 | 12.322 | 7.653 | 5.292 | 8.548 | 12.349 | 14.480 |
| Audio8 TTS Preview 0.6B | 0.6B | 3.205 | 3.128 | 7.205 | 4.223 | 3.447 | 3.641 | 8.790 | 4.790 |
| Fish S2 Pro | 4.6B | 3.600 | 3.493 | 5.139 | 4.111 | 3.605 | 2.972 | 8.600 | 4.229 |
| Higgs Audio v2 | 4.7B | 3.378 | 3.404 | 4.742 | 4.260 | 3.300 | 2.929 | 9.425 | 3.555 |
| CosyVoice3-1.5B | 1.5B | 3.91 | 4.99 | 7.57 | 5.69 | 6.43 | 4.47 | 11.8 | 10.5 |
| VoxCPM2 | 2.3B | 3.65 | 5.00 | 5.96 | 5.69 | 4.77 | 3.80 | 9.85 | 4.25 |
| IndexTTS2.5 | 0.8B | 4.36 | 5.12 | 5.66 | - | - | 3.75 | - | - |
此对比表中,相似度以百分比显示。 WER/CER 越低越好;相似度越高越好。
| 模型 | 参数量 | EN WER / SIM | ZH CER / SIM |
|---|---|---|---|
| Audio8 TTS Preview 0.1B | ~0.17B | 1.662 / 56.7 | 1.13 / 68.2 |
| Audio8 TTS Preview 0.6B | 0.6B | 1.506 / 63.2 | 0.950 / 73.1 |
| Fish S2 Pro | 4.6B | 1.607 / 64.6 | 1.038 / 73.8 |
| Higgs Audio v2 | 4.7B | 1.524 / 66.4 | 0.806 / 72.1 |
| CosyVoice3-1.5B | 1.5B | 2.22 / 72.0 | 1.12 / 78.1 |
| MOSS-TTS | 8.5B | 1.85 / 73.4 | 1.20 / 78.8 |
| VoxCPM2 | 2.3B | 1.84 / 75.3 | 0.97 / 79.5 |
| IndexTTS2.5 | 0.8B | 3.253 / 82.3 | 1.119 / 80.4 |
IndexTTS2.5 行采用 IndexTTS 2.5 技术报告中 Table 1 的 Seed-TTS-Eval 部分 Token-Level Concatenation 结果。
参数规模为各模型报告中的近似参考值(见 Compact Scale 部分);它们并非 严格对齐后的参数量核算。供参考,MOSS-TTS 包含 8,489,841,664 个参数, VoxCPM2 主模型包含 2,290,004,544 个参数;独立的 AudioVAE 未纳入参数对比。
Fish S2 Pro 已重新评估,因为其官方评估使用了自身归一化器。Higgs Audio v2 进行了本地评估,因为缺少具体数值。其余基线数值均通过 VoxCPM 仓库 从各自官方报告中收集。
不同归一化器和评估器使得跨项目数值只能作为参考对比,而非严格对齐后的排名。评估覆盖范围不会将 Preview 检查点的支持语言声明扩展到上述所列语言之外。
本模型依据 Audio8 Community License v1.0 发布,这是一项设有收入上限的自定义许可证。
英文文本为权威版本;LICENSE 文件中提供了中文翻译,仅供参考。如需商业许可,请通过 Audio8 GitHub 仓库 或本 Hugging Face 仓库的 Issue 联系 Audio8 团队。