HuggingFace镜像/Audio8-TTS-Preview-0.1b
模型介绍
文件和版本
分析
Audio8

Audio8 TTS Preview 0.1B

最小且值得运行的零样本 TTS。

GitHub Demo-0.1B 音频示例

🎬 预告视频

Audio8 TTS 0.1B 支持语音生成和零样本语音克隆。该仓库包含完整的 v4 混合检查点,以及其神经音频 Codec、分词器、处理器和 Hugging Face 远程代码。

轻量规模

此次发布的核心特点是其规模。主生成模型约为 1.7 亿参数,而 Codec 解码器是一个独立的约 1.2 亿参数组件。即使将 Codec 解码器计算在内,完整音频生成技术栈仍然远小于大多数现代多语言 TTS 系统。

模型报告的主模型规模
Audio8 TTS Preview 0.1B~0.17B
Audio8 TTS Preview 0.6B~0.6B
IndexTTS2.5~0.8B
CosyVoice3~1.5B
VoxCPM2~2.3B
Fish S2 Pro~4.6B
Higgs Audio v2~4.7B
MOSS-TTS~8.5B

这些数值是从相应模型报告中收集的大致参考规模,并非严格对齐的参数规模审计。0.1B 检查点旨在以更小的语言/音频模型占用,使零样本 TTS 变得实用,而非声称在所有语言或基准测试上具有相同质量。

支持的语言

  • 主要语言:中文和英文
  • 实验性/多语言评估:德语、西班牙语、法语、意大利语、日语和韩语

模型详情

该模型采用 Audio8 Falcon H1 架构,包含慢速与快速自回归分支。慢速分支预测语义 token,快速分支则以慢速隐藏状态为条件预测 codec 码本。

组件配置
主模型约 170M 参数,不含 codec 解码器
慢速 AR24 层,宽度 512,8 个注意力头,2 个 KV 头
快速 AR4 层,宽度 512,8 个注意力头,2 个 KV 头
声学 token10 个码本,每个码本 4,096 个条目
Codec44.1 kHz,每个模型帧 2,048 个采样点(约 21.5 帧/秒)
Codec 解码器约 120M 参数;打包在 codec.pth 中
上下文最多 2,048 个打包的文本/音频位置

本仓库已包含该 codec。无需额外的 codec 检查点。

部署选项

CPU 部署:ONNX INT8

Audio8-TTS-Preview-0.1B-ONNX-INT8 使用 ONNX Runtime 将 Audio8 TTS 封装用于低资源 CPU 推理。慢速 AR 和快速 AR 使用逐 token 的 INT8 计算图,神经音频 codec 则使用 FP16。

优势详情
原生 CPU可在 ONNX Runtime 的 CPUExecutionProvider 上运行;无需 CUDA
低内存在测试的 Linux x86_64 配置下,加载后约 0.4 GiB
轻量运行时下载模型后无需依赖 PyTorch 或 Transformers
完整工作流支持 CLI、Web 和 HTTP 服务、流式 PCM 以及语音注册

常规合成仅加载慢速 AR、快速 AR 和 codec 解码器会话。 语音注册在加载可选的 codec 编码器之前会释放这些会话,从而控制峰值内存。

获取 ONNX INT8 模型 并按照 CPU ONNX Runtime 指南 进行操作。

安装

建议使用 Python 3.11 或更高版本,并配备支持 CUDA 的 GPU。

pip install "torch>=2.5.0" "torchaudio>=2.5.0" \
  "transformers>=4.57.0,<5" "soundfile>=0.12" "safetensors>=0.4"

用法

该模型包含自定义 Transformers 代码。加载时使用 trust_remote_code=True。

语音克隆

此检查点的主要用途是零样本语音克隆。请将 reference.wav 和参考转录文本替换为您自己的音频和文本。 参考转录文本应与参考音频中的语音内容一致。

import soundfile as sf
import torch
from transformers import AutoModel, AutoProcessor

model_id = "Audio8/Audio8-TTS-Preview-0.1b"
device = "cuda" if torch.cuda.is_available() else "cpu"
dtype = torch.bfloat16 if device == "cuda" else torch.float32

processor = AutoProcessor.from_pretrained(
    model_id,
    trust_remote_code=True,
)
model = AutoModel.from_pretrained(
    model_id,
    trust_remote_code=True,
    dtype=dtype,
).eval().to(device)

inputs = processor(
    text=["这是一个语音合成测试。"],
    reference_audio=["reference.wav"],
    reference_text=["参考音频对应的完整文本。"],
    return_tensors="pt",
)
inputs = {name: value.to(device) for name, value in inputs.items()}

with torch.inference_mode():
    output = model.generate(
        **inputs,
        max_new_tokens=512,
        temperature=0.7,
        top_p=0.9,
        top_k=50,
        do_sample=True,
        return_dict_in_generate=True,
    )
    waveforms, waveform_lengths = model.decode_audio(output.codes)

audio = waveforms[0, : int(waveform_lengths[0])].float().cpu().numpy()
sf.write("output.wav", audio, model.config.codec_sample_rate)

若不进行声音克隆合成,请省略 reference_audio 和 reference_text。 若需使用音频或预编码参考代码进行批量推理,请参见 Audio8 TTS 训练与推理仓库。

评估

WER/CER 越低越好;SIM(相似度)越高越好。

CV3 错误率对比

越低越好。以下对比数值参照针对 Audio8 TTS Preview 0.6B 发布的评估表; 它们属于参考性对比,并非严格对齐后的重新评估。

模型参数量zhenjakodeesfrit
Audio8 TTS Preview 0.1B~0.17B3.6193.30712.3227.6535.2928.54812.34914.480
Audio8 TTS Preview 0.6B0.6B3.2053.1287.2054.2233.4473.6418.7904.790
Fish S2 Pro4.6B3.6003.4935.1394.1113.6052.9728.6004.229
Higgs Audio v24.7B3.3783.4044.7424.2603.3002.9299.4253.555
CosyVoice3-1.5B1.5B3.914.997.575.696.434.4711.810.5
VoxCPM22.3B3.655.005.965.694.773.809.854.25
IndexTTS2.50.8B4.365.125.66--3.75--

Seed-TTS 对比

此对比表中,相似度以百分比显示。 WER/CER 越低越好;相似度越高越好。

模型参数量EN WER / SIMZH CER / SIM
Audio8 TTS Preview 0.1B~0.17B1.662 / 56.71.13 / 68.2
Audio8 TTS Preview 0.6B0.6B1.506 / 63.20.950 / 73.1
Fish S2 Pro4.6B1.607 / 64.61.038 / 73.8
Higgs Audio v24.7B1.524 / 66.40.806 / 72.1
CosyVoice3-1.5B1.5B2.22 / 72.01.12 / 78.1
MOSS-TTS8.5B1.85 / 73.41.20 / 78.8
VoxCPM22.3B1.84 / 75.30.97 / 79.5
IndexTTS2.50.8B3.253 / 82.31.119 / 80.4

IndexTTS2.5 行采用 IndexTTS 2.5 技术报告中 Table 1 的 Seed-TTS-Eval 部分 Token-Level Concatenation 结果。

参数规模为各模型报告中的近似参考值(见 Compact Scale 部分);它们并非 严格对齐后的参数量核算。供参考,MOSS-TTS 包含 8,489,841,664 个参数, VoxCPM2 主模型包含 2,290,004,544 个参数;独立的 AudioVAE 未纳入参数对比。

Fish S2 Pro 已重新评估,因为其官方评估使用了自身归一化器。Higgs Audio v2 进行了本地评估,因为缺少具体数值。其余基线数值均通过 VoxCPM 仓库 从各自官方报告中收集。

不同归一化器和评估器使得跨项目数值只能作为参考对比,而非严格对齐后的排名。评估覆盖范围不会将 Preview 检查点的支持语言声明扩展到上述所列语言之外。

局限性与负责任使用

  • 这是一个轻量预览检查点。中文和英文是主要目标语言;其他语言的质量通常较弱且波动更大。
  • 参考音频片段过长、噪声较大或转录不正确时,可能会降低生成稳定性与说话人相似度。
  • 生成的语音可能被滥用于冒充身份或传播虚假信息。克隆声音前须获得同意,并应在适当场合披露合成音频。
  • 部署前,应评估模型的准确性、安全性和法律合规性。

许可证

本模型依据 Audio8 Community License v1.0 发布,这是一项设有收入上限的自定义许可证。

  • 非商业用途(研究、个人、教育、评估)免费。
  • 商业使用免费,适用于年收入(包括母公司、子公司和关联公司)低于 2,000,000 美元的实体。
  • 年收入为 2,000,000 美元或更多的实体,在进行任何商业使用前,必须从 Audio8 取得单独的书面商业许可。

英文文本为权威版本;LICENSE 文件中提供了中文翻译,仅供参考。如需商业许可,请通过 Audio8 GitHub 仓库 或本 Hugging Face 仓库的 Issue 联系 Audio8 团队。