HuggingFace镜像/VibeVoice-ASR
模型介绍
文件和版本
分析

VibeVoice-ASR

GitHub Live Playground Technical Report

VibeVoice-ASR 是一款统一的语音转文本模型,支持单次处理长达 60 分钟的长音频,可生成包含 说话人(Who)、时间戳(When)和内容(What) 的结构化转录文本,并支持 自定义热词 及超过 50 种语言。

➡️ 代码: microsoft/VibeVoice
➡️ 演示: VibeVoice-ASR-Demo
➡️ 报告: VibeVoice-ASR 技术报告
➡️ 微调: Finetuning
➡️ vLLM: vLLM-VibeVoice-ASR

VibeVoice-ASR Architecture

🔥 核心特性

  • 🕒 60分钟单次处理: 不同于传统 ASR 模型将音频分割成短片段(常导致全局上下文丢失),VibeVoice ASR 可接收长达 60 分钟的连续音频输入(在 64K 令牌长度内)。这确保了整个小时内说话人跟踪的一致性和语义连贯性。

  • 👤 自定义热词: 用户可提供自定义热词(如特定名称、技术术语或背景信息)来指导识别过程,显著提升特定领域内容的识别准确率。

  • 📝 丰富转录信息(Who、When、What): 该模型联合执行语音识别、说话人分离和时间戳标注,生成结构化输出,清晰指示谁在何时说了什么。

  • 🌍 多语言及语码转换支持: 支持超过 50 种语言,无需显式设置语言,原生支持话语内和跨话语的语码转换。语言分布详情可参见此处。

评估

DER cpWER tcpWER

安装与使用

详情请参见 GitHub 说明文档。

语言分布

Language Distribution

许可证

本项目基于 MIT 许可证授权。

联系方式

本项目由微软研究院成员负责。我们欢迎广大用户提供反馈并开展合作。如果您有任何建议、问题,或发现我们的技术存在意外/冒犯性表现,请通过 VibeVoice@microsoft.com 与我们联系。 若团队收到不良行为报告或自行发现相关问题,我们将更新此代码库并采取适当的缓解措施。