VibeVoice-ASR 是一款统一的语音转文本模型,支持单次处理长达 60 分钟的长音频,可生成包含 说话人(Who)、时间戳(When)和内容(What) 的结构化转录文本,并支持 自定义热词 及超过 50 种语言。
➡️ 代码: microsoft/VibeVoice
➡️ 演示: VibeVoice-ASR-Demo
➡️ 报告: VibeVoice-ASR 技术报告
➡️ 微调: Finetuning
➡️ vLLM: vLLM-VibeVoice-ASR
🕒 60分钟单次处理: 不同于传统 ASR 模型将音频分割成短片段(常导致全局上下文丢失),VibeVoice ASR 可接收长达 60 分钟的连续音频输入(在 64K 令牌长度内)。这确保了整个小时内说话人跟踪的一致性和语义连贯性。
👤 自定义热词: 用户可提供自定义热词(如特定名称、技术术语或背景信息)来指导识别过程,显著提升特定领域内容的识别准确率。
📝 丰富转录信息(Who、When、What): 该模型联合执行语音识别、说话人分离和时间戳标注,生成结构化输出,清晰指示谁在何时说了什么。
🌍 多语言及语码转换支持: 支持超过 50 种语言,无需显式设置语言,原生支持话语内和跨话语的语码转换。语言分布详情可参见此处。
详情请参见 GitHub 说明文档。
本项目基于 MIT 许可证授权。
本项目由微软研究院成员负责。我们欢迎广大用户提供反馈并开展合作。如果您有任何建议、问题,或发现我们的技术存在意外/冒犯性表现,请通过 VibeVoice@microsoft.com 与我们联系。 若团队收到不良行为报告或自行发现相关问题,我们将更新此代码库并采取适当的缓解措施。