K-ON111111/w2v-xls-r-uk
模型介绍
文件和版本
Pull Requests
讨论
分析

w2v-xls-r-uk — 昇腾 NPU 适配模型

赛事: 昇腾 Model Agent 模型适配大赛(第二季) 引擎: torch_npu + transformers 硬件: Ascend 910B 系列(实测 Ascend910B4) 标签: npu ascend pytorch transformers

📖 模型简介

属性值
原始模型Yehor/w2v-xls-r-uk
基座模型facebook/wav2vec2-xls-r-300m
参数量~300M
任务类型自动语音识别(ASR / CTC)
输入格式16kHz 单声道音频(wav / mp3 / flac)
输出格式乌克兰语转录文本 + 置信度

🔧 环境依赖

pip install -r requirements.txt -i https://repo.huaweicloud.com/repository/pypi/simple/

🚀 推理步骤

⚠️ 本仓库不包含模型权重(交付件仅 inference.py / readme.md / requirements.txt / assets/), 推理前必须先从原始模型仓单独下载权重。

# 1. 下载模型权重(仓库不含权重,必须单独下载)
git clone https://gitcode.com/hf_mirrors/Yehor/w2v-xls-r-uk.git .
git lfs pull

# 2. 运行 NPU 推理(输入为 16kHz 单声道音频)
python3 inference.py --model_path . --input <your_audio.wav> --device npu:0

🧪 测试用例

用例 1: 乌克兰语语音识别

python3 inference.py --model_path . --input test_uk.wav --device npu:0

预期输出:

[Model Agent] ✅ NPU 设备就绪: Ascend910B4
[Model Agent] ✅ 模型加载完成 → npu:0
[Model Agent] 🎧 输入音频: test_uk.wav, 时长 5.04s
[Model Agent] ✅ 推理完成 → 转录文本: з іншого боку вінпрацював вже на зоряних війнах тобто це людина яка
[Model Agent] 📊 置信度: 0.9575 | 推理耗时: 5467.82 ms
[Model Agent] ✅ 结果已保存 → inference_result.json

📁 目录结构

.
├── inference.py          # NPU 推理脚本
├── readme.md             # 本文件
├── requirements.txt      # 依赖清单
└── assets/               # 截图素材

📝 适配说明

本模型由 昇腾 Model Agent 自动完成 NPU 适配。 将 Wav2Vec2ForCTC 从 CUDA 迁移至昇腾 NPU:调用 torch_npu 完成设备初始化与算子下发, 音频经 librosa 重采样为 16kHz 后送入模型,CTC greedy decode 输出转录文本。