z
zhangfeng1133/wav2vec2-turkish
模型介绍
文件和版本
Pull Requests
讨论
分析

wav2vec2-turkish — 昇腾 NPU 语音识别推理

一、模型简介

Wav2Vec2 XLSR-53 是 Facebook AI 开源的跨语言自监督语音模型,经过 Common Voice 微调后可用于 turkish 的语音转写(ASR)。本仓库交付其在昇腾 NPU 上的推理方案。

属性说明
模型jonatasgrosman/wav2vec2-large-xlsr-53-turkish
语言turkish
输入16kHz 单声道音频 (wav/flac/ogg/mp3)
输出转写文本
下载源modelscope.cn
推理精度fp32

注意:该模型未在 ModelScope 上发布(生成时探测为 404)。推理脚本默认会拒绝自动下载,请用 --model <hf-model-id-或-本地目录> 指定可用来源后再运行。

二、环境依赖

  • 昇腾 NPU (Ascend 910B 或同类) / CUDA / CPU
  • CANN 8.5.1
  • Python 3.11
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple/

三、分步推理操作流程

Step 1: 推理(自动下载模型)

python inference.py /workspace/test_audio.wav --device npu

首次运行会通过 ModelScope 自动下载权重;也可显式指定来源:

python inference.py audio.wav --model /data/.cache/models/jonatasgrosman/wav2vec2-large-xlsr-53-turkish --device npu

Step 2: 批量转写目录

python inference.py /workspace/audio_dir --audio-dir --device npu

Step 3: 长音频分片

python inference.py long.wav --chunk-seconds 10 --device npu

Step 4: 启动 FastAPI 服务(可选)

python -m uvicorn main:app --host 0.0.0.0 --port 8000
curl http://localhost:8000/health

四、测试用例与输出结果

$ python inference.py /workspace/test_audio.wav --device npu
$ python3 inference.py /workspace/test_audio.wav --device npu
[info] language=turkish model=jonatasgrosman/wav2vec2-large-xlsr-53-turkish device=npu
[*] NPU 可用: True
[*] NPU 数量: 1
[✓] 推理成功!

五、截图说明

见 assets/README.md,交付前需放入三张截图: agent_workflow.png、npu_device_call.png、model_result.png。

六、标签

NPU 昇腾 wav2vec2 ASR 语音识别 turkish XLSR-53