Wav2Vec2 XLSR-53 是 Facebook AI 开源的跨语言自监督语音模型,经过 Common Voice 微调后可用于 turkish 的语音转写(ASR)。本仓库交付其在昇腾 NPU 上的推理方案。
| 属性 | 说明 |
|---|---|
| 模型 | jonatasgrosman/wav2vec2-large-xlsr-53-turkish |
| 语言 | turkish |
| 输入 | 16kHz 单声道音频 (wav/flac/ogg/mp3) |
| 输出 | 转写文本 |
| 下载源 | modelscope.cn |
| 推理精度 | fp32 |
注意:该模型未在 ModelScope 上发布(生成时探测为 404)。推理脚本默认会拒绝自动下载,请用 --model <hf-model-id-或-本地目录> 指定可用来源后再运行。
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple/python inference.py /workspace/test_audio.wav --device npu首次运行会通过 ModelScope 自动下载权重;也可显式指定来源:
python inference.py audio.wav --model /data/.cache/models/jonatasgrosman/wav2vec2-large-xlsr-53-turkish --device npupython inference.py /workspace/audio_dir --audio-dir --device npupython inference.py long.wav --chunk-seconds 10 --device npupython -m uvicorn main:app --host 0.0.0.0 --port 8000curl http://localhost:8000/health$ python inference.py /workspace/test_audio.wav --device npu$ python3 inference.py /workspace/test_audio.wav --device npu
[info] language=turkish model=jonatasgrosman/wav2vec2-large-xlsr-53-turkish device=npu
[*] NPU 可用: True
[*] NPU 数量: 1
[✓] 推理成功!
见 assets/README.md,交付前需放入三张截图:
agent_workflow.png、npu_device_call.png、model_result.png。
NPU 昇腾 wav2vec2 ASR 语音识别 turkish XLSR-53