赛事: 昇腾 Model Agent 模型适配大赛(第二季) 引擎: torch_npu + transformers 硬件: Ascend 910B 系列(实测 Ascend910B4) 标签:
npuascendpytorchtransformers
| 属性 | 值 |
|---|---|
| 原始模型 | AbelZimba/whisper-bemba-stt |
| 基座模型 | openai/whisper-small |
| 参数量 | ~244M |
| 任务类型 | 自动语音识别(本巴语 ASR) |
| 输入格式 | 16kHz 单声道音频(wav / mp3 / flac) |
| 输出格式 | 转录文本(本巴语) |
pip install -r requirements.txt -i https://repo.huaweicloud.com/repository/pypi/simple/⚠️ 本仓库不包含模型权重(交付件仅
inference.py/readme.md/requirements.txt/assets/), 推理前必须先从原始模型仓单独下载权重。
# 1. 下载模型权重(仓库不含权重,必须单独下载)
git clone https://gitcode.com/hf_mirrors/AbelZimba/whisper-bemba-stt.git .
git lfs pull
# 2. 运行 NPU 推理(输入为 16kHz 单声道音频)
python3 inference.py --model_path . --input <your_audio.wav> --device npu:0python3 inference.py --model_path . --input test_bem.wav --device npu:0预期输出:
[Model Agent] ✅ NPU 设备就绪: Ascend910B4
[Model Agent] ✅ 模型加载完成 → npu:0
[Model Agent] 🎧 输入音频: test_bem.wav, 时长 5.24s
[Model Agent] ✅ 推理完成 → 转录文本: Ula janamwana wawe bagamu uglola uglolwi.
[Model Agent] 📊 语言: en | 推理耗时: 6283.74 ms
[Model Agent] ✅ 结果已保存 → inference_result.json.
├── inference.py # NPU 推理脚本
├── readme.md # 本文件
├── requirements.txt # 依赖清单
└── assets/ # 截图素材本模型由 昇腾 Model Agent 自动完成 NPU 适配。
WhisperForConditionalGeneration 从 CUDA 迁移至昇腾 NPU:调用 torch_npu 完成设备初始化与算子下发,
音频经 librosa 重采样为 16kHz 后由 WhisperProcessor 提取 80 维 mel 特征,
模型微调未扩展 <|bem|> 语言 token,故以 <|en|> 语言 token 强制转录输出本巴语文本。