2301_76761127/uae-large-v1-npu
模型介绍
文件和版本
Pull Requests
讨论
分析

WhereIsAI/UAE-Large-V1 — Ascend NPU 推理

本仓提供 WhereIsAI/UAE-Large-V1 的可独立复现 Ascend NPU 推理入口。 最终托管运行在 npu:1 上完成一次真实 BERT-large forward,以 CLS token 作为句子向量:8 个样本、每个 1024 维、共 8192 个有限值,进程退出码为 0。

环境

  • Ascend 910_9362
  • CANN 8.5.1
  • Python 3.11
  • PyTorch 2.9
  • torch_npu 2.9.0.post1
  • transformers 4.57.6

保留容器自带的 PyTorch、torch_npu 与 CANN 平台栈;requirements.txt 只列模型层依赖。

从空目录准备

在本仓根目录执行:

git clone https://gitcode.com/hf_mirrors/WhereIsAI/UAE-Large-V1.git model
git -C model checkout 9c9b2c999b3350cfb3171ed429320668e39b00b8
git -C model lfs pull

python -m pip install --no-deps --target ./pydeps -r requirements.txt

固定 commit 用于可复现地获取模型。推理脚本运行时不校验仓库身份、revision、 文件 SHA、manifest、输入夹具哈希或固定参数量;它也不会联网下载模型。

唯一推理入口

source /usr/local/Ascend/cann-8.5.1/set_env.sh
PYTHONNOUSERSITE=1 \
PYTHONPATH=./pydeps:$PYTHONPATH \
EVIDENCE_HOLD_SECONDS=90 \
python inference.py \
  --model_path ./model \
  --device npu:1 \
  --seed 20260816 \
  --output_json ./result.json

--device 只接受 npu:N,禁用 CPU/CUDA 回退。脚本把模型、token 张量和 完整 embedding 保持在指定 NPU 上,校验输出 shape [8, 1024]、8192 个值、 有限性与退出状态。EVIDENCE_HOLD_SECONDS 可在真实 forward 后、模型和张量 仍存活时保持进程 0–600 秒;最终截图运行使用 600 秒,因此记录的 forward_ms=600586.9588418864 包含该保持时间。

双份托管截图

Agent workflow

Agent workflow

Agent workflow duplicate

NPU device call

NPU device call

NPU device call duplicate

Model result

Model result

Model result duplicate

这些确定性句子用于验证模型能在 Ascend NPU 上完整执行,不代表通用语义检索 质量评测。模型许可为 Apache-2.0;使用前请同时核对上游模型卡。

本仓为 2301_76761127 队伍交付件(与备份账号合并提交)。