s
stella4528/llama-nemotron-embed-1b-v2-NPU
模型介绍
文件和版本
Pull Requests
讨论
分析

llama-nemotron-embed-1b-v2 昇腾 NPU 推理适配

原始权重:nvidia/llama-nemotron-embed-1b-v2 适配账号:stella4528 · 昇腾 Ascend 910B · torch_npu 2.9.0.post1

简介

嵌入模型模型已完成昇腾 NPU 推理适配,六件套(minimal / accuracy / benchmark / stability / inference)全 PASS,验收达标。

架构

LlamaBidirectionalModel(1235.8M),权重 ascend-model/model.safetensors

环境

  • 昇腾 Ascend 910B(NPU:0),CANN 8.5.1
  • PyTorch 2.9.0 + torch_npu 2.9.0.post1
  • 依赖见 requirements.txt

权重

权重已按比赛要求整理于 ascend-model/ 目录(真实权重文件,非 LFS 指针)。

验收结果

项目结果
精度rel_l2=6.71e-06、cos=1.000000
性能p50 16.3ms / avg 16.4ms
稳定性20/20 逐位一致
形状一致
finite全 finite

脚本复现

python3 minimal_repro.py    # 最小前向验证
python3 accuracy_eval.py    # 精度验收(CPU/NPU 对比)
python3 benchmark.py        # 性能基准
python3 stability.py        # 稳定性(20 轮)
python3 inference.py        # 推理演示

目录结构

s78/
├── common.py / minimal_repro.py / accuracy_eval.py
├── benchmark.py / stability.py / inference.py
├── results/          # 验收 JSON
├── assets/           # 真实运行截图
└── ascend-model/     # 权重

生成时间:2026-08-25 · stella4528 号冲榜工作