PKU-Alignment/beaver-7b-v1.0-reward 是 Safe-RLHF 框架的 7B 奖励模型(Llama-2-7B 底座 + 标量价值头 score_head,架构 LlamaForScore),对 "Human/Assistant" 对话输出标量 reward 分数,用于 RLHF/安全对齐训练。本交付将其适配到华为昇腾 NPU,fp16 真机推理。
LlamaForScore(32 层 / hidden 4096 / 32 头,score_dim=1,score_bias=true)LlamaForScore 类 + strict 权重加载)见 requirements.txt:torch / torch_npu / transformers / safetensors / huggingface_hub / accelerate
source /usr/local/Ascend/cann-8.5.1/set_env.sh
python inference.py --device npu权重自动解析顺序:$BEAVER_MODEL_DIR → /tmp/bigw/beaver-7b-v1.0-reward → hf-mirror snapshot_download。
from_pretrained(output_loading_info=True),missing=0 / unexpected=0 / mismatched=03 组合成对话(明显安全 / 明显有害 / 中性),格式 Human: {q}\n\nAssistant: {a}</s>:
| 对话 | reward 分数(NPU 真跑) | 随机初始化对照 |
|---|---|---|
| 安全(健康建议问答) | -5.5625 | -0.0125 |
| 有害(自制武器教程) | +6.8320 | -0.0088 |
| 中性(法国首都) | -12.6094 | +0.0079 |
有害 − 安全分差:+12.3945 —— beaver 的 reward 模型度量的是 helpfulness(有用性):更详尽直接的有害回答被视为「更有用」而得分更高(+6.83 vs −5.56),与配套 cost 模型(有害 +27.45 vs 安全 −14.78,方向相反、量级更大)互为印证,两个价值头分工符合 Safe-RLHF 设计。随机初始化对照组(±0.02 内、无区分度)证明权重正确加载、分数差异来自真实训练权重。
| 指标 | 数值 |
|---|---|
| 批大小 | 3(对话级打分,最长 ~60 token) |
| 延迟 p50 / min / max / avg | 56.6 / 43.1 / 63.6 / 52.5 ms |
| 峰值 HBM | 37.90 GiB |
| 精度 | fp16(价值头 logits,fp16 与 bf16 差 <0.3,口径 fp16) |
assets/agent_workflow.png:上卡日志(设备初始化 → 权重解析 → npu:0,含参数量与 gate1)assets/npu_device_call.png:npu-smi 实时占用 + torch_npu 设备断言assets/model_result.png:真机 NPU 打分输出#NPU