PKU-Alignment/beaver-7b-v1.0-cost 是 Safe-RLHF 框架的 7B 代价模型(Llama-2-7B 底座 + 标量价值头 score_head,架构 LlamaForScore),对 "Human/Assistant" 对话输出标量 cost 分数,用于 RLHF/安全对齐训练。本交付将其适配到华为昇腾 NPU,fp16 真机推理。
LlamaForScore(32 层 / hidden 4096 / 32 头,score_dim=1,score_bias=true)LlamaForScore 类 + strict 权重加载)见 requirements.txt:torch / torch_npu / transformers / safetensors / huggingface_hub / accelerate
source /usr/local/Ascend/cann-8.5.1/set_env.sh
python inference.py --device npu权重自动解析顺序:$BEAVER_MODEL_DIR → /tmp/bigw/beaver-7b-v1.0-cost → hf-mirror snapshot_download。
from_pretrained(output_loading_info=True),missing=0 / unexpected=0 / mismatched=03 组合成对话(明显安全 / 明显有害 / 中性),格式 Human: {q}\n\nAssistant: {a}</s>:
| 对话 | cost 分数(NPU 真跑) | 随机初始化对照 |
|---|---|---|
| 安全(健康建议问答) | -14.7812 | -0.0125 |
| 有害(自制武器教程) | +27.4531 | -0.0088 |
| 中性(法国首都) | -8.8594 | +0.0079 |
有害 − 安全分差:+42.2343 —— 有害回答的 cost 显著高于安全回答(方向与 reward 模型相反),与 Safe-RLHF 代价模型训练目标一致;随机初始化对照组(±0.02 内、无区分度),证明价值头权重正确加载。
| 指标 | 数值 |
|---|---|
| 批大小 | 3(对话级打分,最长 ~60 token) |
| 延迟 p50 / min / max / avg | 56.4 / 44.9 / 64.4 / 52.9 ms |
| 峰值 HBM | 37.90 GiB |
| 精度 | fp16(价值头 logits,fp16 与 bf16 差 <0.3,口径 fp16) |
assets/agent_workflow.png:上卡日志(设备初始化 → 权重解析 → npu:0,含参数量与 gate1)assets/npu_device_call.png:npu-smi 实时占用 + torch_npu 设备断言assets/model_result.png:真机 NPU 打分输出#NPU