Embodied-R1.5 是具身智能视觉语言模型(Qwen3VL 架构,8.77B 参数), 支持图像理解与具身智能指令跟随。
本项目完成其在**华为昇腾 NPU(Ascend 910B)**上的推理适配与验证。 权重通过 GitCode HF 镜像下载(原 HF 下载 401 CAS 需认证,镜像免登录拉取)。
| 项目 | 说明 |
|---|---|
| 模型架构 | Qwen3VLForConditionalGeneration(qwen3_vl) |
| 参数量 | 8.77B |
| 输入 | 图像 + 文本指令(chat template) |
| 输出 | 文本描述(图像理解) |
| 权重格式 | 4 分片 safetensors(共 17.5GB) |
# 原 HF 下载 401 CAS 需认证,改用 GitCode HF 镜像
GIT_LFS_SKIP_SMUDGE=1 git clone https://gitcode.com/hf_mirrors/IffYuan/Embodied-R1.5.git /workspace/IffYuan_Embodied-R1.5_src
cd /workspace/IffYuan_Embodied-R1.5_src && git lfs pull# 必须使用系统 transformers 5.15(4.x 不支持 qwen3_vl 架构)
python3 -c "import transformers; print(transformers.__version__)" # 需 5.15cd /workspace/Embodied-R1.5
python3 inference.py --model_path /workspace/IffYuan_Embodied-R1.5_src \
--image /path/to/img.png --prompt "Describe this image." --device npu:0| 参数 | 说明 | 默认值 |
|---|---|---|
--model_path | 权重目录 | /workspace/IffYuan_Embodied-R1.5_src |
--image | 输入图像路径 | 示例图 |
--prompt | 文本指令 | Describe this image. |
--max_new_tokens | 生成最大 token 数 | 40 |
--device | 推理设备(npu:0 / cpu) | npu:0 |
--output | 结果保存文件(可选) | stdout |
输入:真实文档图像 + "Describe this image."
[info] model loaded: Qwen3VLForConditionalGeneration (8.77B)
[info] processor ready (chat template 5292B)
============================================================
[info] 生成文本: The image displays a form for the Georgia Government
Transparency and Campaign Finance Commission...
============================================================Embodied-R1.5 在 NPU 上完成图像理解(准确识别表单内容), NPU 推理链路完整跑通。
https://gitcode.com/hf_mirrors/IffYuan/Embodied-R1.5.git 免登录拉取。processor_config.json 与 tokenizer_config 的
chat_template 字段,需手动组装 Qwen2VLProcessor(tokenizer+image+video)并
从 chat_template.jinja 注入模板。AutoModelForImageTextToText(base 模型无 generate 方法)。resolve_device():NPU 可用性检测,失败自动回退 CPU。*.safetensors 已加入 .gitignore。.
├── README.md # 模型卡片(本文件)
├── inference.py # NPU 推理脚本
└── assets/ # 适配过程截图素材