f
gcw_pCMO8DfP/Alpamayo-R1-10B
模型介绍
文件和版本
Pull Requests
讨论
分析

Alpamayo-R1-10B — 自动驾驶视觉语言动作模型 (昇腾 NPU 版)

Alpamayo-R1 是 NVIDIA 推出的推理型视觉语言动作 (Vision-Language-Action, VLA) 模型,基于 Qwen3-VL-8B-Instruct (Cosmos-Reason2-8B 基座) + 轨迹规划专家模块,通过 Chain-of-Causation 推理生成未来驾驶轨迹。本仓库为 昇腾 Ascend NPU (torch_npu) 适配版,全流程无 CUDA。

环境要求

  • Python 3.10+
  • 昇腾 NPU (Ascend910, 64GB HBM) + torch_npu 2.9 + CANN
  • 依赖: torch torch_npu transformers einops scipy fastapi uvicorn python-multipart safetensors pillow numpy

快速开始

# 命令行单图推理 (前视相机图像 -> 未来轨迹 waypoints + CoT 推理)
python3 inference.py --img sample_input.png

# 启动 FastAPI 服务 (根路径为上传表单, POST /predict 返回推理 JSON)
python3 inference.py --server

命令行参数

参数说明
--img车辆前视相机图像路径 (必需)
--server启动 FastAPI Web 服务

输出格式

{
  "model": "nvidia/Alpamayo-R1-10B",
  "device": "npu:0",
  "inference_time_s": 12.34,
  "num_traj_samples": 1,
  "future_waypoints": [{"x": 0.0, "y": 0.0, "z": 0.0}, ...],
  "num_waypoints": 64,
  "trajectory_xyz_shape": [1, 1, 1, 64, 3],
  "cot_reasoning": "The ego vehicle is moving straight..."
}

模型权重

模型权重 (config.json + 5 个 safetensors 分片) 与 Qwen3-VL-8B-Instruct 处理器文件自动从 GitCode 镜像下载 (回退 hf-mirror.com),缓存到 ./model_weights/,优先复用本地缓存,避免重复下载。

适配说明

  • VLM 底座实为 Qwen3-VL-8B-Instruct (Cosmos-Reason2-8B 基座),需其 config.json (文本 4096/36层 + 视觉 1152/27层) 匹配权重形状。
  • attn_implementation 由 flash_attention_2 改写为 eager (flash-attn 不适用于 NPU)。
  • 内部 alpamayo_r1 架构包为本地 vendored 版本 (无需从 PyPI 安装);hydra.utils.instantiate 为最小内置实现。

项目结构

Alpamayo-R1-10B/
├── inference.py        # 主推理脚本 (CLI + FastAPI 双模式)
├── alpamayo_r1/        # vendored 架构模块 (NPU 适配, 无 CUDA)
├── hydra/              # hydra.utils 最小 shim
├── sample_input.png    # 示例输入图像
├── README.md
├── model_weights/      # 权重缓存 (不提交)
└── assets/             # 截图
    ├── agent_workflow.png
    ├── npu_device_call.png
    └── model_result.png