Alpamayo-R1 是 NVIDIA 推出的推理型视觉语言动作 (Vision-Language-Action, VLA) 模型,基于 Qwen3-VL-8B-Instruct (Cosmos-Reason2-8B 基座) + 轨迹规划专家模块,通过 Chain-of-Causation 推理生成未来驾驶轨迹。本仓库为 昇腾 Ascend NPU (torch_npu) 适配版,全流程无 CUDA。
torch_npu 2.9 + CANNtorch torch_npu transformers einops scipy fastapi uvicorn python-multipart safetensors pillow numpy# 命令行单图推理 (前视相机图像 -> 未来轨迹 waypoints + CoT 推理)
python3 inference.py --img sample_input.png
# 启动 FastAPI 服务 (根路径为上传表单, POST /predict 返回推理 JSON)
python3 inference.py --server| 参数 | 说明 |
|---|---|
--img | 车辆前视相机图像路径 (必需) |
--server | 启动 FastAPI Web 服务 |
{
"model": "nvidia/Alpamayo-R1-10B",
"device": "npu:0",
"inference_time_s": 12.34,
"num_traj_samples": 1,
"future_waypoints": [{"x": 0.0, "y": 0.0, "z": 0.0}, ...],
"num_waypoints": 64,
"trajectory_xyz_shape": [1, 1, 1, 64, 3],
"cot_reasoning": "The ego vehicle is moving straight..."
}模型权重 (config.json + 5 个 safetensors 分片) 与 Qwen3-VL-8B-Instruct 处理器文件自动从 GitCode 镜像下载 (回退 hf-mirror.com),缓存到 ./model_weights/,优先复用本地缓存,避免重复下载。
attn_implementation 由 flash_attention_2 改写为 eager (flash-attn 不适用于 NPU)。alpamayo_r1 架构包为本地 vendored 版本 (无需从 PyPI 安装);hydra.utils.instantiate 为最小内置实现。Alpamayo-R1-10B/
├── inference.py # 主推理脚本 (CLI + FastAPI 双模式)
├── alpamayo_r1/ # vendored 架构模块 (NPU 适配, 无 CUDA)
├── hydra/ # hydra.utils 最小 shim
├── sample_input.png # 示例输入图像
├── README.md
├── model_weights/ # 权重缓存 (不提交)
└── assets/ # 截图
├── agent_workflow.png
├── npu_device_call.png
└── model_result.png