HuggingFace镜像/Alpamayo-R1-10B
模型介绍
文件和版本
分析

Alpamayo 1

代码 | 论文

注:继 2026 年国际消费电子展(CES)上 NVIDIA Alpamayo 发布后,Alpamayo-R1 已更名为 Alpamayo 1。

模型概述

描述:

Alpamayo 1 融合因果链推理与轨迹规划技术,旨在提升复杂自动驾驶场景下的决策能力。Alpamayo 1(v1.0)由 NVIDIA 研发,是一款视觉 - 语言 - 动作(VLA)模型,它在自动驾驶应用中实现了可解释推理与精确车辆控制的有机结合。

本模型可供非商业用途。商业授权可根据需求提供。

许可证:

模型权重: 模型权重依据 OpenMDW-1.1 许可证发布。

源代码: 采用 Apache License 2.0 许可证,详见 Alpamayo 1 源代码仓库。

部署地区:

全球

应用场景:

适用于研发和评估自动驾驶场景下 VLA 模型的研究人员与自动驾驶从业者,尤其适用于处理罕见的长尾事件。

发布日期:

2025 年 12 月 3 日通过本仓库在 Hugging Face 发布。

推理代码:

GitHub:https://github.com/NVlabs/alpamayo

参考文献:

Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail

模型架构:

架构类型: Transformer

网络架构: 基于 Cosmos - Reason 的 VLA 模型,并配备基于扩散的轨迹解码器。

本模型基于以下技术开发: Cosmos - Reason(VLM 主干网络)与基于扩散的动作解码器

模型参数数量:

  • 主干网络:82 亿参数
  • 动作专家网络:23 亿参数

输入:

输入类型: 图像/视频、文本、自车运动历史

输入格式:

  • 图像:红、绿、蓝(RGB)
  • 文本:字符串
  • 自车运动历史:浮点值 (x, y, z), R_rot

输入参数:

  • 图像:二维(2D)、多摄像头、多时间步
  • 文本:一维(1D)
  • 自车运动历史:三维(3D)平移和九维(9D,3x3)旋转、多时间步

与输入相关的其他属性: 多摄像头图像(4 个摄像头:前视广角、前视长焦、左视交叉、右视交叉),历史窗口为 0.4 秒,频率 10Hz(每个摄像头 4 帧),图像分辨率 1080x1920 像素(处理器会将其下采样至 320x576 像素)。文本输入包括用户指令。图像和自车运动历史(10Hz 下的 16 个路点)还需关联时间戳。 请注意,该模型主要在此设置下进行训练,且仅在此设置下经过测试。

输出

输出类型: 文本、轨迹

输出格式:

  • 文本:字符串(因果链推理轨迹)
  • 轨迹:浮点值 (x, y, z), R_rot

输出参数:

  • 文本:一维(1D)
  • 轨迹:三维(3D)平移和九维(9D,3x3)旋转,多时间步长

与输出相关的其他属性: 输出6.4秒的未来轨迹(10Hz下64个路点),包含自车坐标系下的位置 (x, y, z) 和旋转矩阵 R_rot。 在内部,轨迹表示为一系列动态动作(加速度和曲率),遵循鸟瞰图(BEV)空间中的单轮模型。 文本推理轨迹长度可变,描述驾驶决策和因果因素。

我们的AI模型设计和/或优化为在NVIDIA GPU加速系统上运行。通过利用NVIDIA的硬件(例如GPU核心)和软件框架(例如CUDA库),与仅使用CPU的解决方案相比,该模型实现了更快的训练和推理时间。

软件集成:

运行时引擎:

  • PyTorch(最低版本:2.8)
  • Hugging Face Transformers(最低版本:4.57.1)
  • DeepSpeed(最低版本:0.17.4)

支持的硬件微架构兼容性:

  • 具有足够内存以加载10B参数模型的NVIDIA GPU(至少1块GPU,且VRAM至少为24GB)

首选/支持的操作系统:

  • Linux(我们未在其他操作系统上进行测试)

将基础模型和微调模型集成到AI系统中,需要使用特定用例的数据进行额外测试,以确保安全有效的部署。遵循V模型方法,在单元和系统层面进行迭代测试和验证,对于在部署前减轻风险、满足技术和功能要求以及确保符合安全和伦理标准至关重要。

模型版本:

Alpamayo 1 10B v1.0 已训练

可集成到云端的自动驾驶软件中,用于高级端到端感知、推理和运动规划。

训练、测试与评估数据集:

训练数据集:

Alpamayo 1 的训练数据包含因果链(CoC)推理轨迹、Cosmos-Reason 物理 AI 数据集以及 NVIDIA 内部专有自动驾驶数据的混合。

数据模态:

  • 图像(多摄像头)
  • 文本(推理轨迹)
  • 其他:轨迹数据(自车运动、未来路径点)

图像训练数据规模: 超过 10 亿张图像(来自 80,000 小时的多摄像头驾驶数据)

文本训练数据规模: 少于 10 亿 tokens(70 万条 CoC 推理轨迹加上 Cosmos-Reason 训练数据)

视频训练数据规模: 10,000 至 100 万小时(80,000 小时)

非音频、图像、文本训练数据规模: 轨迹数据:80,000 小时,采样率为 10Hz

各数据集的数据收集方法: 混合:自动/传感器(摄像头和车辆传感器)、合成(VLM 生成的推理)

各数据集的标注方法: 混合:人工(结构化 CoC 标注)、自动化(基于 VLM 的自动标注)、自动/传感器(轨迹和自车运动)

特性: 该数据集包含 80,000 小时的多摄像头驾驶视频,以及相应的自车运动和轨迹标注。 包含 700,000 条因果链(CoC)推理轨迹,为驾驶行为提供基于决策的、因果关联的解释。 内容包括来自车辆传感器(摄像头、IMU 和 GPS)的机器生成数据以及合成推理轨迹。 CoC 标注为英文,并采用结构化格式,将驾驶决策与因果因素相联系。 传感器包括 RGB 摄像头(每辆车 2-6 个)、惯性测量单元和 GPS。

测试数据集:

链接: 专有自动驾驶测试数据集、闭环仿真、实车道路测试。

各数据集的数据收集方法: 混合:自动/传感器(真实世界驾驶数据)、合成(仿真场景)

各数据集的标注方法: 混合:自动/传感器、人工(真值验证)

特性: 该数据集涵盖多摄像头驾驶场景,特别关注罕见的长尾事件。它包括具有挑战性的情况,如复杂交叉路口、加塞、行人交互以及恶劣天气条件。数据从 RGB 摄像头和车辆传感器收集。

评估数据集:

链接: 与测试数据集相同。

数据集的数据收集方法: 混合:自动/传感器(真实驾驶数据)、合成(模拟场景)

数据集的标注方法: 混合:自动/传感器、人工(真值验证)

特性: 评估侧重于罕见的长尾场景,包括复杂交叉路口、行人过街、车辆加塞以及具有挑战性的天气和光照条件。多摄像头传感器数据从RGB摄像头收集。

定量评估基准:

  • 使用AlpaSim在来自PhysicalAI-AV-NuRec Dataset的910个场景上进行闭环评估:AlpaSim得分为0.73 ± 0.01。
  • 在来自PhysicalAI-AV Dataset的937个具有挑战性的样本上进行开环评估:6.4秒时的minADE_6为1.22米。

推理:

加速引擎: PyTorch、Hugging Face Transformers

测试硬件:

  • 最低配置:1块24GB及以上显存的GPU(例如,NVIDIA RTX 3090、RTX 3090 Ti、RTX 4090、A5000或同等型号)
  • 已测试:NVIDIA H100

有关模型推理的脚本,请查看我们的代码仓库。

伦理考量:

NVIDIA 认为可信 AI 是一项共同的责任,我们已制定相关政策和实践,以支持广泛的 AI 应用开发。当按照我们的服务条款下载或使用时,开发人员应与其内部模型团队合作,确保该模型满足相关行业和用例的要求,并解决意外的产品误用问题。

请在此链接报告模型质量、风险、安全漏洞或 NVIDIA AI 相关问题。

支持

📣 使用问题:发布于 Alpamayo NV 开发者论坛。

🐛 代码错误/文档问题/功能请求:使用适当的模板(错误报告、文档请求或功能请求)在 https://github.com/NVlabs/alpamayo/issues/new/choose 提交 GitHub issue。相关的 NVIDIA 响应人员将被自动分配。

🚨 安全漏洞:请使用 NVIDIA 漏洞披露计划。不要提交公开 issue。

(注意:此模型的 HuggingFace 社区标签将于2026年7月31日停用。请使用上述渠道。)