注:继 2026 年国际消费电子展(CES)上 NVIDIA Alpamayo 发布后,Alpamayo-R1 已更名为 Alpamayo 1。
Alpamayo 1 融合因果链推理与轨迹规划技术,旨在提升复杂自动驾驶场景下的决策能力。Alpamayo 1(v1.0)由 NVIDIA 研发,是一款视觉 - 语言 - 动作(VLA)模型,它在自动驾驶应用中实现了可解释推理与精确车辆控制的有机结合。
本模型可供非商业用途。商业授权可根据需求提供。
模型权重: 模型权重依据 OpenMDW-1.1 许可证发布。
源代码: 采用 Apache License 2.0 许可证,详见 Alpamayo 1 源代码仓库。
全球
适用于研发和评估自动驾驶场景下 VLA 模型的研究人员与自动驾驶从业者,尤其适用于处理罕见的长尾事件。
2025 年 12 月 3 日通过本仓库在 Hugging Face 发布。
GitHub:https://github.com/NVlabs/alpamayo
架构类型: Transformer
网络架构: 基于 Cosmos - Reason 的 VLA 模型,并配备基于扩散的轨迹解码器。
本模型基于以下技术开发: Cosmos - Reason(VLM 主干网络)与基于扩散的动作解码器
模型参数数量:
输入类型: 图像/视频、文本、自车运动历史
输入格式:
(x, y, z), R_rot输入参数:
与输入相关的其他属性: 多摄像头图像(4 个摄像头:前视广角、前视长焦、左视交叉、右视交叉),历史窗口为 0.4 秒,频率 10Hz(每个摄像头 4 帧),图像分辨率 1080x1920 像素(处理器会将其下采样至 320x576 像素)。文本输入包括用户指令。图像和自车运动历史(10Hz 下的 16 个路点)还需关联时间戳。 请注意,该模型主要在此设置下进行训练,且仅在此设置下经过测试。
输出类型: 文本、轨迹
输出格式:
(x, y, z), R_rot输出参数:
与输出相关的其他属性:
输出6.4秒的未来轨迹(10Hz下64个路点),包含自车坐标系下的位置 (x, y, z) 和旋转矩阵 R_rot。
在内部,轨迹表示为一系列动态动作(加速度和曲率),遵循鸟瞰图(BEV)空间中的单轮模型。
文本推理轨迹长度可变,描述驾驶决策和因果因素。
我们的AI模型设计和/或优化为在NVIDIA GPU加速系统上运行。通过利用NVIDIA的硬件(例如GPU核心)和软件框架(例如CUDA库),与仅使用CPU的解决方案相比,该模型实现了更快的训练和推理时间。
运行时引擎:
支持的硬件微架构兼容性:
首选/支持的操作系统:
将基础模型和微调模型集成到AI系统中,需要使用特定用例的数据进行额外测试,以确保安全有效的部署。遵循V模型方法,在单元和系统层面进行迭代测试和验证,对于在部署前减轻风险、满足技术和功能要求以及确保符合安全和伦理标准至关重要。
Alpamayo 1 10B v1.0 已训练
可集成到云端的自动驾驶软件中,用于高级端到端感知、推理和运动规划。
Alpamayo 1 的训练数据包含因果链(CoC)推理轨迹、Cosmos-Reason 物理 AI 数据集以及 NVIDIA 内部专有自动驾驶数据的混合。
数据模态:
图像训练数据规模: 超过 10 亿张图像(来自 80,000 小时的多摄像头驾驶数据)
文本训练数据规模: 少于 10 亿 tokens(70 万条 CoC 推理轨迹加上 Cosmos-Reason 训练数据)
视频训练数据规模: 10,000 至 100 万小时(80,000 小时)
非音频、图像、文本训练数据规模: 轨迹数据:80,000 小时,采样率为 10Hz
各数据集的数据收集方法: 混合:自动/传感器(摄像头和车辆传感器)、合成(VLM 生成的推理)
各数据集的标注方法: 混合:人工(结构化 CoC 标注)、自动化(基于 VLM 的自动标注)、自动/传感器(轨迹和自车运动)
特性: 该数据集包含 80,000 小时的多摄像头驾驶视频,以及相应的自车运动和轨迹标注。 包含 700,000 条因果链(CoC)推理轨迹,为驾驶行为提供基于决策的、因果关联的解释。 内容包括来自车辆传感器(摄像头、IMU 和 GPS)的机器生成数据以及合成推理轨迹。 CoC 标注为英文,并采用结构化格式,将驾驶决策与因果因素相联系。 传感器包括 RGB 摄像头(每辆车 2-6 个)、惯性测量单元和 GPS。
链接: 专有自动驾驶测试数据集、闭环仿真、实车道路测试。
各数据集的数据收集方法: 混合:自动/传感器(真实世界驾驶数据)、合成(仿真场景)
各数据集的标注方法: 混合:自动/传感器、人工(真值验证)
特性: 该数据集涵盖多摄像头驾驶场景,特别关注罕见的长尾事件。它包括具有挑战性的情况,如复杂交叉路口、加塞、行人交互以及恶劣天气条件。数据从 RGB 摄像头和车辆传感器收集。
链接: 与测试数据集相同。
数据集的数据收集方法: 混合:自动/传感器(真实驾驶数据)、合成(模拟场景)
数据集的标注方法: 混合:自动/传感器、人工(真值验证)
特性: 评估侧重于罕见的长尾场景,包括复杂交叉路口、行人过街、车辆加塞以及具有挑战性的天气和光照条件。多摄像头传感器数据从RGB摄像头收集。
定量评估基准:
加速引擎: PyTorch、Hugging Face Transformers
测试硬件:
有关模型推理的脚本,请查看我们的代码仓库。
NVIDIA 认为可信 AI 是一项共同的责任,我们已制定相关政策和实践,以支持广泛的 AI 应用开发。当按照我们的服务条款下载或使用时,开发人员应与其内部模型团队合作,确保该模型满足相关行业和用例的要求,并解决意外的产品误用问题。
请在此链接报告模型质量、风险、安全漏洞或 NVIDIA AI 相关问题。
📣 使用问题:发布于 Alpamayo NV 开发者论坛。
🐛 代码错误/文档问题/功能请求:使用适当的模板(错误报告、文档请求或功能请求)在 https://github.com/NVlabs/alpamayo/issues/new/choose 提交 GitHub issue。相关的 NVIDIA 响应人员将被自动分配。
🚨 安全漏洞:请使用 NVIDIA 漏洞披露计划。不要提交公开 issue。
(注意:此模型的 HuggingFace 社区标签将于2026年7月31日停用。请使用上述渠道。)