本次交付跟踪线上 2toINF/X-VLA-Pt 检查点以及官方
2toINF/X-VLA 实现:
c1c4a64a7e03ac5b95c468bf1578f3d03651b53b6bc2513f5f1cbec715cc668b414392a6cae5c671model.safetensors,3,519,068,172 字节433acffc992f457b1737d35ae20f81a895521f38eadaf03c736b6c0b0af1c93eee6d,30 个动作,20 个动作/本体感知维度inference.py 从 vendor/xvla 加载官方 XVLA 架构,
构造确定性的单视角 [1, 1, 3, 224, 224] 输入,并在 npu:0 上执行一次
去噪步骤。经验证的 Ascend910 运行加载了 932,002,392
个参数,并返回形状为 [1, 30, 20] 的有限 BF16 动作。
vendor 源码包含容器内 Transformers 5.7 运行时所需的三处小型兼容性调整:初始化缺失的
forced_bos_token_id、构造时显式设置注意力能力标志,
以及宽松的共享权重钩子。这些不会改变模型张量形状或
XVLA 前向算法。官方加载器报告了一个缺失的共享嵌入键;冒烟门禁记录该情况,而不是声称通过精度校验。
将检查点下载到本地目录后运行:
python inference.py --model-path /tmp/model-agent/xvla --device npu --output-dir validation验收门槛为真实 Ascend NPU 执行且输出为有限值,这是本次竞赛要求达成的通过标准。它并不声称是完整的 CPU/NPU 精度验收门槛。


