凤
weixin_44093752/x-vla-pt-ascend-npu
模型介绍
文件和版本
Pull Requests
讨论
分析

X-VLA-Pt Ascend NPU 冒烟适配

本次交付跟踪线上 2toINF/X-VLA-Pt 检查点以及官方 2toINF/X-VLA 实现:

  • 模型:https://huggingface.co/2toINF/X-VLA-Pt
  • 版本:c1c4a64a7e03ac5b95c468bf1578f3d03651b53b
  • 来源:https://github.com/2toinf/X-VLA
  • 来源版本:6bc2513f5f1cbec715cc668b414392a6cae5c671
  • 权重:model.safetensors,3,519,068,172 字节
  • SHA-256:433acffc992f457b1737d35ae20f81a895521f38eadaf03c736b6c0b0af1c93e
  • 动作模式:ee6d,30 个动作,20 个动作/本体感知维度

inference.py 从 vendor/xvla 加载官方 XVLA 架构, 构造确定性的单视角 [1, 1, 3, 224, 224] 输入,并在 npu:0 上执行一次 去噪步骤。经验证的 Ascend910 运行加载了 932,002,392 个参数,并返回形状为 [1, 30, 20] 的有限 BF16 动作。

vendor 源码包含容器内 Transformers 5.7 运行时所需的三处小型兼容性调整:初始化缺失的 forced_bos_token_id、构造时显式设置注意力能力标志, 以及宽松的共享权重钩子。这些不会改变模型张量形状或 XVLA 前向算法。官方加载器报告了一个缺失的共享嵌入键;冒烟门禁记录该情况,而不是声称通过精度校验。

将检查点下载到本地目录后运行:

python inference.py --model-path /tmp/model-agent/xvla --device npu --output-dir validation

验收门槛为真实 Ascend NPU 执行且输出为有限值,这是本次竞赛要求达成的通过标准。它并不声称是完整的 CPU/NPU 精度验收门槛。

Model Agent CPU/NPU 工作流

Ascend NPU 设备调用

NPU 冒烟测试结果