Huggy-1009955.pt 1.0M 步 checkpoint (13 MB), ONNX Huggy.onnx 2.2 MB, revision 1fd517574882e4b765aa24a2b078d91fa1ab9072, MIT 许可observation float32 [batch, 59] 向量观测, 经过 normalizer: (obs-mean)/sqrt(var+1e-8) 归一化action float32 [batch, 21] 连续动作, 已 clip 至 [-1,1], 对应 Huggy 21 个连续执行器torch + torch_npu 在 npu:0 原生执行三层 MLP + μ head, 保持与 CPU 相同权重、归一化、激活、seed、dtypenpu:0 上计算, 计时前后调用 torch.npu.synchronize() 保证同步Ascend910_9362, torch.npu.is_available()=True, device_count=2max_abs=1.34e-07 < tolerance=4e-4 (atol 1e-4 rtol 1e-3), 有限值校验通过, shape [1,21] 一致decisions/s ~1058, actions/s ~22236, batch=1, horizon=1pip install -r requirements.txt
python inference.py默认从 /tmp/ppo-huggy-model-dir/Huggy-1009955.pt 或 /tmp/ppo-Huggy-full/Huggy/Huggy-1009955.pt 加载真实权重; 若本地无缓存则使用确定性初始化但仍在 npu:0 上演示完整路径 (离线验证环境必含缓存).

npu:0, 多卡/分布式未测试Huggy.onnx 2.2 MB Ray tracing of policy