Y
gcw_hhrLdMXW/ppo-cartpole-v1
模型介绍
文件和版本
Pull Requests
讨论
分析

humancompatibleai/ppo-CartPole-v1 昇腾 NPU 部署文档

1. 模型简介

PPO-CartPole-v1 是一个使用 PPO 算法在 CartPole-v1 环境上训练得到的强化学习策略模型,由 stable-baselines3 训练。

  • 架构:MlpPolicy(2 层 64 维 MLP)
  • 参数:约 9K
  • 输入:4 维观测(位置/速度/角度/角速度)
  • 输出:2 维动作(左/右)
  • 权重:ppo-CartPole-v1.zip(139KB)
  • 官方仓库:https://huggingface.co/HumanCompatibleAI/ppo-CartPole-v1

2. 环境依赖清单

组件版本说明
torch2.9.0+cpuPyTorch
torch_npu2.9.0.post1昇腾 NPU 插件
stable-baselines32.9.0RL 框架
gymnasium1.3.0环境模拟

3. 推理操作流程

pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
python3 inference.py

4. 测试用例与输出

Episode 1: reward=500, steps=500, time=1147ms
Episode 2: reward=500, steps=500, time=968ms
Episode 3: reward=500, steps=500, time=972ms
Episode 4: reward=500, steps=500, time=968ms
Episode 5: reward=500, steps=500, time=971ms

验收结论:PPO 策略在 NPU 上推理正确,稳定达到最大奖励 500。