PPO-CartPole-v1 是一个使用 PPO 算法在 CartPole-v1 环境上训练得到的强化学习策略模型,由 stable-baselines3 训练。
MlpPolicy(2 层 64 维 MLP)ppo-CartPole-v1.zip(139KB)| 组件 | 版本 | 说明 |
|---|---|---|
| torch | 2.9.0+cpu | PyTorch |
| torch_npu | 2.9.0.post1 | 昇腾 NPU 插件 |
| stable-baselines3 | 2.9.0 | RL 框架 |
| gymnasium | 1.3.0 | 环境模拟 |
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
python3 inference.pyEpisode 1: reward=500, steps=500, time=1147ms
Episode 2: reward=500, steps=500, time=968ms
Episode 3: reward=500, steps=500, time=972ms
Episode 4: reward=500, steps=500, time=968ms
Episode 5: reward=500, steps=500, time=971ms验收结论:PPO 策略在 NPU 上推理正确,稳定达到最大奖励 500。