资讯动态

CleanRL 中基于 EnvPool XLA 与 JAX 的 PPO Atari 训练运行时基准评测全解析

发布时间:2026/9/15 18:02:13 来源:尧图企业网站定制
CleanRL 中基于 EnvPool XLA 与 JAX 的 PPO Atari 训练运行时基准评测全解析【免费下载链接】cleanrlHigh-quality single file implementation of Deep Reinforcement Learning algorithms with research-friendly features (PPO, DQN, C51, DDPG, TD3, SAC, PPG)项目地址: https://gitcode.com/GitHub_Trending/cl/cleanrl本篇技术指南聚焦于 CleanRL 仓库中 docs/benchmark/ppo_atari_envpool_xla_jax_runtimes.md 所记录的PPO EnvPool XLA JAX组合在 57 个 Atari-v5 环境上的运行时Runtimes基准数据——即以完成全部训练所需的实际挂钟时间wall-clock minutes为度量将ppo_atari_envpool_xla_jax.py与 openai/baselines 的 PPO2-CNN 基线进行逐游戏对比。读完本文你将理解这份表格如何解读、运行时数据对应的训练配置与复现命令、以及如何用仓库内的 benchmark 脚本与可视化工具自行复现和验证。一、数据表格解读挂钟分钟数作为运行效率度量原文档的核心是一张运行时对比表横向两列分别对应两个实现纵向是 57 个 Atari 游戏环境*-v5即使用gymAPI 的 EnvPool Atari 环境表格中的数字是完成训练所花费的挂钟时间以分钟为单位。该表用于回答一个关键工程问题在拿到相近的样本效率return的前提下哪套实现能以更短的墙钟时间完成训练。二、为什么运行时会快EnvPool 的 C 向量化与 XLA 接口三、运行时基准的实验设置与复现命令四、运行时数据完整 57 环境对照表环境CleanRL ppo_atari_envpool_xla_jax (min)openai/baselines PPO2-CNN (min)Alien-v550.33117.40Amidar-v542.82114.09Assault-v535.92108.09Asterix-v537.71113.39Asteroids-v539.97114.41Atlantis-v540.15123.05BankHeist-v538.74137.31BattleZone-v545.07138.49BeamRider-v542.08119.44Berzerk-v538.72135.32Bowling-v535.02131.37Boxing-v548.81151.61Breakout-v542.35122.83Centipede-v543.69150.11ChopperCommand-v545.93131.19CrazyClimber-v536.08127.94Defender-v535.10132.29DemonAttack-v535.41128.48DoubleDunk-v541.45108.03Enduro-v544.99142.05FishingDerby-v551.61151.29Freeway-v550.71154.16Frostbite-v547.55146.09Gopher-v536.30139.50Gravitar-v541.93138.75Hero-v550.51152.41IceHockey-v543.02144.46Jamesbond-v538.83137.32Kangaroo-v544.43142.44Krull-v547.77147.31KungFuMaster-v543.15141.90MontezumaRevenge-v544.88146.78MsPacman-v542.65138.38NameThisGame-v543.85136.26Phoenix-v536.76129.72Pitfall-v544.64137.36Pong-v536.77118.75PrivateEye-v543.34143.96Qbert-v540.15135.26Riverraid-v544.26142.63RoadRunner-v546.11145.45Robotank-v548.34149.68Seaquest-v538.36136.94Skiing-v538.64132.06Solaris-v550.29136.90SpaceInvaders-v539.49125.83StarGunner-v533.71119.18Surround-v533.92132.02Tennis-v539.6297.02TimePilot-v537.01130.69Tutankham-v536.97139.69UpNDown-v552.99140.88Venture-v537.98144.24VideoPinball-v547.17179.87WizardOfWor-v537.58142.09YarsRevenge-v536.59127.36Zaxxon-v541.98133.92运行时间解读要点在所有 57 个环境上ppo_atari_envpool_xla_jax的挂钟耗时均显著低于 openai/baselines 的 PPO2-CNN耗时最短的环境为 StarGunner-v533.71 分钟与 Surround-v533.92 分钟最长的为 UpNDown-v552.99 分钟与 FishingDerby-v551.61 分钟。耗时差异最小的环境是 Tennis-v539.62 vs 97.02约 2.45 倍差异最大的为 YarsRevenge-v536.59 vs 127.36约 3.5 倍与 VideoPinball-v547.17 vs 179.87约 3.8 倍。平均而言xla_jax 实现约为 PPO2-CNN 耗时的 1/3 左右这正是 EnvPool 向量化环境 JAX 端到端 XLA 编译带来的收益。五、运行时数据与样本效率数据的配合阅读50/57 的环境上 CleanRL 的 return 更高或相当如 Assault-v5、Asterix-v5、Atlantis-v5、ChopperCommand-v5、DemonAttack-v5、Enduro-v5、Qbert-v5、YarsRevenge-v5、UpNDown-v5 等即“更快的同时还更强”。少数环境上 CleanRL 低于基线如 Alien-v5、BankHeist-v5、Kangaroo-v5 等但差距不大属于正常随机波动范畴。结论运行时与样本效率两张表格结合来看ppo_atari_envpool_xla_jax以约 1/3 的挂钟时间取得与经典实现相当甚至更高的 return是规模化 Atari 研究的首选配置之一。六、结论阅读 docs/benchmark/ppo_atari_envpool_xla_jax_runtimes.md主算法文档 docs/rl-algorithms/ppo.md 中的ppo_atari_envpool_xla_jax.py章节运行命令、实现细节、注意事项样本效率对照表 docs/benchmark/ppo_atari_envpool_xla_jax.md基准复现脚本 benchmark/ppo.sh算法源码 cleanrl/ppo_atari_envpool_xla_jax.py资源需求 requirements/requirements-envpool.txt 与 requirements/requirements-jax.txt最后提醒ppo_atari_envpool_xla_jax.py依赖 EnvPool 的 XLA 接口官方文档明确说明该实现不适用于 Windows 与 macOS请在 Linux 环境推荐 NVIDIA GPU CUDA下运行以获得上述性能。【免费下载链接】cleanrlHigh-quality single file implementation of Deep Reinforcement Learning algorithms with research-friendly features (PPO, DQN, C51, DDPG, TD3, SAC, PPG)项目地址: https://gitcode.com/GitHub_Trending/cl/cleanrl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价