RL Benchmarks

RL: Reinforcement Learning

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 62

All topics
CardsList
  1. Factoriax: A GPU-Accelerated Factorio-Style Simulator for Reinforcement Learning

    Oct 4, 2026Mickey Beurskens, Tristan Tomilin, Thiago D. SimãoRL BenchmarksReinforcement Learning

  2. ALER: Adaptive Learnable Experience Rewriting for Reinforcement Learning

    Sep 30, 2026Oleg Shchendrigin, Egor Cherepanov, Aleksandr I. Panov +1RL BenchmarksReinforcement Learning

  3. CATCH: A Controllable Analysis Testbed for Reward Hacking in Coding RL

    Sep 30, 2026Shouli Wang, Yanfeng Jia, Zhihao Ou +6RL BenchmarksRL for Code Generation

  4. Jaxolotl: A Unified High-Performance Benchmark Suite for LTL-Based Multi-Task RL

    Sep 29, 2026Mathias Jackermeier, Jacques Cloete, Alessandro AbateRL BenchmarksReinforcement Learning

  5. PowerMarketJax: A JAX Benchmark Suite for Multi-Agent Reinforcement Learning in Power Markets

    Sep 29, 2026Zhanhua Pan, Xin Qin, Xiao Liu +3RL BenchmarksMulti-Agent Reinforcement Learning

  6. PowerZooJax: A JAX-based Power System Benchmark for Reinforcement Learning

    Sep 28, 2026Zhanhua Pan, Xiao Liu, Zhilong Cao +2RL BenchmarksConstrained RL

  7. GlyphBench: A Playground for Language-Model Reinforcement Learning

    Sep 28, 2026Roger Creus Castanyer, Marc-Alexandre Côté, Matthew James Sargent +3RL BenchmarksRL for Language Models

  8. Evaluation Metrics for Safe Reinforcement Learning

    Sep 14, 2026Lindsay Spoor, Aske Plaat, Thomas MoerlandRL BenchmarksConstrained RL

  9. VRL-Bench: Benchmarking agents on computer control tasks under finite trial budgets

    Sep 14, 2026Yu Bai, Yukai Miao, Dawei Wang +8RL BenchmarksReinforcement Learning

  10. Sim2Signal: Sim-to-Real Benchmarks for Traffic Signal Control

    Sep 1, 2026Ferdous Al Rafi, Susrik Mukherjee, Latika Liladhar Dekate +6RL BenchmarksSim-to-Real Transfer

  11. Chronocooked: A Benchmark for Interval Timing in Reinforcement Learning Agents

    Aug 17, 2026Amrapali Pednekar, Alvaro Garrido-Perez, Yara Khaluf +1RL Benchmarks

  12. DSLE: A Learning Environment for Dark Souls Boss Encounters

    Aug 10, 2026Derin Gezgin, Jim O'Connor, Tanner Goodwin +1RL BenchmarksGame-Playing Agents

  13. TOUR: A Trajectory-Level Unlearning Benchmark for Offline Reinforcement Learning

    Jul 23, 2026Chaofan Pan, Lingfei Ren, Xiangyu Jiang +6RL BenchmarksMembership Inference Attacks

  14. Building2Building: A Large Scale Benchmark for Generalizable Real-World Reinforcement Learning

    Jul 17, 2026Vincent Taboga, Justin Veilleux, Doseok Jang +2RL BenchmarksReinforcement Learning

  15. OOD-RL-Bench: A Benchmark Framework for Out-of-Distribution Detection in Reinforcement Learning

    Jul 14, 2026Emil Mittag, Richard Dazeley, Peter VamplewRL BenchmarksOnline Anomaly Detection

  16. Measure the Sim-to-Real Gap: Designing an Affordable Real-World Benchmark Platform for Reinforcement Learning in AIoT Systems

    Jul 11, 2026Rongping Zhou, Omid Tavallaie, Shuaijun Chen +1RL BenchmarksReinforcement Learning

  17. FootsiesGym: A Fighting Game Benchmark for Two-Player Zero-Sum Imperfect-Information Games

    Jul 7, 2026Chase McDonald, Nathan Tsang, Wesley N. KerrRL BenchmarksGame-Playing Agents

  18. EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

    Jul 2, 2026Zhilin Wang, Han Song, Runzhe Zhan +13RL BenchmarksAI Agent Benchmarks

  19. RoAd-RL: A Unified Library and Benchmark for Robust Adversarial Reinforcement Learning

    Jun 29, 2026Adithya Mohan, Daniel Kriegl, Torsten SchönRL BenchmarksReinforcement Learning

  20. Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy

    Jun 26, 2026Matthew Vandergrift, Esraa Elelimy, Martha WhiteRL BenchmarksReinforcement Learning

  21. SVGym (SciVerseGym): An Environment for Reinforcement Learning and Bayesian Optimization in Crystal Discovery

    Jun 21, 2026Bin CaoRL BenchmarksCrystal Structure Generation

  22. The Two-Hump Problem: Bridging the Difficulty Gap in Mathematical Reinforcement Learning

    Jun 19, 2026Lucas Fagan, Michele Tarquini, Ali Shehper +6RL BenchmarksReinforcement Learning

  23. CRAX: Fast Safe Reinforcement Learning Benchmarking

    Jun 18, 2026Tristan Tomilin, Mourad Boustani, Mickey Beurskens +2RL BenchmarksReinforcement Learning

  24. Insulin4RL: Real-Time Insulin Management in the Intensive Care Unit for Offline Reinforcement Learning

    Jun 17, 2026Thomas Frost, Steve HarrisRL BenchmarksOffline RL

  25. A Unified Benchmark for Dynamic Medical Treatment Reinforcement Learning

    May 31, 2026Yuepeng Wang, Ken Kawano, Yoshihiko Fujisawa +12RL BenchmarksReinforcement Learning

  26. Task diversity produces systematic transfer but inhibits continual reinforcement learning

    May 30, 2026Purab Seth, Neil Shah, Ishaan Sinha +4RL BenchmarksReinforcement Learning

  27. Certificate-Guided Evaluation of Reinforcement Learning Generalization

    May 30, 2026Vignesh Subramanian, Đorđe Žikelić, Suguman BansalRL BenchmarksReinforcement Learning