Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Revisiting Adam for Streaming Reinforcement Learning

    May 7, 2026Florin Gogianu, Adrian Catalin Lutu, Razvan PascanuDistributional RLReinforcement Learning

  2. Sequential Design of Genetic Circuits Under Uncertainty With Reinforcement Learning

    May 7, 2026Michal Kobiela, Diego A. Oyarzún, Michael U. GutmannReinforcement LearningModel-Based RL

  3. On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR

    May 7, 2026Hao Ye, Jisheng Dang, Junfeng Fang +7Reinforcement LearningReinforcement Learning with Verifiable Rewards

  4. Operator-Guided Invariance Learning for Continuous Reinforcement Learning

    May 7, 2026Zuyuan Zhang, Fei Xu Yu, Tian LanReinforcement LearningContinuous-Time RL

  5. The Causally Emergent Alignment Hypothesis: Causal Emergence Aligns with and Predicts Final Reward in Reinforcement Learning Agents

    May 7, 2026Federico Pigozzi, Michael LevinReinforcement Learning

  6. Beyond the Independence Assumption: Finite-Sample Guarantees for Deep Q-Learning under ττ-Mixing

    May 7, 2026Leon Halgryn, Sophie Langer, Janusz M. Meylahn +1Reinforcement LearningDeep Q-Learning

  7. On Training in Imagination

    May 7, 2026Nadav Timor, Ravid Shwartz-Ziv, Micah Goldblum +2Reward ModelingReinforcement Learning

  8. AdaGamma: State-Dependent Discounting for Temporal Adaptation in Reinforcement Learning

    May 7, 2026Yaomin Wang, Jianting Pan, Ran Tian +4Reinforcement LearningTemporal-Difference Learning

  9. Unifying Goal-Conditioned RL and Unsupervised Skill Learning via Control-Maximization

    May 7, 2026Alireza Modirshanechi, Benjamin Eysenbach, Peter Dayan +1Reinforcement LearningAgent Skill Learning

  10. Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs

    May 7, 2026Yujia Chen, Yang Ye, Xiao Chu +2RL for Code GenerationReinforcement Learning

  11. Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer

    May 7, 2026Yongyi Wang, Hanyu Liu, Lingfeng Li +6Efficient Transformer InferenceReinforcement Learning

  12. Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark

    May 7, 2026Cristiano da Costa Cunha, Ajmal Mian, Tim French +1RL BenchmarksStructural Causal Models

  13. Measuring Learning Progress via Gradient-Momentum Coupling

    May 7, 2026Samuel Blad, Martin Längkvist, Amy LoutfiReinforcement LearningIntrinsic Motivation

  14. Reward Shaping and Action Masking for Compositional Tasks using Behavior Trees and LLMs

    May 7, 2026Nicholas Potteiger, Ankita Samaddar, Taylor T. Johnson +1Reinforcement LearningReward Shaping

  15. A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration

    May 7, 2026Manuel Haussmann, Mustafa Mert Çelikok, Melih KandemirReinforcement LearningQ-Learning

  16. Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement

    May 7, 2026Haodong Liang, Lifeng LaiReinforcement LearningTransformer-Based RL

  17. LANTERN: LLM-Augmented Neurosymbolic Transfer with Experience-Gated Reasoning Networks

    May 6, 2026Mahyar Alinejad, Yue Wang, Amrit Singh Bedi +1Reinforcement LearningLLM-Guided RL

  18. Hidden States as Value Gradients: The Pontryagin Structure of Recurrent Policies

    May 6, 2026David Leeftink, Max Hinne, Marcel van GervenRL ControlReinforcement Learning

  19. LineRides: Line-Guided Reinforcement Learning for Bicycle Robot Stunts

    May 6, 2026Seungeun Rho, Shamel Fahmi, Jeonghwan Kim +3Reinforcement LearningRobot Skill Learning

  20. Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers

    May 6, 2026Senkang Hu, Yong Dai, Xudong Han +4Agentic RLReinforcement Learning

  21. Modular Reinforcement Learning For Cooperative Swarms

    May 6, 2026Erel Shtossel, Gal A. KaminkaMulti-Robot SystemsReinforcement Learning

  22. A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs

    May 6, 2026Erel Shtossel, Alicia Vidler, Uri Shaham +1Non-Stationary RLReinforcement Learning

  23. SPHERE: Mitigating the Loss of Spectral Plasticity in Mixture-of-Experts for Deep Reinforcement Learning

    May 6, 2026Lirui Luo, Guoxi Zhang, Hongming Xu +2Loss of PlasticityReinforcement Learning

  24. Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation

    May 6, 2026Akiyoshi Tomihari, Issei SatoReinforcement LearningKL-Regularized RL

  25. CRAFT: Counterfactual-to-Interactive Reinforcement Fine-Tuning for Driving Policies

    May 6, 2026Keyu Chen, Nanfei Ye, Yida Wang +4Reinforcement LearningAutonomous Driving Planning