Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Inducing Process Supervision from Outcome-Only Reinforcement Learning

    Sep 29, 2026Shengda Fan, Xin Cong, Zhong Zhang +2Reinforcement LearningProcess Reward Models

  2. SERA: Scale-Equalized Rollout Allocation for Maximum Likelihood Reinforcement Learning

    Sep 29, 2026Zihao Chen, Fanxiang Xiong, Hongran Ren +6Reinforcement LearningRL for Language Model Reasoning

  3. BRIDGE: Bilevel Retrieval-Credit-Aware Agentic Reinforcement Learning

    Sep 29, 2026Quan Xiao, Mingda Liu, Gaowen Liu +2Reinforcement LearningAgentic RAG

  4. Massively Parallel Reinforcement Learning with a Chaotic Reconfigurable Clockless Chip

    Sep 28, 2026Eric Oliveira-Gomes, Damien RontaniReinforcement LearningChaotic Dynamical Systems

  5. ChronoSRL: Temporal Geometry for Self-Supervised Reinforcement Learning

    Sep 28, 2026Nico Bohlinger, Jan PetersRL for RoboticsRepresentation Learning

  6. X-Reset: Scaling Object-Centric Reinforcement Learning via Cross-Embodiment Resets

    Sep 28, 2026Prithwish Dan, Chenyang Ma, Wei ZhanReinforcement LearningGeneralization in Robotic Manipulation

  7. Provable Benefits of Regularization: Fast Rates for Adversarial Imitation Learning

    Sep 28, 2026Hanbin Zhou, Shangzhe Li, Alexander Braverman +1Reinforcement LearningAdversarial Imitation Learning

  8. Verifier Errors in RLVR: Reward Hacking, Limits of Feedback, and Selective Control

    Sep 28, 2026Christian Moya, Elliott Thornley, Guang LinReward HackingReinforcement Learning

  9. Behavioral Foundation Models for Quality Diversity

    Sep 28, 2026Nazim Bendib, Nicolas Perrin-Gilbert, Olivier SigaudReinforcement LearningQuality-Diversity Optimization

  10. An analysis of Mirror-Descent Soft Actor-Critic

    Sep 28, 2026Denis Zorba, Michal ValkoReinforcement LearningOnline Mirror Descent

  11. Passive-Dynamic-Walking-Inspired Dynamics Guidance for Energy-Efficient Humanoid Locomotion

    Sep 28, 2026Hyeonjin Choi, Joongheon Kim, Daekyum KimHumanoid Robot LocomotionReinforcement Learning

  12. Teach to Learn: Hint Annealing for Self-improving LLM Reasoning

    Sep 28, 2026Zile Wang, Zijian Li, Haodong Wang +5Reinforcement LearningSelf-Training for Language Models

  13. Learning High-Risk High-Precision Motion Control

    Sep 28, 2026Nam Hee Kim, Markus Kirjonen, Perttu HämäläinenRobotic ControlReinforcement Learning

  14. SIPO: Selective-Inference Policy Optimization for Tree-Structured Agentic RL

    Sep 28, 2026Zenghuang Fu, Ningqi Chen, Mingda Jia +10Agentic RLReinforcement Learning

  15. Unified Trajectory Matching Policy Optimization: Diverse T2I Generation and VLA Generalization

    Sep 28, 2026Zhiyuan Ma, Jiaming Li, Lingzhen Li +7Reinforcement LearningVision-Language-Action Models

  16. FlexLoop: Depth-Elastic Looped Policies for Adaptive Test-Time Computation in Deep RL

    Sep 28, 2026Xun Wang, Ruishuo Chen, Yu Chen +2Efficient Neural Network InferenceReinforcement Learning

  17. Escaping Local Views: Discovering Latent Concepts for Interpretable Multi-Agent Reinforcement Learning

    Sep 28, 2026Yijie Sun, Sanquan Sun, Yanda Zhu +3Reinforcement LearningPartially Observable RL

  18. LLMs as Adaptive Meta-Solvers: Strategy-Diverse RL for Industrial-Scale Optimization

    Sep 28, 2026Shihao Zhang, Weiting Liu, Siyu Shao +4Algorithm SelectionReinforcement Learning

  19. Q-learning Penalized Transformer for Safe Offline Reinforcement Learning

    Sep 28, 2026Shengchao Hu, Peng Wang, Jifeng Hu +5Reinforcement LearningTransformer-Based RL

  20. DexTaG: Tactile-as-Guidance in Reinforcement Learning for Dexterous Manipulation

    Sep 27, 2026Han Yang, Yian Wang, Yunlong Song +2Reinforcement LearningContact-Rich Robotic Manipulation

  21. QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents

    Sep 27, 2026Weiqi Wang, Yuxin Zhou, Mouxiang Chen +9Reinforcement LearningLong-Horizon Agent Tasks

  22. Principal Steering Subspaces for Online Adaptation of Frozen Generative Robot Policies

    Sep 27, 2026Jialeng Ni, Nathan Zhao, Kunpeng SongRobot Policy LearningReinforcement Learning

  23. DuraS2ST: Chain-of-Thought and Reinforcement Learning for Duration-Aligned Speech-to-Speech Translation

    Sep 27, 2026Yayue Deng, Dingdong Wang, Yuxuan Hu +7Speech TranslationReinforcement Learning

  24. GTRL: Grounding Divide-and-Conquer Value Learning with Temporal Differences

    Sep 27, 2026Abdul Monaf Chowdhury, MD Sameer Iqbal Chowdhury, Shifat E Arman +1Reinforcement LearningTemporal-Difference Learning

  25. Search-Aware Reinforcement Learning for Multi-Component Query Understanding in Roblox Game Search

    Sep 24, 2026Nayoung Choi, Shengjian Chen, Xiaokai Wei +6Reinforcement LearningRL for IR

  26. Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

    Sep 24, 2026Ruoqi Guo, Yi Liu, Gelei Deng +6LLM Safety BenchmarksLLM Alignment

  27. Right Choice of Classification Algorithms Based on Reinforcement Learning for Prediction of Non-Alcoholic Fatty Liver

    Sep 24, 2026Hasan Samadbin, Arman DaliriAlgorithm SelectionReinforcement Learning

  28. An Analysis of Streaming Deep Reinforcement Learning for Adaptive Continual Learning in Robotics

    Sep 23, 2026Teeratham Vitchutripop, Alyssa Quarles, Wenhe Zhang +2Reinforcement LearningContinual Robot Learning

  29. Reinforcement Learning with Verifiable Rewards for Small Search Agents

    Sep 23, 2026Gaurisankar Jayadas, Aske Plaat, Álvaro Serra-Gómez +1Reinforcement LearningReinforcement Learning with Verifiable Rewards