Sample-Efficient RL

RL: Reinforcement Learning

Momentum

12 papers in the last four weeks, up 140% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 166

All topics
CardsList
  1. Can Jev be Your Q or Policy in Reinforcement Learning?

    Oct 8, 2026Yi Ma, Tianpei Yang, Yaodong Yang +2LLM-Guided RLSample-Efficient RL

  2. A Closed-Loop Non-Asymptotic Convergence Analysis of PPO with Learned Critics and Clipping

    Oct 7, 2026Junwei Su, Mengfan Liu, Yanyong Zhang +1Proximal Policy OptimizationActor-Critic Methods

  3. Ask the Expert: LLM-Guided Reinforcement Learning for Autonomous Cyber Defense

    Oct 7, 2026Fernando Martinez, Abhishek Satyam, Tao Li +3Autonomous Cyber DefenseLLM-Guided RL

  4. Adaptive Expert Guidance for Efficient On-Policy Reinforcement Learning

    Oct 5, 2026Daniele Affinita, Ming Xu, Rudolf Reiter +2Sample-Efficient RL

  5. Reusing Past Samples in Proximal Policy Optimization: When and How Does It Help?

    Oct 1, 2026Alessandro Montenegro, Riccardo Venturelli, Marco Mussi +2Experience ReplayProximal Policy Optimization

  6. OPTS-TTPO: Enhancing Finite-Sample Policy-Gradient Learning with Tree Search

    Sep 30, 2026Junyu Lu, Shichao Weng, Zhiqiang Wang +10Tree SearchPolicy Gradient Methods

  7. Fast Regularized Policy Mirror Descent with One-Step TD Updates

    Sep 30, 2026Qipei Chen, Wenye Li, Yule Sun +1Markov Decision ProcessesPolicy Optimization

  8. SERA: Scale-Equalized Rollout Allocation for Maximum Likelihood Reinforcement Learning

    Sep 29, 2026Zihao Chen, Fanxiang Xiong, Hongran Ren +6Reinforcement LearningRL for Language Model Reasoning

  9. Provable Benefits of Regularization: Fast Rates for Adversarial Imitation Learning

    Sep 28, 2026Hanbin Zhou, Shangzhe Li, Alexander Braverman +1Reinforcement LearningAdversarial Imitation Learning

  10. TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs

    Sep 27, 2026Zihan Lin, Xiaohan Wang, Jie Cao +4RL for Language ModelsRL for Language Model Reasoning

  11. Correcting Within-Group Self-Selection Bias in Prioritized Replay

    Sep 21, 2026Oscar Miró López-Feliu, Herke van HoofReinforcement LearningSample-Efficient RL

  12. Efficient Bayes-Adaptive Reinforcement Learning with Temporal Logic Specifications

    Sep 17, 2026Jonathan Hau, Alessandro AbateBayesian RLSafe RL

  13. Groupoid-Based Internal State Representations for Reinforcement Learning with Local Symmetries

    Sep 14, 2026Ben Opperman, Eduardo Alonso, Esther MondragónReinforcement LearningState Representation Learning

  14. ThinkPrior: Zero-Rollout Difficulty Priors for Cold-Start Prompt Selection in RLVR

    Sep 8, 2026Tommy Sha, Skylar Zhai, Siqi ZhaoRL for Language Model ReasoningGroup Relative Policy Optimization

  15. Stable-MM-R1: Anchoring Multimodal Reasoning Dynamics via Entropy-Guided Stratification

    Sep 7, 2026Yimeng Ye, Shuang Chen, Wenxuan Huang +8Reinforcement LearningRL Fine-Tuning

  16. Robust PAC Learning of Concurrent Stochastic Games

    Sep 3, 2026Angel Y. He, David ParkerGame TheoryRobust RL

  17. Provably Safe Sim-to-Real Transfer

    Sep 1, 2026Tingting Ni, Maryam KamgarpourReinforcement LearningSim-to-Real Transfer

  18. IADD-TR: Intervention-Aware Dynamics Decoupling with Targeted Regularization for Model-Based Reinforcement Learning

    Aug 11, 2026Zefeng Liang, Jie Qiao, Ruichu Cai +2Reinforcement LearningRobust RL

  19. Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

    Aug 10, 2026Ting Zhou, Zhenqing Ling, Daoyuan Chen +4Reinforcement LearningRL for Language Model Reasoning

  20. V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control

    Aug 8, 2026Donghu Kim, Youngdo Lee, Hojoon Lee +6Reinforcement LearningVisual RL

  21. Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control

    Aug 7, 2026Qi Zhao, Guozheng Ma, Yilun Kong +9Reinforcement LearningExperience Replay

  22. Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions

    Aug 6, 2026Yuepeng Yang, Yuxin Chen, Yuejie ChiRobust Markov Decision ProcessesAverage-Reward RL

  23. ProDVI: Programmatic Dynamics Priors for Value Network Initialization

    Aug 6, 2026Xinwei Liu, Junyuan Liang, Jianting Zhang +1Reinforcement LearningLLM-Guided RL

  24. Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning

    Aug 4, 2026Subrat Prasad Panda, Blaise Genest, Arvind EaswaranReinforcement LearningSymbolic Planning

  25. Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification

    Jul 31, 2026Anders Jonsson, Emilie Kaufmann, Gianmarco Tedeschi +1Hierarchical RLPolicy Learning

  26. Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity

    Jul 30, 2026Naman Saxena, Mudit Gaur, Vaneet AggarwalReinforcement LearningBilevel Optimization