Sample-Efficient RL

RL: Reinforcement Learning

Momentum

12 papers in the last four weeks, up 140% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 168

All topics
CardsList
  1. Reflex: Reinforcement Learning with Reflection Symmetry Exploitation in State-Based Continuous Control

    May 22, 2026Shuai Zhen, Yifan Zhang, Yuling Wang +1RL ControlReinforcement Learning

  2. Pure Exploration for a Good Policy in Reinforcement Learning with Bandit Feedback

    May 22, 2026Zitian Li, Wang Chi CheungReinforcement LearningRL Exploration

  3. Dreaming Smoothly and Sample Efficiently with Gradient Penalized Latent Dynamics

    May 21, 2026Romil V. Sonigra, P. R. KumarLatent Dynamics ModelingJacobian Regularization

  4. On the Sample Complexity of Discounted Reinforcement Learning with Optimized Certainty Equivalents

    May 20, 2026Oliver Mortensen, Mohammad Sadegh TalebiReinforcement LearningRisk-Sensitive RL

  5. Reinforcement Learning-based Control via Y-wise Affine Neural Networks: Comparative Case Studies for Chemical Processes

    May 20, 2026Austin Braniff, Yuhe TianRL ControlFeedback Control

  6. ReversedQ: Opportunities for Faster Q-Learning in Episodic Online Reinforcement Learning

    May 20, 2026Sofia R. Miskala-Dinc, Aviva PrinsReinforcement LearningQ-Learning

  7. Sampling-Based Safe Reinforcement Learning

    May 19, 2026Luca Vignola, Bruce D. Lee, Manish Prajapat +4Robot SafetySafe RL

  8. When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR

    May 19, 2026Yuchun Miao, Sen Zhang, Yuqi Zhang +4RL for Language Model ReasoningPolicy Optimization

  9. RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuning

    May 18, 2026Ehsan Ahmadi, Hunter Schofield, Behzad Khamidehi +5Multi-Agent SystemsAutonomous Driving Simulation

  10. COOPO: Cyclic Offline-Online Policy Optimization Algorithm

    May 18, 2026Qisai Liu, Zhanhong Jiang, Joshua Russell Waite +3Offline RLSample-Efficient RL

  11. Privacy Preserving Reinforcement Learning with One-Sided Feedback

    May 18, 2026Lin William Cong, Guangyan Gan, Hanzhang Qin +1Reinforcement LearningPartially Observable RL

  12. EfficientTDMPC: Improved MPC Objectives for Sample-Efficient Continuous Control

    May 15, 2026Thomas Evers, Cristian Meo, Wendelin Bohmer +2Model Predictive ControlContinuous Control

  13. Addressing Terminal Constraints in Data-Driven Demand Response Scheduling

    May 14, 2026Maximilian Bloor, Martha White, Ehecatl Antonio del Rio Chanona +1Hierarchical RLCredit Assignment in RL

  14. R2R2: Robust Representation for Intensive Experience Reuse via Redundancy Reduction in Self-Predictive Learning

    May 13, 2026Sanghyeob Song, Donghyeok Lee, Jinsik Kim +1Reinforcement LearningSelf-Supervised Learning

  15. Tight Sample Complexity Bounds for Entropic Best Policy Identification

    May 13, 2026Amer Essakine, Claire VernadeReinforcement LearningRisk-Sensitive RL

  16. Achieving ε−2ε^{-2} Sample Complexity for Single-Loop Actor-Critic under Minimal Assumptions

    May 13, 2026Ishaq Hamza, Zaiwei ChenPolicy GradientLast-Iterate Convergence

  17. Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation

    May 12, 2026Yuwei Zhang, Sha Li, Changlong Yu +9Continual Learning for LLMsSelf-Distillation

  18. TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

    May 12, 2026Matthew M. Hong, Jesse Zhang, Anusha Nagabandi +1Robot Policy AdaptationRobot Skill Learning

  19. Debiased Model-based Representations for Sample-efficient Continuous Control

    May 12, 2026Jiafei Lyu, Zichuan Lin, Scott Fujimoto +5Representation LearningContinuous Control

  20. XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies

    May 11, 2026Daniel Palenicek, Florian Vogt, Joe Watson +3Robotic RLLearning from Demonstration

  21. When Does Non-Uniform Replay Matter in Reinforcement Learning?

    May 11, 2026Michal Korniak, Mikołaj Czarnecki, Yarden As +3Experience ReplaySample-Efficient RL

  22. The Value of Mechanistic Priors in Sequential Decision Making

    May 11, 2026Itai Shufaro, Gal Benor, Shie MannorMulti-Armed BanditsSequential Decision Making

  23. From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay

    May 10, 2026Yanan Xiao, Yixiang Tang, Zechen Feng +3Reinforcement LearningExperience Replay

  24. DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation

    May 9, 2026Yang Zhou, Can Jin, Zihan Dong +7Reinforcement LearningRL for Language Model Reasoning

  25. Actor-Critic with Active Importance Sampling

    May 8, 2026Majid Molaei, Gabor Paczolay, Matteo Papini +2Reinforcement LearningPolicy Gradient Methods

  26. Beyond the Independence Assumption: Finite-Sample Guarantees for Deep Q-Learning under ττ-Mixing

    May 7, 2026Leon Halgryn, Sophie Langer, Janusz M. Meylahn +1Reinforcement LearningDeep Q-Learning

  27. Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR

    May 7, 2026Chaoli Mou, Zhan Zhuang, Xinning Chen +1RL for Language Model ReasoningCredit Assignment in RL

  28. A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration

    May 7, 2026Manuel Haussmann, Mustafa Mert Çelikok, Melih KandemirReinforcement LearningQ-Learning

  29. Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning

    May 6, 2026Alper Kamil Bozkurt, Xiaoan Xu, Shangtong Zhang +2Sequential Decision MakingRL Fine-Tuning