Sample-Efficient RL

RL: Reinforcement Learning

Momentum

12 papers in the last four weeks, up 140% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 168

All topics
CardsList
  1. Counter-Dyna: Data-Efficient RL-Based HVAC Control using Counterfactual Building Models

    May 6, 2026Jan Marco Ruiz de Vargas, Fabian Raisch, Zoltan Nagy +2Neural Surrogate ModelingBuilding Energy Management

  2. Data-dependent Exploration for Online Reinforcement Learning from Human Feedback

    May 6, 2026Zhen-Yu Zhang, Yuting Tang, Jiandong Zhang +2RL ExplorationSample-Efficient RL

  3. Optimal Posterior Sampling for Policy Identification in Tabular Markov Decision Processes

    May 5, 2026Cyrille Kone, Kevin JamiesonThompson SamplingMarkov Decision Processes

  4. Taming the Curses of Multiagency in Robust Markov Games with Large State Space through Linear Function Approximation

    May 4, 2026Jingchu Gai, Laixi ShiMulti-Agent System OptimizationMarkov Models

  5. Do We Really Need Immediate Resets? Rethinking Collision Handling for Efficient Robot Navigation

    May 4, 2026Shanze Wang, Xinming Zhang, Siwei Cheng +4RL for RoboticsRobot Navigation

  6. Dynamics Distillation for Efficient and Transferable Control Learning

    May 2, 2026Xunjiang Gu, Kashyap Chitta, Mahsa Golchoubian +2Vehicle DynamicsTransfer Learning

  7. Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs

    May 2, 2026Ruiquan Huang, Donghao Li, Yingbin Liang +1Markov Decision ProcessesReinforcement Learning

  8. E2^2DT: Efficient and Effective Decision Transformer with Experience-Aware Sampling for Robotic Manipulation

    Apr 30, 2026Kaiyan Zhao, Borong Zhang, Yiming Wang +4Long-Horizon Robotic ManipulationTransformer

  9. Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning

    Apr 30, 2026Shijin Gong, Kai Ye, Jin Zhu +3Value Function EstimationRL for Language Model Reasoning

  10. Rule-based High-Level Coaching for Goal-Conditioned Reinforcement Learning in Search-and-Rescue UAV Missions Under Limited-Simulation Training

    Apr 29, 2026Mahya Ramezani, Holger VoosReinforcement LearningUAV Navigation

  11. Sample-efficient Neuro-symbolic Proximal Policy Optimization

    Apr 28, 2026Simone Murari, Celeste Veronese, Daniele MeliReinforcement LearningProximal Policy Optimization

  12. Replay-buffer engineering for noise-aware quantum circuit optimization

    Apr 23, 2026Akash Kundu, Sebastian FeldReinforcement LearningExperience Replay

  13. Distributional Value Estimation Without Target Networks for Robust Quality-Diversity

    Apr 22, 2026Behrad Koohy, Jamie BayneDistributional RLReinforcement Learning

  14. Planning in entropy-regularized Markov decision processes and games

    Apr 21, 2026Jean-Bastien Grill, Omar Darwiche Domingues, Pierre Ménard +2Value Function EstimationMarkov Models

  15. Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes

    Apr 20, 2026Justin Bauer, Thomas Walshe, Derek Pham +4RL for Language Model ReasoningSmall Language Models

  16. Scale-free adaptive planning for deterministic dynamics & discounted rewards

    Apr 20, 2026Peter L. Bartlett, Victor Gabillon, Jennifer Healey +1Markov Decision ProcessesModel-Based Planning

  17. Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

    Apr 18, 2026Weiyu Ma, Yongcheng Zeng, Yan Song +4Reinforcement LearningRL Post-Training

  18. Sample Complexity Bounds for Stochastic Shortest Path with a Generative Model

    Apr 17, 2026Jean Tarbouriech, Matteo Pirotta, Michal Valko +1Markov Decision ProcessesPolicy Learning

  19. Blazing the trails before beating the path: Sample-efficient Monte-Carlo planning

    Apr 16, 2026Jean-Bastien Grill, Michal Valko, Rémi MunosMarkov Decision ProcessesMarkov Models

  20. Value Mirror Descent for Reinforcement Learning

    Apr 7, 2026Zhichao Jia, Guanghui LanMarkov Decision ProcessesReinforcement Learning

  21. TRACE: Capability-Targeted Agentic Training

    Apr 7, 2026Hangoo Kang, Tarun Suresh, Jon Saad-Falcon +1LLM Agent Self-ImprovementAgent Skill Learning

  22. Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching

    Mar 27, 2026Andrea Fraschini, Davide Tenedini, Riccardo Zamboni +2RL ControlDistribution Matching

  23. Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model

    Mar 26, 2026Jiahao Wu, Ning Lu, Shengcai Liu +6RL for Language ModelsSample-Efficient RL

  24. Complementary RL: Towards Efficient Experience-Driven Agent Learning

    Mar 18, 2026Dilxat Muhtar, Jiashun Liu, Wei Gao +8Reinforcement LearningSample-Efficient RL

  25. GIPO: Gaussian Importance Sampling Policy Optimization

    Mar 4, 2026Chengxuan Lu, Zhenquan Zhang, Shukuan Wang +3Reinforcement LearningRL Post-Training

  26. VLM-Guided Experience Replay

    Feb 2, 2026Elad Sharony, Tom Jurgenson, Orr Krupnik +2Reinforcement LearningSample-Efficient RL