Sample-Efficient RL

RL: Reinforcement Learning

Momentum

12 papers in the last four weeks, up 140% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 168

All topics
CardsList
  1. Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

    Jul 28, 2026Pixel Nomand, Elena Voss, Marcus Hale +1Reinforcement LearningRL for Language Model Reasoning

  2. When Every Simulation Counts: Value-Based Reinforcement Learning for Accelerated Photonics Inverse Design

    Jul 26, 2026Longying Wen, Feiyang Wu, Jinglin Yu +3Deep Q-LearningSample-Efficient RL

  3. Expert Behavior Prior Reinforcement Learning

    Jul 23, 2026Gong Gao, Weidong Zhao, Xianhui Liu +1RL ControlReinforcement Learning

  4. Sample-Efficient Learning from Agent Experience

    Jul 23, 2026Chenhui Gou, Haoqin Tu, Yunhao Fang +2In-Context RLLanguage Model Distillation

  5. Theoretical Foundations of max⁡\max@kk Reinforcement Learning

    Jul 20, 2026Riccardo Poiani, Martino Bernasconi, Andrea CelliReinforcement LearningPolicy Learning

  6. Rethinking the Suitability of Reinforcement Learning Algorithms Under Practical Transfer Constraints

    Jul 19, 2026Hany Hamed, Abhishek Naik, Colin Bellinger +1Domain RandomizationReinforcement Learning

  7. Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning

    Jul 19, 2026Joseph Lazzaro, Alessio Russo, Aldo PacchianoMarkov Decision ProcessesRL Exploration

  8. Lighthouse RL: Sample-Efficient Circuit Optimization via Strategic Reset Points

    Jul 15, 2026Mustafa Emre Gürsoy, Stefan Uhlich, Ryoga Matsuo +6Reinforcement LearningBlack-Box Optimization

  9. Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning

    Jul 15, 2026Bowei He, Yankai Chen, Xiaokun Zhang +1Reinforcement LearningPolicy Gradient Methods

  10. Factorized Spectral Representations for Reinforcement Learning

    Jul 15, 2026Junyi Wu, Dan LiTensor DecompositionRepresentation Learning for RL

  11. ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning

    Jul 14, 2026Yilun Kong, Yunpeng Qing, Guozheng Ma +4RL ExplorationRobotic Manipulation

  12. Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes

    Jul 14, 2026Jonas Ehrhardt, René Heesch, Oliver NiggemannReinforcement LearningConstrained RL

  13. Prompt-Driven Exploration

    Jul 9, 2026Sunshine Jiang, John Marangola, David Zhang +6LLM-Guided RLRL Exploration

  14. Statistical Efficiency and Inference of Quantile Distributional Reinforcement Learning

    Jul 9, 2026Zijie Cheng, Yang Peng, Zhihua ZhangDistributional RLReinforcement Learning

  15. Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

    Jul 8, 2026Eric Zhu, Abhinav Shrivastava, Soumik MukhopadhyayDiffusion Model AlignmentRL for Diffusion Models

  16. Mask-based Predictive Representations for Reinforcement Learning

    Jul 5, 2026Kai ZhaoRepresentation LearningPredictive Representation Learning

  17. Sample-Efficient Pareto Front Modeling for Energy-Aware Reinforcement Learning Using Bayesian Optimization

    Jul 3, 2026Georg Schäfer, Jakob Rehrl, Stefan Huber +1RL ControlMulti-Objective Reinforcement Learning

  18. WorldSample: Closed-loop Real-robot RL with World Modelling

    Jul 2, 2026Yuquan Xue, Le Xu, Zeyi Liu +5Robot Skill LearningWorld Models for Robotics

  19. QuasiMoTTo: Quasi-Monte Carlo Test-Time Scaling

    Jul 1, 2026Michael Y. Li, Anthony Zhan, Kanishk Gandhi +2Inference-Time ScalingSample-Efficient RL

  20. FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion

    Jun 30, 2026Guanchen Lu, Yajuan Dun, Yi Zhou +4Distributional RLReinforcement Learning

  21. Hierarchical Reinforcement Learning in StarCraft Micromanagement with Influence Maps and Cluster-based Scripts

    Jun 29, 2026Chunhui Bai, Changhe Li, Dequan Li +2Hierarchical RLSparse-Reward RL

  22. Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy

    Jun 25, 2026Wenjie Huang, Yang Li, Jingjia Teng +6Reinforcement LearningReward Shaping

  23. Mesh-RL: Coupled subgrid reinforcement learning

    Jun 24, 2026Behnam Gheshlaghi, Bahador Rashidi, Shahin AtakishiyevReinforcement LearningCredit Assignment in RL

  24. Minimax PAC Bounds for Learning in Exogenous Contextual MDPs

    Jun 23, 2026Corentin Pla, Hugo Richard, Marc Abeille +1Markov Decision ProcessesReinforcement Learning

  25. Supervised Reinforcement Learning for the Coordination of Distributed Energy Resources

    Jun 23, 2026Haoyuan Deng, Yihong Zhou, Thomas Morstyn +1Reinforcement LearningRL Fine-Tuning

  26. FAST: A Framework for Aligned Sampling and Training in Parallel Reinforcement Learning for Autonomous Driving

    Jun 19, 2026Bonan Wang, Letian Tao, Bin Shuai +7Reinforcement LearningRL for Autonomous Driving