Sample-Efficient RL

RL: Reinforcement Learning

Momentum

12 papers in the last four weeks, up 140% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 168

All topics
CardsList
  1. NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning

    Jun 19, 2026Xinwei Liu, Junyuan Liang, Zicong Hong +2Reinforcement LearningQ-Learning

  2. Direct Advantage Estimation for Scalable and Sample-efficient Deep Reinforcement Learning

    Jun 18, 2026Hsiao-Ru Pan, Bernhard SchölkopfPartially Observable RLSample-Efficient RL

  3. DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning

    Jun 17, 2026Calvin Luo, Chen Sun, Shuran SongRobot Policy AdaptationRobotic RL

  4. UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning

    Jun 17, 2026Mohamed Nabail, Leo Kaixuan Cheng, Jingmin Wang +1Pairwise Preference EvaluationRL Exploration

  5. RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents

    Jun 17, 2026Ruishan Fang, Siyuan Lu, Chenyi Zhuang +1Synthetic Data GenerationSample-Efficient RL

  6. Performance-Driven Environment Abstraction with Multi-Timescale Learning

    Jun 16, 2026Yue Guan, Dipankar Maity, Panagiotis TsiotrasMarkov Decision ProcessesReinforcement Learning

  7. Learning Policy from a Single Trajectory in Average-Reward Markov Decision Process

    Jun 15, 2026Jongmin Lee, Ernest K. Ryu, Vaneet AggarwalMarkov Decision ProcessesReinforcement Learning

  8. Infant Spontaneous Movement Noise Improves Exploration in Deep RL

    Jun 15, 2026Francisco M. López, Markus R. Ernst, Francisco Cruz +2Reinforcement LearningRL Exploration

  9. Lyapunov-Based Sample Complexity Analysis for Weakly-Coupled MDPs

    Jun 12, 2026Tianhao Wu, Matthew Zurek, Weina Wang +1Multi-Armed BanditsRobust Markov Decision Processes

  10. Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output

    Jun 9, 2026Guozheng Li, Xiyan Fu, Yiwen GuoRL for Language ModelsSample-Efficient RL

  11. 3SPO: State-Score-Supervised Policy Optimization for LLM Agents

    Jun 8, 2026Yu Han, Kailing Li, Yang Jiao +4Credit Assignment in RLStep-Level Credit Assignment in RL

  12. sGPO: Trading Inference FLOPs for Training Efficiency in RLVR

    Jun 7, 2026Shivchander Sudalairaj, Kai Xu, Akash Srivastava +1Group Relative Policy OptimizationAdaptive Sampling

  13. Cross-Epoch Adaptive Rollout Optimization for RL Post-Training

    Jun 4, 2026Yiming Zong, Yige Wang, Jiashuo JiangSequential Decision MakingRL for Language Model Reasoning

  14. Rollout-Level Advantage-Prioritized Experience Replay for GRPO

    Jun 3, 2026Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang +2RL for Language Model ReasoningGroup Relative Policy Optimization

  15. Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

    May 31, 2026Hikmet Simsir, Ozgur S. OguzRobot Policy AdaptationReinforcement Learning

  16. Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems

    May 29, 2026Jonathan Colaço Carr, Prakash Panangaden, Doina Precup +1Pairwise Preference LearningMarkov Decision Processes

  17. Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

    May 29, 2026Yuhuan Yuan, Zhouliang Yu, Minghao Liu +2Physical ReasoningVisual Spatial Reasoning

  18. Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance

    May 28, 2026Shutong Ding, Zejia Zhong, Zhongyi Wang +4Diffusion GuidanceRobotic RL

  19. Optimal Data Acquisition for Reinforcement Learning: A Large Deviations Perspective

    May 27, 2026Mingjie Hu, Jian-Qiang Hu, Enlu ZhouReinforcement LearningSample-Efficient RL

  20. IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage

    May 27, 2026Yuhan Li, Mingxu Zhang, Dazhong Shen +1Reinforcement LearningRL for Language Model Reasoning

  21. BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning

    May 26, 2026Shijin Gong, Erhan Xu, Kai Ye +3RL for Language Model ReasoningCritic-Free RL

  22. Ratio-Variance Regularized Policy Optimization

    May 26, 2026Yu Luo, Shuo Han, Yihan Hu +5RL for Language Model ReasoningPolicy Optimization

  23. Sample Complexity of Policy Gradient for Log-Growth Control

    May 26, 2026Qiuhua Pan, Yukai Shen, Liwei Zhang +2Stochastic Linear Dynamical SystemsStochastic Optimal Control

  24. Refined Analysis of Entropy-Regularized Actor-Critic

    May 23, 2026Safwan Labbi, Paul Mangold, Daniil Tiapkin +1Reinforcement LearningMaximum Entropy RL

  25. Goal-Conditioned Agents that Learn Everything All at Once

    May 22, 2026Michael Matthews, Matthew Jackson, Michael Beukman +5Policy LearningSample-Efficient RL