Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Q-Learning for Reachability in MEC-Free MDPs

    Oct 1, 2026Lu-Chin Chang, Suguman BansalMarkov Decision ProcessesReinforcement Learning

  2. Reinforcement Learning to Accelerate Primal-Dual Hybrid Gradient for Linear Programming

    Oct 1, 2026Jinhwan Sul, Alex Oshin, Evangelos A. TheodorouPrimal-Dual OptimizationReinforcement Learning

  3. Decision Titan: Test-Time Training for Long-Term Memory in Offline Reinforcement Learning

    Oct 1, 2026Jude Waide, Robert LieckReinforcement LearningTransformer-Based RL

  4. Rethinking Probability-Based Reinforcement Learning From Posterior Concentration

    Oct 1, 2026Shiu-Hong Kao, Yubo Zhao, Zhenyu Tian +3Reinforcement LearningRL for Language Model Reasoning

  5. Optimal Transport Meets Reinforcement Learning: A Survey

    Oct 1, 2026Yujie Zhu, Charles A. Hepburn, Matthew Thorpe +1Reinforcement LearningOptimal Transport

  6. MMVistaReason: Toward Open-Data and Post-Training Recipes for Multimodal Reasoning

    Oct 1, 2026Juekai Lin, Honglin Lin, Yuqian Yuan +7Reinforcement LearningMultimodal Reasoning

  7. PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading

    Oct 1, 2026Duong Hien Chi Kien, Thanh Trung HuynhReinforcement LearningRisk-Sensitive RL

  8. MASkillBlender: Decentralized Whole-Body Coordination for Multi-Humanoid Loco-Manipulation via Skill Blending

    Oct 1, 2026Yifan Hu, Luhang Hong, Mingkang Long +5Humanoid Loco-ManipulationReinforcement Learning

  9. Probe with Participation Trophies: Random-Reward RL as a Probe of LLM Capability

    Oct 1, 2026Yu Mao, Lei Yu, Zining Zhu +6RL for Language ModelsReinforcement Learning

  10. RISED: RubrIcs for agentic multi-environment Selection and sElf-Distillation

    Oct 1, 2026Jingtan Wang, Sirajul Salekin, Young mok Jung +3Reinforcement LearningRubric-Based RL

  11. Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning

    Oct 1, 2026Pedro Robles Dutenhefner, Dikshant Shehmar, Wagner Meira +1Reinforcement LearningOffline RL

  12. Crossing the Cyber Divide: Sim-to-Sim and Sim-to-Real Transfer for RL Agents

    Sep 30, 2026Sabrina Saika, Yinuo Du, Aritran PiplaiReinforcement LearningSim-to-Real Transfer

  13. Scalable Multi-Task Inverse Reinforcement Learning

    Sep 30, 2026Allen Tran, Jia Wan, Nathan Kallus +1Reinforcement LearningMulti-Task RL

  14. ALER: Adaptive Learnable Experience Rewriting for Reinforcement Learning

    Sep 30, 2026Oleg Shchendrigin, Egor Cherepanov, Aleksandr I. Panov +1RL BenchmarksReinforcement Learning

  15. Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

    Sep 30, 2026Tong Zheng, Skylar Zhai, Zhan Cheng +7Multi-Objective Reinforcement LearningReinforcement Learning

  16. PhantomEnvironments: Training LLM Agents in Fictional Worlds

    Sep 30, 2026Anmol Kabra, Swathi Saravana Selvam, Albert Gong +5Multi-Hop QAReinforcement Learning

  17. MemLife: Curating and Reasoning over Long-Term Egocentric Video Memories

    Sep 30, 2026Guangzhi Xiong, Xinyuan Zhang, Xiao Yang +14Multimodal MemoryReinforcement Learning

  18. Unlearnable, or Unmeasured? On the Reliability of Difficulty Labels in RLVR

    Sep 30, 2026Chandak Chakma, Syed Nazmus Sakib, Nafiul Haque +1Reinforcement LearningRL for Language Model Reasoning

  19. Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding

    Sep 30, 2026Yifan Zhang, Qifan Zhang, Liang ZhengRL ControlReinforcement Learning

  20. T-Router: Learning Thalamic Routing for Reasoning with Parameter-Efficient Reinforcement Learning

    Sep 30, 2026Liuxian Ma, Jiale Dai, Jiaqi Li +1Reinforcement LearningRL for Language Model Reasoning

  21. Loop-Free Inverse Reinforcement Learning via Sequential Value Recovery with Q-Score Matching

    Sep 30, 2026Yang chen, Yitan Zhang, Michael Witbrock +1Reinforcement Learning

  22. Revisiting scaling laws for reward optimization

    Sep 29, 2026Ali Aouad, Aymane El Gadarri, Vivek F. FariasReward ModelingReinforcement Learning

  23. MOBA-VL: Event-Localized Multi-Turn Reinforcement Learning for Real-Time MOBA Commentary

    Sep 29, 2026Shengyun Zhong, Xinkang Zhao, Ziyuan Chu +1Reinforcement LearningVideo-Language Models

  24. Jaxolotl: A Unified High-Performance Benchmark Suite for LTL-Based Multi-Task RL

    Sep 29, 2026Mathias Jackermeier, Jacques Cloete, Alessandro AbateRL BenchmarksReinforcement Learning

  25. Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +3Reinforcement LearningValue Function Estimation

  26. SCA: Spatial Credit Assignment for Reinforcement Learning of GUI Agents

    Sep 29, 2026Shengtian Yang, Ziyu Xiong, Kaibing Yang +6Reinforcement LearningRL for GUI Agents

  27. State Trace Rationale As Auxiliary Task in Reinforcement Learning

    Sep 29, 2026Muhammad U. Nasir, Alex Vogt, Steven D. James +1Reinforcement LearningRepresentation Learning for RL

  28. Group-Marginalized Self-Rewarding RL Drives Zero-Label Self-Evolving

    Sep 29, 2026Yiming Wang, Yikang Liu, Qingyuan Tian +4RL for Language ModelsReinforcement Learning