Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 269% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,125

All topics
CardsList
  1. Selective Transfer of RL Updates for Visual Reasoning

    Oct 6, 2026Suxin Ji, Hungtao Wan, Mingjun Liu +1Reinforcement LearningVLM Reasoning

  2. Reinforcement Learning with Segment Reward Feedback under Linear Function Approximation

    Oct 6, 2026Fengxu Liu, Siwei Wang, Gal Dalal +2Regret Minimization in RLReinforcement Learning

  3. Revisiting Temporal Regularization for Smooth Control in Deep Reinforcement Learning

    Oct 6, 2026SungJae Ahn, Jeong Woon Lee, Kyoleen Kwak +1RL ControlReinforcement Learning

  4. Learned Adaptive Multiresolution Diffusion Imaging

    Oct 6, 2026Christian Tantardini, Stig Rune Jensen, Roberto Di Remigio Eikås +1Reinforcement LearningAdaptive Mesh Refinement

  5. Considering Context: When World Models Need Context Encoders

    Oct 5, 2026Oleg Smirnov, Sofiane Ennadir, John Pertoft +2Reinforcement LearningWorld Model Learning

  6. GPlaceRL: An Open-Source Graph Reinforcement Learning Framework for Detailed Placement

    Oct 5, 2026Pavlos Stoikos, Foteini Oikonomou, Christos Poulos +5Reinforcement LearningElectronic Design Automation

  7. I-BFM: Reward-Conditioned Robust Humanoid Interaction via Unsupervised Reinforcement Learning

    Oct 5, 2026Ziqi Han, Yitang Li, Junhan Sun +8Representation LearningReinforcement Learning

  8. HuatuoGPT-3: RL-Only Domain Adaptation from Base Models

    Oct 5, 2026Junying Chen, Xinyuan Xie, Ziniu Li +7RL for Language ModelsReinforcement Learning

  9. An LLM-in-the-loop RL Framework for Bioinformatics Feature Selection

    Oct 4, 2026Xinyuan Wang, Deepti Agrawal, Yanjie FuReinforcement LearningLLM-Guided RL

  10. Factoriax: A GPU-Accelerated Factorio-Style Simulator for Reinforcement Learning

    Oct 4, 2026Mickey Beurskens, Tristan Tomilin, Thiago D. SimãoRL BenchmarksReinforcement Learning

  11. Hierarchical Reinforcement Learning with Stable Temporal Abstraction for Language Model Agents

    Oct 4, 2026Shayan Mohajer Hamidi, Yize Cheng, Yuanda Xu +2Reinforcement LearningHierarchical RL

  12. Task Inference Beyond Least Squares in Behavioral Foundation Models

    Oct 4, 2026Kuan-Hsun Tu, Chien-Sheng Chiang, Hsin-Wei Chen +2Reinforcement LearningMulti-Task RL

  13. On Semi-Markov Suboptimality in Hierarchical Reinforcement Learning

    Oct 4, 2026Bingyun Liu, Yuheng JingReinforcement LearningSequential Decision Making

  14. Long-MDR: Long-Context Reinforcement Learning for Multimodal Deep-Research Agents

    Oct 4, 2026On Tai TangReinforcement LearningDeep Research Agents

  15. Beyond Instruction Following: Learning Grounded Skill-Following with Skill Contracts

    Oct 4, 2026Jianghan Shen, Zhenjie Liu, Yue Li +10Reinforcement LearningLLM Agent Skill Learning

  16. Direction-Conditioned Policies for Online Goal-Conditioned Reinforcement Learning

    Oct 4, 2026S K Swaminathan, Damiya Gondha, Theyanesh Eswaramoorthy Rajahkrishnan +1Reinforcement LearningContrastive RL

  17. Faynt: Scaling and Optimizing Policies for Competitive Melee

    Oct 1, 2026Ali Janati, Nikita Kuzmin, Rohit Swamy +1Reinforcement LearningSelf-Play RL

  18. Bellman Meets Lyapunov: Unsupervised Reinforcement Learning via Mastering Chaos

    Oct 1, 2026Tristan Shah, Wooyoung Chung, Volodomyr Makarenko +2Reinforcement LearningIntrinsic Motivation

  19. Q-Learning for Reachability in MEC-Free MDPs

    Oct 1, 2026Lu-Chin Chang, Suguman BansalMarkov Decision ProcessesReinforcement Learning

  20. Reinforcement Learning to Accelerate Primal-Dual Hybrid Gradient for Linear Programming

    Oct 1, 2026Jinhwan Sul, Alex Oshin, Evangelos A. TheodorouPrimal-Dual OptimizationReinforcement Learning

  21. Decision Titan: Test-Time Training for Long-Term Memory in Offline Reinforcement Learning

    Oct 1, 2026Jude Waide, Robert LieckReinforcement LearningTransformer-Based RL

  22. Rethinking Probability-Based Reinforcement Learning From Posterior Concentration

    Oct 1, 2026Shiu-Hong Kao, Yubo Zhao, Zhenyu Tian +3Reinforcement LearningRL for Language Model Reasoning

  23. Optimal Transport Meets Reinforcement Learning: A Survey

    Oct 1, 2026Yujie Zhu, Charles A. Hepburn, Matthew Thorpe +1Reinforcement LearningOptimal Transport

  24. MMVistaReason: Toward Open-Data and Post-Training Recipes for Multimodal Reasoning

    Oct 1, 2026Juekai Lin, Honglin Lin, Yuqian Yuan +7Reinforcement LearningMultimodal Reasoning

  25. PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading

    Oct 1, 2026Duong Hien Chi Kien, Thanh Trung HuynhReinforcement LearningRisk-Sensitive RL

  26. MASkillBlender: Decentralized Whole-Body Coordination for Multi-Humanoid Loco-Manipulation via Skill Blending

    Oct 1, 2026Yifan Hu, Luhang Hong, Mingkang Long +5Humanoid Loco-ManipulationReinforcement Learning

  27. Probe with Participation Trophies: Random-Reward RL as a Probe of LLM Capability

    Oct 1, 2026Yu Mao, Lei Yu, Zining Zhu +6RL for Language ModelsReinforcement Learning

  28. RISED: RubrIcs for agentic multi-environment Selection and sElf-Distillation

    Oct 1, 2026Jingtan Wang, Sirajul Salekin, Young mok Jung +3Reinforcement LearningRubric-Based RL

  29. Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning

    Oct 1, 2026Pedro Robles Dutenhefner, Dikshant Shehmar, Wagner Meira +1Reinforcement LearningOffline RL

  30. Crossing the Cyber Divide: Sim-to-Sim and Sim-to-Real Transfer for RL Agents

    Sep 30, 2026Sabrina Saika, Yinuo Du, Aritran PiplaiReinforcement LearningSim-to-Real Transfer

  31. Scalable Multi-Task Inverse Reinforcement Learning

    Sep 30, 2026Allen Tran, Jia Wan, Nathan Kallus +1Reinforcement LearningMulti-Task RL

  32. ALER: Adaptive Learnable Experience Rewriting for Reinforcement Learning

    Sep 30, 2026Oleg Shchendrigin, Egor Cherepanov, Aleksandr I. Panov +1RL BenchmarksReinforcement Learning

  33. Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

    Sep 30, 2026Tong Zheng, Skylar Zhai, Zhan Cheng +7Multi-Objective Reinforcement LearningReinforcement Learning

  34. PhantomEnvironments: Training LLM Agents in Fictional Worlds

    Sep 30, 2026Anmol Kabra, Swathi Saravana Selvam, Albert Gong +5Multi-Hop QAReinforcement Learning

  35. MemLife: Curating and Reasoning over Long-Term Egocentric Video Memories

    Sep 30, 2026Guangzhi Xiong, Xinyuan Zhang, Xiao Yang +14Multimodal MemoryReinforcement Learning

  36. Unlearnable, or Unmeasured? On the Reliability of Difficulty Labels in RLVR

    Sep 30, 2026Chandak Chakma, Syed Nazmus Sakib, Nafiul Haque +1Reinforcement LearningRL for Language Model Reasoning

  37. Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding

    Sep 30, 2026Yifan Zhang, Qifan Zhang, Liang ZhengRL ControlReinforcement Learning

  38. T-Router: Learning Thalamic Routing for Reasoning with Parameter-Efficient Reinforcement Learning

    Sep 30, 2026Liuxian Ma, Jiale Dai, Jiaqi Li +1Reinforcement LearningRL for Language Model Reasoning

  39. Loop-Free Inverse Reinforcement Learning via Sequential Value Recovery with Q-Score Matching

    Sep 30, 2026Yang chen, Yitan Zhang, Michael Witbrock +1Reinforcement Learning

  40. Revisiting scaling laws for reward optimization

    Sep 29, 2026Ali Aouad, Aymane El Gadarri, Vivek F. FariasReward ModelingReinforcement Learning

  41. MOBA-VL: Event-Localized Multi-Turn Reinforcement Learning for Real-Time MOBA Commentary

    Sep 29, 2026Shengyun Zhong, Xinkang Zhao, Ziyuan Chu +1Reinforcement LearningVideo-Language Models

  42. Jaxolotl: A Unified High-Performance Benchmark Suite for LTL-Based Multi-Task RL

    Sep 29, 2026Mathias Jackermeier, Jacques Cloete, Alessandro AbateRL BenchmarksReinforcement Learning

  43. Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +3Reinforcement LearningValue Function Estimation

  44. SCA: Spatial Credit Assignment for Reinforcement Learning of GUI Agents

    Sep 29, 2026Shengtian Yang, Ziyu Xiong, Kaibing Yang +6Reinforcement LearningRL for GUI Agents

  45. State Trace Rationale As Auxiliary Task in Reinforcement Learning

    Sep 29, 2026Muhammad U. Nasir, Alex Vogt, Steven D. James +1Reinforcement LearningRepresentation Learning for RL

  46. Group-Marginalized Self-Rewarding RL Drives Zero-Label Self-Evolving

    Sep 29, 2026Yiming Wang, Yikang Liu, Qingyuan Tian +4RL for Language ModelsReinforcement Learning

  47. Inducing Process Supervision from Outcome-Only Reinforcement Learning

    Sep 29, 2026Shengda Fan, Xin Cong, Zhong Zhang +2Reinforcement LearningProcess Reward Models

  48. SERA: Scale-Equalized Rollout Allocation for Maximum Likelihood Reinforcement Learning

    Sep 29, 2026Zihao Chen, Fanxiang Xiong, Hongran Ren +6Reinforcement LearningRL for Language Model Reasoning

  49. BRIDGE: Bilevel Retrieval-Credit-Aware Agentic Reinforcement Learning

    Sep 29, 2026Quan Xiao, Mingda Liu, Gaowen Liu +2Reinforcement LearningAgentic RAG

  50. Massively Parallel Reinforcement Learning with a Chaotic Reconfigurable Clockless Chip

    Sep 28, 2026Eric Oliveira-Gomes, Damien RontaniReinforcement LearningChaotic Dynamical Systems

  51. ChronoSRL: Temporal Geometry for Self-Supervised Reinforcement Learning

    Sep 28, 2026Nico Bohlinger, Jan PetersRL for RoboticsRepresentation Learning

  52. X-Reset: Scaling Object-Centric Reinforcement Learning via Cross-Embodiment Resets

    Sep 28, 2026Prithwish Dan, Chenyang Ma, Wei ZhanReinforcement LearningGeneralization in Robotic Manipulation

  53. Provable Benefits of Regularization: Fast Rates for Adversarial Imitation Learning

    Sep 28, 2026Hanbin Zhou, Shangzhe Li, Alexander Braverman +1Reinforcement LearningAdversarial Imitation Learning