RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO

    Sep 3, 2026Hyun Bin Park, Du-Seong ChangRL for Language Model ReasoningGroup Relative Policy Optimization

  2. StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios

    Sep 3, 2026Chenglin Wu, Junjie Wu, Jinhang Chen +5Speech EnhancementRL for LLM Agents

  3. Act More, Decide Less: Skill-Guided Adaptive Action Chunking for Long-Horizon LLM Agents

    Sep 2, 2026Yanting Yang, Can Jin, Jinman Zhao +6LLM Agent Workflow OptimizationLLM Agent Skill Learning

  4. The Rise of Verbal Reinforcement Learning

    Sep 1, 2026Kshitij Tayal, Arun Sharma, Genta Indra Winata +2RL for Language ModelsReinforcement Learning

  5. ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning

    Sep 1, 2026Fanrui Zhang, Ruixue Ding, Qiang Zhang +13AI Agent BenchmarksRubric-Based RL

  6. VerNav: Verifier-First Low-Latency Vision-and-Language Navigation

    Sep 1, 2026Zhixin Wang, Chengzheyi Yao, Leyuan Liu +2Efficient VLM InferenceVision-Language Navigation

  7. One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning

    Sep 1, 2026Xiaowei Sun, Jin Li, Yili Hong +2Cost-Aware InferenceConstrained RL

  8. How do World Models and Policies Compose in LLM Agents? A Joint Spectral and Behavioral Account

    Aug 30, 2026Ruize Xu, Xiao Yu, Yujin Tang +2World Model LearningWorld Models

  9. SearchWiki: Learning to Build and Navigate Knowledge Wikis for Active Information Seeking

    Aug 30, 2026Guransh Singh, Vishwajeet Kumar, Arkadeep Acharya +3Retrieval-Augmented GenerationAgentic Retrieval

  10. A^2Agent: Action-Aware Reinforcement Learning for Repository-Level Code Localization Agents

    Aug 30, 2026Doyeon Kim, Suyoung Bae, Yumin Lee +1Software Engineering AgentsCredit Assignment in RL

  11. Harness-RL: Black-Box Reinforcement Learning with Action-Args Decoupling for Central-Agent Multi-Agent Harnesses

    Aug 30, 2026Xinke Jiang, Zhixin Zhang, Zhibang Yang +6Multi-Agent LLM SystemsAgent Harness Optimization

  12. AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing

    Aug 30, 2026Xinke Jiang, Yue Fang, Zhibang Yang +12Retrieval-Augmented GenerationAgentic RAG

  13. Learning Generalizable Behaviors for Terminal Agents

    Aug 23, 2026Yihang Yao, Bo Pang, Xuan Phi Nguyen +3Terminal AgentsGeneralization in RL

  14. HiDiffTIR: Hierarchical Difficulty-Aware Policy Optimization for Multi-Turn Tool-Integrated Reasoning

    Aug 22, 2026Yucan Guo, Xiaohan Wang, Miao Su +8Credit AssignmentRL for LLM Agents

  15. SPADE: Self-Play in Adaptive Synthetic Executable Environments

    Aug 19, 2026Bo Liu, Simon Yu, Yiding Jiang +15Self-Play RLLLM Agent Self-Improvement

  16. Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents

    Aug 13, 2026Haoze Wu, Chuqiao Kuang, Tianyi Zhuang +1Group Relative Policy OptimizationCredit Assignment in RL

  17. Scaling Automatic Research Agents via World Models

    Aug 12, 2026Xiyuan Yang, Sheikh Sarwar, Jingru Cheng +8World Model LearningRL Post-Training

  18. LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

    Aug 12, 2026Zhixin Zhang, Xinke Jiang, Zhibang Yang +5LLM-Guided RLLLM Agents

  19. Learning from Online User Feedback for Shopping Agents

    Aug 12, 2026Haobo Zhang, Kelong Mao, Sulong Xu +2Large Language Model-Based RecommendationUser Preference Modeling

  20. SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

    Aug 11, 2026Chenhao Dang, Siyuan Xiong, Conghui He +1RL for Language ModelsSmall Language Models

  21. TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling

    Aug 11, 2026Yanyu Ren, Xizheng Wang, Xiao Liu +8Agentic RLAsynchronous RL

  22. Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks

    Aug 11, 2026Zelei Cheng, Amritansh Mishra, Sambit Sahu +1Efficient AttentionLong-Horizon Agent Tasks

  23. Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents

    Aug 10, 2026Tianjun Pan, Yuan Li, Hongda Wang +8LLM Agent Skill LearningSelf-Distillation

  24. MoRSE: Task-Oriented Multi-Agent System with Mixture of Role-Subtask Experts

    Aug 10, 2026Peiwen Li, Shiyang Zhang, Yangtian Zhang +3Multi-Agent LLM SystemsMixture-of-Experts Language Models

  25. Reading is not Reasoning: Bridging the Agentic Policy Gap in Vision-Text Compression

    Aug 9, 2026Cheng Fan, Junyi Zhou, Tingzhang Luo +5Cross-Modal Knowledge DistillationMultimodal Token Compression

  26. GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

    Aug 8, 2026Chen Li, Sijie Cheng, Yuelin Zhang +4Large Language Model-Based Robot PlanningRobot Task Planning