RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. From Imitation to Reward Discovery: On-Policy Warmup for Agentic RL

    Sep 30, 2026Yitong Qiao, Tiantian He, Lei Liu +4Agentic RLReinforcement Learning with Verifiable Rewards

  2. Mitigating the Length-Scaling Tax with Online Distillation

    Sep 30, 2026Xu Wan, Wenyue Xu, Shengjie Zhao +1RL for Language Model ReasoningOn-Policy Distillation

  3. EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making

    Sep 29, 2026Yuhan Guo, Jinming Liu, Liang Xu +8LLM Agent TrainingGeneralization in RL

  4. AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation

    Sep 29, 2026Rishabh Agrawal, Hejie Cui, Shasha Li +2Language Model SteeringLLM Agent Self-Improvement

  5. ReMem: Rethinking Perception and Memory in Long-Context Recommendation Agents

    Sep 29, 2026Haohao Qu, Yongcheng Jing, Chun Hin Chan +3Long-Context ModelingRecommender Systems

  6. VACE: Validation-Gated Alternating Co-Evolution of Agent Models and Harnesses

    Sep 29, 2026Jiexing Qi, Yu He, Jun Liu +9Agentic RLAgent Harness Optimization

  7. Traverse: Learning When to Remember, Reset, and Redirect for Long-Horizon Web Search

    Sep 29, 2026Jingyuan Ma, Lynx Aster, He Zhang +5Long-Horizon Agent EvaluationWeb Search Agents

  8. EASE: Behavior-Adaptive Skill Curation for Self-Evolving Agents

    Sep 29, 2026Zhen Xiong, Qiaoyu TanLLM Agent Skill LearningLLM Agent Skill Retrieval

  9. BRIDGE: Bilevel Retrieval-Credit-Aware Agentic Reinforcement Learning

    Sep 29, 2026Quan Xiao, Mingda Liu, Gaowen Liu +2Reinforcement LearningAgentic RAG

  10. Reinforcing Agentic Creativity in Scientific Ideation with Night Science

    Sep 28, 2026Priyanka Kargupta, Silviu Cucerzan, Shweti Mahajan +4AI Agents for Scientific DiscoveryScientific Hypothesis Generation

  11. Continuous Context Management

    Sep 28, 2026William Hoy, Jingxuan Fan, Nurcin Celik +1Context DistillationLong-Horizon LLM Agents

  12. ASCT: Attentive Search over Counterfactual Trees for Credit Assignment in Agentic Reinforcement Learning

    Sep 28, 2026Yang Li, Jinhan Yang, hai liu +8Agentic RLCredit Assignment in RL

  13. GraphHCA: Closed-Form Hindsight Credit Assignment for Long-Horizon LLM Agents

    Sep 28, 2026Haodong Zhu, Yangyang Ren, Changbai Li +4Credit Assignment in RLStep-Level Credit Assignment in RL

  14. Cross-Rollout Bellman Closure for Long-Horizon Agentic Reinforcement Learning

    Sep 28, 2026Yangyang Ren, Haodong Zhu, Linlin Yang +3Agentic RLStep-Level Credit Assignment in RL

  15. TIDE: Teacher-Student Transition via Informative Distillation and Exploration for Agentic RL

    Sep 28, 2026Yibin Huang, Xinming Xu, Conghui ZhuAgentic RLOn-Policy Distillation

  16. Proactive Dialogue Policy Optimization via Cognitive-State Transition

    Sep 28, 2026Minghui Ma, Mengqi Chen, Bin Guo +1Policy OptimizationConversational Agents

  17. UniOPSD: Unifying Outcome and Hindsight Feedback for Agentic Reinforcement Learning

    Sep 28, 2026Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai +8Agentic RLCredit Assignment in RL

  18. SIPO: Selective-Inference Policy Optimization for Tree-Structured Agentic RL

    Sep 28, 2026Zenghuang Fu, Ningqi Chen, Mingda Jia +10Agentic RLReinforcement Learning

  19. Marathoner: Ultra-Long-Horizon Autonomous Intelligence

    Sep 28, 2026Zhang Ruiyang, Ou Jinpeng, Xie Yifan +4Long-Horizon Agent TasksLong-Horizon LLM Agents

  20. GlyphBench: A Playground for Language-Model Reinforcement Learning

    Sep 28, 2026Roger Creus Castanyer, Marc-Alexandre Côté, Matthew James Sargent +3RL BenchmarksRL for Language Models

  21. Learning Perturbation Robust Policies for LLM Agents with Stable Optimization

    Sep 28, 2026Pengxin Wang, Yuanzhe LI, Yuxin Ren +2RL Post-TrainingRobust RL

  22. QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents

    Sep 27, 2026Weiqi Wang, Yuxin Zhou, Mouxiang Chen +9Reinforcement LearningLong-Horizon Agent Tasks

  23. Climbing the Hill: Prompt Injection Red-Teaming Against Frontier Models with Curriculum Reinforcement Learning

    Sep 27, 2026Chenlong Yin, Xiaolong Jin, Wei Zou +2Adversarial Attacks on LLMsLLM Red Teaming

  24. Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents

    Sep 27, 2026Mingju Chen, Can Lv, Jinrong Liu +3Credit Assignment in RLReinforcement Learning with Verifiable Rewards