Agentic RL

RL: Reinforcement Learning

Momentum

28 papers in the last four weeks, up 300% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 140

All topics
CardsList
  1. Self-Retrospection Distillation: Turning Post-hoc Experiences into Prior Foresight

    Oct 6, 2026Haoxiang Zhang, Qinglin Chen, Hiroaki Hayashi +9Agentic RLRL for Language Model Reasoning

  2. Structuring MoE Expert Selection for Agentic Reinforcement Learning

    Oct 5, 2026Bolian Li, Ting-Yao Hu, Cheng-Yu Hsieh +3Agentic RLExpert Routing

  3. ThunderSyncRL: Lossless Acceleration of Agentic Reinforcement Learning

    Oct 5, 2026Seil Kang, Hangoo Kang, Tarun Suresh +4Agentic RLOn-Policy Distillation

  4. Do Your Own Research: Learning to Forecast by Learning to Search

    Oct 1, 2026Yusuf Afifi, Artur Kiulian, Anton Polishko +3Agentic RLForecasting Benchmarks

  5. Sharpening Tax in Post-Training

    Oct 1, 2026Changdae Oh, Qi Zeng, Qi Qi +7Agentic RLTest-Time Scaling

  6. Dependency-Aware Reward Shaping for Agentic Reinforcement Learning

    Oct 1, 2026Ziyi Chen, Yan Zhang, Jianhui Wei +2RL for Language ModelsAgentic RL

  7. My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning

    Oct 1, 2026Yihua Zhu, Qianying Liu, Weixu Qiao +10Agentic RLCredit Assignment in RL

  8. SHARPO: Segment-Level Credit Assignment for Agentic Reinforcement Learning

    Sep 30, 2026Xinchen Du, Zhengze Zhou, Wenhui Zhu +4Agentic RLGroup Relative Policy Optimization

  9. T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

    Sep 30, 2026Bo-Wen Zhang, Junwei He, Maoqi Liu +6Agentic RLReward Shaping

  10. From Imitation to Reward Discovery: On-Policy Warmup for Agentic RL

    Sep 30, 2026Yitong Qiao, Tiantian He, Lei Liu +4Agentic RLReinforcement Learning with Verifiable Rewards

  11. Guide, Then Let Go: Gap-Adaptive Teacher Scheduling for Sparse-Reward Agentic RL

    Sep 29, 2026Youling Huang, Tiankuo Xu, Jiaji Liu +10Agentic RLLLM-Guided RL

  12. VACE: Validation-Gated Alternating Co-Evolution of Agent Models and Harnesses

    Sep 29, 2026Jiexing Qi, Yu He, Jun Liu +9Agentic RLAgent Harness Optimization

  13. Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning

    Sep 28, 2026Dongwon Jung, Hemanth Neelgund Ramesh, Yifan Wang +7Agentic RLGroup Relative Policy Optimization

  14. KV-streams for Efficient Compaction in Agentic Reinforcement Learning

    Sep 28, 2026Emiliano Penaloza, Dane Malenfant, Dheeraj Vattikonda +15Agentic RLKV-Cache Management

  15. ARISE: Adapting to Evolving Capability Gaps in Agentic Reinforcement Learning

    Sep 28, 2026Kun Feng, Yuchen Fang, Yiyang Tan +6Agentic RLLong-Horizon Agent Evaluation

  16. ASCT: Attentive Search over Counterfactual Trees for Credit Assignment in Agentic Reinforcement Learning

    Sep 28, 2026Yang Li, Jinhan Yang, hai liu +8Agentic RLCredit Assignment in RL

  17. Cross-Rollout Bellman Closure for Long-Horizon Agentic Reinforcement Learning

    Sep 28, 2026Yangyang Ren, Haodong Zhu, Linlin Yang +3Agentic RLStep-Level Credit Assignment in RL

  18. TIDE: Teacher-Student Transition via Informative Distillation and Exploration for Agentic RL

    Sep 28, 2026Yibin Huang, Xinming Xu, Conghui ZhuAgentic RLOn-Policy Distillation

  19. UniOPSD: Unifying Outcome and Hindsight Feedback for Agentic Reinforcement Learning

    Sep 28, 2026Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai +8Agentic RLCredit Assignment in RL

  20. SIPO: Selective-Inference Policy Optimization for Tree-Structured Agentic RL

    Sep 28, 2026Zenghuang Fu, Ningqi Chen, Mingda Jia +10Agentic RLReinforcement Learning

  21. Qwen-Planner-Agent: A Closed-Loop AI-for-AI Framework for Real-World Mobile Planner Agents

    Sep 24, 2026Tingyu Qu, Weigao Sun, Yuecheng Liu +23Agentic RLAgent Harness Optimization

  22. Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning

    Sep 24, 2026Xincheng Yao, Haobo Fu, Weiming Liu +1Agentic RLCredit Assignment in RL

  23. ProCredit: From Outcome Rewards to Progress Credit in Agentic Reinforcement Learning

    Sep 23, 2026Ming Ma, Yi Zhu, Yiran Zhong +7Agentic RLCredit Assignment in RL

  24. Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms

    Sep 23, 2026Xinjie Shen, Wei Fan, Xudong Guo +5Agentic RLReinforcement Learning

  25. RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

    Sep 17, 2026Yan Yu, Zhengxi Lu, Yizhou Liu +7Agentic RLOn-Policy Distillation

  26. Reach or Solve? Attributing Agentic RL Gains with Checkpoint Handoffs

    Sep 17, 2026Xuan Liu, Jingbin QianAgentic RLLong-Horizon Agent Evaluation

  27. AgenticGen: Reward-Guided Agentic Video Generation for Advertising

    Sep 10, 2026Xingyuan Bu, Chengru Song, Hao Zhou +9Reward ModelingAgentic RL