Agentic Reinforcement Learning

Latest papers 145

All topics
CardsList
  1. Structuring MoE Expert Selection for Agentic Reinforcement Learning

    Oct 5, 2026Bolian Li, Ting-Yao Hu, Cheng-Yu Hsieh +3Agentic Reinforcement LearningMixture-Of-Agents

  2. Dependency-Aware Reward Shaping for Agentic Reinforcement Learning

    Oct 1, 2026Ziyi Chen, Yan Zhang, Jianhui Wei +2Agentic Reinforcement LearningPotential-Based Reward Shaping

  3. My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning

    Oct 1, 2026Yihua Zhu, Qianying Liu, Weixu Qiao +10Credit AssignmentAgentic Reinforcement Learning

  4. SHARPO: Segment-Level Credit Assignment for Agentic Reinforcement Learning

    Sep 30, 2026Xinchen Du, Zhengze Zhou, Wenhui Zhu +4Agentic Reinforcement LearningCredit Assignment

  5. From Given to Gathered Evidence: Agentic Learning for Longitudinal Medical Reasoning

    Sep 30, 2026Minye Shao, Chaohui Yu, Yixuan Wu +3Clinical Reasoning TrainingAgentic Learning

  6. T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

    Sep 30, 2026Bo-Wen Zhang, Junwei He, Maoqi Liu +6Agentic Reinforcement LearningProcess-Level Supervision

  7. From Imitation to Reward Discovery: On-Policy Warmup for Agentic RL

    Sep 30, 2026Yitong Qiao, Tiantian He, Lei Liu +4Reinforcement Learning With Verifiable RewardAgentic Reinforcement Learning

  8. BRIDGE: Bilevel Retrieval-Credit-Aware Agentic Reinforcement Learning

    Sep 29, 2026Quan Xiao, Mingda Liu, Gaowen Liu +2Agentic Reinforcement LearningLarge Language Model Policy Optimization

  9. Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning

    Sep 28, 2026Dongwon Jung, Hemanth Neelgund Ramesh, Yifan Wang +7Credit AssignmentAgentic Reinforcement Learning

  10. KV-streams for Efficient Compaction in Agentic Reinforcement Learning

    Sep 28, 2026Emiliano Penaloza, Dane Malenfant, Dheeraj Vattikonda +15CompactionAgentic Reinforcement Learning

  11. ARISE: Adapting to Evolving Capability Gaps in Agentic Reinforcement Learning

    Sep 28, 2026Kun Feng, Yuchen Fang, Yiyang Tan +6Agentic Reinforcement LearningLong-Horizon Agents

  12. ASCT: Attentive Search over Counterfactual Trees for Credit Assignment in Agentic Reinforcement Learning

    Sep 28, 2026Yang Li, Jinhan Yang, hai liu +8Agentic Reinforcement LearningCredit Assignment

  13. TIDE: Teacher-Student Transition via Informative Distillation and Exploration for Agentic RL

    Sep 28, 2026Yibin Huang, Xinming Xu, Conghui ZhuAgentic Reinforcement LearningTeacher

  14. SIPO: Selective-Inference Policy Optimization for Tree-Structured Agentic RL

    Sep 28, 2026Zenghuang Fu, Ningqi Chen, Mingda Jia +10Frictive Policy OptimizationAgentic Reinforcement Learning

  15. Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning

    Sep 24, 2026Xincheng Yao, Haobo Fu, Weiming Liu +1Group-Based Reinforcement LearningAgentic Reinforcement Learning

  16. ProCredit: From Outcome Rewards to Progress Credit in Agentic Reinforcement Learning

    Sep 23, 2026Ming Ma, Yi Zhu, Yiran Zhong +7Agentic Reinforcement LearningReward Signal

  17. UnifiedPlayers: Enhance Tool-Integrated Reasoning in Agentic Reinforcement Learning

    Sep 17, 2026Wenjie Liao, Liangjie Zhao, Zehong CaoAgentic Reinforcement LearningReasoning Benchmark

  18. Reach or Solve? Attributing Agentic RL Gains with Checkpoint Handoffs

    Sep 17, 2026Xuan Liu, Jingbin QianAgentic Reinforcement Learning

  19. Harness-RL: Black-Box Reinforcement Learning with Action-Args Decoupling for Central-Agent Multi-Agent Harnesses

    Aug 30, 2026Xinke Jiang, Zhixin Zhang, Zhibang Yang +6Agentic Reinforcement LearningAgent Harness

  20. AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing

    Aug 30, 2026Xinke Jiang, Yue Fang, Zhibang Yang +12Agentic Reinforcement LearningAgentic Benchmarks

  21. Learning Generalizable Behaviors for Terminal Agents

    Aug 23, 2026Yihang Yao, Bo Pang, Xuan Phi Nguyen +3Agentic Reinforcement LearningAgentic Benchmarks

  22. ToSCA: Leveraging Hierarchical Reinforcement Learning on Temporal and Strategic Abstractions of Conversational Agents

    Aug 22, 2026Xiaoyu Wang, Qingqing Gu, Yue Zhao +5Hierarchical Reinforcement LearningAgentic Reinforcement Learning

  23. RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

    Aug 19, 2026Yugu Li, Zehong Cao, Jianglin Qiao +1Agentic Reinforcement LearningFrictive Policy Optimization

  24. LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

    Aug 12, 2026Zhixin Zhang, Xinke Jiang, Zhibang Yang +5Long-Horizon AgentsAgentic Reinforcement Learning

  25. Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents

    Aug 10, 2026Tianjun Pan, Yuan Li, Hongda Wang +8Unsupervised On-Policy Self-DistillationAgentic Reinforcement Learning

  26. Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning

    Aug 8, 2026Yifu Huo, Shunjie Xing, Chenglong Wang +8Agentic Reinforcement LearningCredit Assignment

  27. Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

    Aug 7, 2026Haoyu Zheng, Yun Zhu, Qing Wang +1Agentic Reinforcement LearningHindsight

  28. DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

    Aug 7, 2026Xucong Wang, Zhe Zhao, Liheng Yu +3Reinforcement Learning With Verifiable RewardCritic-Free Reinforcement Learning

  29. EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

    Aug 6, 2026Zishan Xu, Zhiyuan Yao, Yuxin Chen +9Agentic Reinforcement LearningLarge Language Model Agents

  30. AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

    Aug 6, 2026Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao +10Agentic Reinforcement LearningUnsupervised On-Policy Self-Distillation

  31. Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding

    Aug 6, 2026Xiaofeng Wang, Kakam Chong, Shuai Xiao +9Agentic Reinforcement LearningNegotiation

  32. Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

    Aug 5, 2026Yi Yang, Cong Qin, Xiaodan Liu +8Unsupervised On-Policy Self-DistillationSelf-Distillation Framework

  33. Agentic Reinforcement Learning with Self-Distilled Reward Shaping

    Aug 4, 2026Ranxu Zhang, Guinan Chen, Chenshaodong +5Agentic Reinforcement LearningPotential-Based Reward Shaping

  34. Cross-Domain Hybrid OPD for Generalizable Search Agents

    Aug 3, 2026Hongzhan Chen, Xiaoyu Liu, Dengming Zhang +11Search AgentsAgentic Reinforcement Learning

  35. PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

    Aug 3, 2026Chunji Lv, Yangguang Wei, Junlin Liu +6Unsupervised On-Policy Self-DistillationAgentic Reinforcement Learning

  36. Progressive Agent Skill Generation via Reinforcement Learning

    Aug 3, 2026Junhao Shen, Zhanqiu Zhang, Yiwen Guo +1Agentic Reinforcement LearningData Generation Pipelines

  37. SERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic Learning

    Aug 1, 2026Tao Liu, Tao Feng, Xiangheng Li +9Text-To-SqlSql

  38. Group-Reflective Self-Distillation for Agentic Reinforcement Learning

    Jul 30, 2026Binbin Zheng, Zijun Xie, Guanqun Zhao +4Agentic Reinforcement LearningUnsupervised On-Policy Self-Distillation

  39. SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

    Jul 30, 2026Yang Zhou, Zixuan Huang, Sunzhu Li +10Recent Vision-Language ModelsGeospatial Reasoning

  40. SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

    Jul 29, 2026Zhiyuan Yao, Yuxin Chen, Zhengxi Lu +13Self-Evolving Skill LibrariesSkills

  41. Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection

    Jul 29, 2026Yikun Li, Ting Zhang, Jiakun Liu +9Vulnerable CodeAgentic Reinforcement Learning

  42. Kimi K3: Open Frontier Intelligence

    Jul 27, 2026Kimi Team, Tongtong Bai, Yifan Bai +399Qwen3Intelligence

  43. PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning

    Jul 23, 2026Yipeng Shi, Zhipeng Ma, Yue Wang +4Agentic Reinforcement LearningOptical Coherence Tomography

  44. Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

    Jul 19, 2026Amez Amanj Ali, Kuo-Kun TsengAgentic Reinforcement LearningLarge Language Model Workflows

  45. When Does Muon Help Agentic Reinforcement Learning?

    Jul 17, 2026Kai Ruan, Jinghao Lin, Zihe Huang +4MuonAdam

  46. ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

    Jul 17, 2026Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu +5Agentic Reinforcement LearningLong-Horizon Task Planning

  47. SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

    Jul 16, 2026Jinyang Wu, Shuo Yang, Zhengxi Lu +8Agentic Reinforcement LearningUnsupervised On-Policy Self-Distillation

  48. TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

    Jul 15, 2026Leitian Tao, Baolin Peng, Wenlin Yao +5Credit AssignmentAgentic Reinforcement Learning

  49. Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning

    Jul 15, 2026Xiaopeng Zhang, Yueyang Weng, Qi Liu +2Robotic ManipulationAgentic Reinforcement Learning