LLM Agent Training

LLM: Large Language Model

Latest papers 354

All topics
CardsList
  1. PersonalPlan: Planning Multi-Agent Systems for Personalized Programming Learning

    Jun 17, 2026Zhiyuan Wen, Jiannong Cao, Peng Gao +4Programming EducationLLM Agent Training

  2. ProCUA-SFT Technical Report

    Jun 15, 2026Jaehun Jung, Ximing Lu, Brandon Cui +11Supervised Fine-TuningComputer-Use Agents

  3. PACT: Privileged Trace Co-Training for Multi-Turn Tool-Use Agents

    Jun 15, 2026Zhenbang Du, Jun Luo, Zhiwei Zheng +8Learning from DemonstrationLLM Agent Training

  4. On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents

    Jun 14, 2026Gengsheng Li, Mao Zheng, Mingyang Song +8Language Model DistillationLLM Agent Training

  5. Retrospective Progress-Aware Self-Refinement for LLM Agent Training

    Jun 12, 2026Xinbei Ma, Congmin Zheng, Jiyang Qiu +11Reward ShapingLLM Agent Training

  6. CacheRL:Multi-Turn Tool-Calling Agents via Cached Rollouts and Hybrid Reward

    Jun 12, 2026Md Amirul Islam, Sumiran Thakur, Huancheng Chen +3LLM Agent TrainingTool-Using Language Agents

  7. HyperTool: Beyond Step-Wise Tool Calls for Tool-Augmented Agents

    Jun 11, 2026Yaxin Du, Yifan Zhou, Yujie Ge +7Tool-Augmented Language Model AgentsLLM Agent Workflow Optimization

  8. ComAct: Reframing Professional Software Manipulation via COM-as-Action Paradigm

    Jun 11, 2026Jiaxin Ai, Tao Hu, Xuemeng Yang +11Computer-Use AgentsProgram Synthesis

  9. SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents

    Jun 11, 2026Ziyi Wang, Yuxuan Lu, Yimeng Zhang +8AI Agent ReliabilityReinforcement Learning

  10. HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness

    Jun 11, 2026Xiaoxuan Wang, Haixin Wang, Alexander Taylor +3Agent Harness OptimizationLLM Agent Training

  11. Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher

    Jun 10, 2026Hongming Piao, Chi Liu, Mengzhuo Chen +5Deep Research AgentsLLM Agent Training

  12. FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents

    Jun 10, 2026Jia Deng, Yimeng Chen, Xiaoqing Xiang +9Deep Research AgentsAgentic Search

  13. ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories

    Jun 9, 2026Siyuan Luo, Nairong Zheng, Lin Zhou +6Synthetic Data GenerationTool-Using Agents

  14. EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents

    Jun 9, 2026Weixian Xu, Shilong Liu, Mengdi WangContinual Learning for LLM AgentsLLM Agent Self-Improvement

  15. Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution

    Jun 9, 2026Xucong Wang, Ziyu Ma, Shidong Yang +4LLM Agent Self-ImprovementLLM Agent Training

  16. SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research

    Jun 8, 2026Pu Ning, Quan Chen, Kun Tao +7Multi-Agent LLM SystemsLLM Agent Orchestration

  17. Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

    Jun 8, 2026Daoyu Wang, Mingyue Cheng, Qingchuan Li +3Agentic RLReinforcement Learning

  18. ComplexConstraints and Beyond: Expert Rubrics for RLVR

    Jun 8, 2026Sushant Mehta, Liudas Panavas, Suhaas Garre +1LLM-as-a-JudgeRubric-Based RL

  19. Bridging the Agent-World Gap: Text World Models for LLM-based Agents

    Jun 8, 2026Yixia Li, Hongru Wang, Peng Lai +13LLM World ModelsWorld Models

  20. Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care

    Jun 8, 2026Aiyuan Yang, Canbin Piao, Chengfeng Dou +25RL for Language ModelsHealthcare

  21. PACT: Learning Diverse Diagnostic Strategies via Privileged Synthesis and Branch Consensus

    Jun 8, 2026Gen Li, Yuanze Hu, Zhichao Yang +10Medical DiagnosisClinical Reasoning

  22. SSR: Can Simulated Patients Learn to Stigmatize Themselves? Modeling Self-Stigma through Internal Monologue

    Jun 6, 2026Kunyao Lan, Bingrui Jin, Zichen Zhu +1Human Behavior SimulationMental Health