LLM Agent Training

LLM: Large Language Model

Latest papers 354

All topics
CardsList
  1. From History to State: Constant-Context Skill Learning for LLM Agents

    May 6, 2026Haoyang Xie, Xinyuan Wang, Yancheng Wang +2LLM Agent Skill LearningLLM Agent Training

  2. SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning

    May 2, 2026Tianshi Zheng, Rui Wang, Xiyun Li +5AI for ScienceDeep Research Agents

  3. MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate

    May 2, 2026Jianze Wang, Ying Liu, Jinlong Chen +7Multi-Agent DebateMulti-Teacher Knowledge Distillation

  4. AutoSurfer -- Teaching Web Agents through Comprehensive Surfing, Learning, and Modeling

    Apr 29, 2026Fazle Elahi Faisal, Qianhui Wu, Baolin Peng +1LLM Agent TrainingWeb Agents

  5. ClawGym: A Scalable Framework for Building Effective Claw Agents

    Apr 29, 2026Fei Bai, Huatong Song, Shuang Sun +11Synthetic Data GenerationAI Agent Benchmarks

  6. Recursive Multi-Agent Systems

    Apr 28, 2026Jiaru Zou, Rui Pan, Ruizhong Qiu +8Multi-Agent LLM SystemsLanguage Modeling

  7. Toward Scalable Terminal Task Synthesis via Skill Graphs

    Apr 28, 2026Zhiyuan Fan, Tinghao Yu, Yuanjun Cai +8Terminal AgentsLLM Agent Trajectory Synthesis

  8. DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents

    Apr 27, 2026Junshuo Zhang, Chengrui Huang, Feng Guo +6Reinforcement LearningRL Exploration

  9. Poster: ClawdGo: Endogenous Security Awareness Training for Autonomous AI Agents

    Apr 27, 2026Jiaqi Li, Yang Zhao, Bin Sun +3AI Agent SecurityLLM Agent Training

  10. Nemobot Games: Crafting Strategic AI Gaming Agents for Interactive Learning with Large Language Models

    Apr 23, 2026Chee Wei Tan, Yuchen Wang, Shangxin GuoGame-Playing AgentsLLM Agents

  11. Learning to Communicate: Toward End-to-End Optimization of Multi-Agent Language Systems

    Apr 23, 2026Ye Yu, Heming Liu, Haibo Jin +3Multi-Agent System OptimizationLLM Agent Training

  12. Supplement Generation Training for Enhancing Agentic Task Performance

    Apr 22, 2026Young Min Cho, Daniele Bonadiman, Divya Bhargavi +8LLM Agent TrainingPrompt Optimization

  13. Training and Agentic Inference Strategies for LLM-based Manim Animation Generation

    Apr 20, 2026Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle +2RL for Code GenerationText-to-Video Generation

  14. ComPASS: Towards Personalized Agentic Social Support via Tool-Augmented Companionship

    Apr 20, 2026Zhaopei Huang, Yanfeng Jia, Jiayi Zhao +3AI CompanionsAI Agent Benchmarks

  15. Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence

    Apr 20, 2026Guanting Dong, Junting Lu, Junjie Huang +17Lifelong Learning AgentsAI Agent Benchmarks

  16. Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration

    Apr 20, 2026Qifan Zhang, Dongyang Ma, Tianqing Fang +5Intrinsic MotivationLLM Agent Self-Improvement

  17. AIT Academy: Cultivating the Complete Agent with a Confucian Three-Domain Curriculum

    Apr 20, 2026Jiaqi Li, Lvyang Zhang, Yang Zhao +2LLM Agent Skill LearningCurriculum Learning

  18. LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent

    Apr 20, 2026Wanli Li, Bince Qu, Bo Pan +5Agentic RLDeep Research Agents

  19. Democratizing Tool Learning with Environments Fully Simulated by a Free 8B Language Model

    Apr 20, 2026Chenming Tang, Hsiu-Yuan Huang, Weijie Liu +3LLM Agent TrainingRL for Tool Use

  20. Small Model as Master Orchestrator: Learning Unified Agent-Tool Orchestration with Parallel Subtask Decomposition

    Apr 18, 2026Wenzhen Yuan, Wutao Xiong, Fanchen Yu +7Multi-Agent System OptimizationMulti-Agent Orchestration

  21. AgentV-RL: Scaling Reward Modeling with Agentic Verifier

    Apr 17, 2026Jiazheng Zhang, Ziche Fu, Zhiheng Xi +13Reward ModelingRL for Language Model Reasoning

  22. CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

    Apr 17, 2026Shidong Yang, Ziyu Ma, Tongwen Huang +3LLM Agent TrainingRL for LLM Agents

  23. SAT: Sequential Agent Tuning for Coordinator Free Plug and Play Multi-LLM Training with Monotonic Improvement Guarantees

    Apr 17, 2026Yi Xie, Yangyang Xu, Yi Fan +1LLM Agent TrainingDecentralized MARL

  24. Subliminal Transfer of Unsafe Behaviors in AI Agent Distillation

    Apr 16, 2026Jacob Dang, Brian Y. Xie, Omar G. YounisSubliminal LearningLanguage Model Distillation

  25. Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis

    Apr 16, 2026Zhiyuan Zhai, Wenjing Yan, Xiaodan Shao +1LLM Agent TrainingRL for LLM Agents

  26. Mind DeepResearch Technical Report

    Apr 16, 2026MindDR Team, Li Auto IncMulti-Agent LLM SystemsDeep Research Agents

  27. UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents

    Apr 13, 2026Yijuan Liang, Xinghao Chen, Yifan Ge +5LLM Agent EvaluationAI Agent Benchmarks

  28. Agentic Tool Use in Large Language Models

    Apr 1, 2026Jinchao Hu, Meizhi Zhong, Kehai Chen +2LLM Agent EvaluationTool-Using Agents

  29. Meta-TTL: Meta-Learning Self-Improvement Policies for Language Agents

    Apr 1, 2026Zhanzhi Lou, Hui Chen, Yibo Li +2Meta-LearningTest-Time Training

  30. Retrieval-Augmented LLM Agents: Learning to Learn from Experience

    Mar 18, 2026Thomas Palmeira Ferraz, Romain Deffayet, Vassilina Nikoulina +2Fine-TuningLLM Agent Training

  31. OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis

    Mar 17, 2026Zhuofeng Li, Dongfu Jiang, Xueguang Ma +7Deep Research AgentsLLM Agent Trajectory Synthesis

  32. The Trace Is the State: Exact Credit Assignment for LLM Agent Teams

    Mar 6, 2026Yanjun Chen, Yirong Sun, Hanlin Wang +5Credit AssignmentCounterfactual Credit Assignment

  33. ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning

    Feb 25, 2026Xiaoxuan Wang, Han Zhang, Haixin Wang +11Agentic RLReinforcement Learning

  34. TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents

    Feb 12, 2026Aladin Djuhera, Swanand Kadhe, Farhan Ahmed +3Tree SearchLLM Agent Training

  35. GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models

    Jan 26, 2026Shaokang Wang, Pei Fu, Ruoceng Zhang +7GUI AgentsTest-Time Scaling

  36. OpenTinker: Separating Concerns in Agentic Reinforcement Learning

    Jan 12, 2026Siqi Zhu, Jiaxuan YouAgentic RLLLM Agent Training

  37. InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training

    Jan 7, 2026Ziyun Zhang, Zezhou Wang, Xiaoyi Zhang +4Web Application GenerationGUI Agents

  38. SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models

    Jan 7, 2026Yuxuan Jiang, Francis FerraroProcess Reward ModelsRL for Language Model Reasoning

  39. Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents

    Nov 11, 2025Chih-Hsuan, Yang, Tanwi Mallick +5Multi-Agent LLM SystemsCooperative Game Theory

  40. Communication and Verification in LLM Agents towards Collaboration under Information Asymmetry

    Oct 29, 2025Run Peng, Ziqiao Ma, Amy Pang +5Multi-Agent LLM SystemsLLM Agent Verification

  41. OpenPhone: Mobile Agentic Foundation Models

    Oct 24, 2025Yangqin Jiang, Chao HuangOn-Device Language Model InferenceGUI Agents

  42. BuilderBench: The Building Blocks of Intelligent Agents

    Oct 7, 2025Raj Ghugare, Roger Creus Castanyer, Catherine Ji +4Long-Horizon Agent EvaluationRobot Manipulation Benchmarks

  43. Interactive Learning for LLM Reasoning

    Sep 30, 2025Hehai Lin, Shilei Cao, Sudong Wang +5RL for Language Model ReasoningLLM Agent Training

  44. DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents

    Sep 26, 2025Yansong Ning, Rui Liu, Jun Wang +6Agentic RLLLM Agent Training

  45. Web-CogReasoner: Towards Multimodal Knowledge-Induced Cognitive Reasoning for Web Agents

    Aug 3, 2025Yuhan Guo, Cong Guo, Aiwen Sun +12Cognitive ModelingMultimodal Reasoning

  46. Meta-SecAlign: Training LLMs against Prompt Injection for Robust Agents

    Jul 3, 2025Sizhe Chen, Arman Zharmagambetov, David Wagner +1LLM Agent SecurityAI Agent Security Benchmarks

  47. Clearing the Fog: Towards Installing and Refining Proactive Exploration Capabilities in LLM Agents

    Date pendingZhizhao Guan, Chen Huang, Ziming Liu +5RL ExplorationLLM Agents