LLM Agent Training

LLM: Large Language Model

Latest papers 354

All topics
CardsList
  1. Direct Diversity Optimization for Diverse Successful Trajectories in Preference Post-Training

    Sep 9, 2026Junwon Ko, Dong-Jae Lee, Minchan Kwon +2Offline RLPreference Optimization

  2. MARBO: Relational Belief Grounding for LLM Agents in Social Deduction Games

    Sep 6, 2026Yechan Hwang, Sangjun Bae, Jeongmo Kim +2Game-Playing AgentsSocial Deduction Games

  3. First Things First: Teaching LLM-Based Agents to Prioritize Must-Haves before Nice-to-Haves

    Sep 4, 2026Tianjie Ju, Xinyue Xu, Wanxuan Sun +4RL for Language Model ReasoningAI Agent Benchmarks

  4. Iris: Climbing to the Search Frontier

    Sep 3, 2026Ziyuan Liu, Hengqi Liu, Zichuan Wang +8Multi-Hop QAWeb Search Agents

  5. Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments

    Sep 3, 2026Jie Wu, Zhenru Zhang, Beichen Zhang +11Software Engineering AgentsLLM Agent Trajectory Synthesis

  6. PersuaRL: Reinforcement Learning-Driven Multi-Expert Selection for Persuasive Dialogue Generation in Insurance

    Sep 1, 2026Rohan Kirti, Akash Ghosh, Aryan Vats +5RL for Language ModelsLLM Agent Training

  7. WHALE: A Simple Recipe for Joint Harness-Weight Optimization

    Aug 31, 2026Haechan Kim, Yoonho Lee, Gisang Lee +2Agent Harness OptimizationLLM Agent Training

  8. SimCRAFT: Distilling Remote Sensing Agents via Synthetic Trajectories and Contextual Retrieval-Augmented Fine-Tuning

    Aug 31, 2026Haoran Wang, Jing Yao, Xu Yang +4Fine-TuningRemote Sensing

  9. CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

    Aug 31, 2026Amir Saeidi, Zehua Zhang, Rishitosh Singh +6LLM AgentsLLM Agent Training

  10. Beyond Task Completion: Training Capable and Safe Computer-Use Agents

    Aug 27, 2026Zeyu Kang, Zhenyun Yin, Yang Zhang +5Computer-Use AgentsAI Agent Safety

  11. CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

    Aug 24, 2026Jian Yang, Haau-Sing Li, Shawn Guo +10CybersecuritySoftware Security

  12. One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL

    Aug 12, 2026Simon Yu, Nicholas Tomlin, Marwa Abdulhai +7Multi-Agent LLM SystemsHuman Behavior Simulation

  13. ExRole: From Team Trajectories to Executable Roles in Multi-Agent Language Models

    Aug 12, 2026Zhou Liu, Chaoyang Han, Zewei Pan +2LLM Agent TrainingMulti-Agent LLMs

  14. MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale

    Aug 11, 2026Yuhang Yao, Zeyu Wang, Wanyi Chen +8Continual Learning for LLM AgentsLLM Fine-Tuning

  15. Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models

    Aug 10, 2026Shulin Tian, Ziqi Huang, Fan Zhang +3Tool-Augmented Language Model AgentsAI Agent Evaluation

  16. Beyond the Capability Boundary: Zeroth-Order Optimization for Self-Evolving LLM Agents

    Aug 10, 2026Bingzhen Liu, Xiaomeng Fan, Yuwei Wu +4Zeroth-Order OptimizationLLM Agent Training

  17. Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

    Aug 7, 2026Jiacheng Miao, Jin Mu, Guanhua Chen +1AI Agent BenchmarksLLM Agent Training

  18. CyberForge: Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training

    Aug 6, 2026Amine Lbath, Manan Suri, Aurelien Delaitre +4Automated Program RepairSoftware Vulnerability Detection

  19. CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

    Aug 6, 2026Fanzhe Meng, Guoxin Chen, Jiale Zhao +6LLM Agent TrainingAgent Benchmarks

  20. EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

    Aug 6, 2026Zishan Xu, Zhiyuan Yao, Yuxin Chen +9LLM World ModelsAgentic RL

  21. StepReflect: Structured UI Transition Reflection for Mobile GUI Agents

    Aug 6, 2026Linqiang Guo, Wei Liu, Li Gu +3Mobile GUI AutomationGUI Agents

  22. Recursive Synthesis for Long-Horizon Terminal Tasks

    Aug 5, 2026Zhongzhi Li, Yucheng Shi, Zongxia Li +8Terminal AgentsSynthetic Benchmark Generation

  23. State2State: Environment-Derived Mid-Training for LLM Agents

    Aug 5, 2026Xuanyu Lei, Yiqi Zhu, Chenliang Li +6LLM Agent TrainingGoal-Conditioned RL

  24. A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination

    Aug 5, 2026Wenxiao Zhao, Dong Liu, Kaiyi Xu +9Multi-Agent LLM SystemsLLM Agent Training

  25. Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation

    Aug 3, 2026Chishui Chen, Yaoyou Fan, Te Sun +11LLM Agent TrainingOn-Policy Distillation

  26. CRISP: Critical Step Perception for Training Efficient Deep Search Agents

    Aug 3, 2026Haosi Mo, Zihao Yan, Ruiqing Zhang +4LLM AgentsLLM Agent Training

  27. SearchMaster: Grounded and Regulated Self-Play for Search Agents

    Aug 3, 2026Wentao Tan, Qiong Cao, Jiaqi Wang +1Multi-Hop QATool-Augmented Language Model Agents

  28. SyncPlan: Long-Horizon LLM Coordination with Explicit Synchronization and Adaptive Correction

    Aug 3, 2026Shen You, Xiaoming Zhu, Weining Weng +17Multi-Agent CoordinationLLM Planning

  29. Search-GRT: Guided Retrieval Training of Search Agents to Optimize for Complex Question Answering

    Aug 2, 2026Aounon Kumar, Sudipta Paul, Vivek Kulkarni +2Multi-Hop QAAgentic RAG

  30. Deep Research Pretraining via Predictive Navigation

    Aug 1, 2026Jiang Zhou, Zhiyuan Fan, Xing Wu +3Deep Research AgentsLLM Agent Training

  31. Learning to Coordinate Symbolic Tools: LLM Agents for Verified Sum-of-Squares Certificates

    Jul 31, 2026Bohan Chen, Shivam N. Patel, Richard Hoffmann +2LLM Agent VerificationTool-Using Agents

  32. MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation

    Jul 31, 2026Hang Yan, Zhangxuan GU, Beitong Zhou +5Multi-Teacher Knowledge DistillationLLM Agent Training

  33. Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

    Jul 30, 2026Hanzhang Zhou, Panrong Tong, Xu Zhang +13Mobile GUI AutomationComputer-Use Agents

  34. Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

    Jul 30, 2026Yash Pandya, Sahil Gupta, Sarthak Harne +10Computer-Use Agent BenchmarksComputer-Use Agents

  35. SKILL-KD: Contrastive Skill Distillation for LLM Agents

    Jul 30, 2026Qiming Shi, Yibo Dou, Jiawen Zhu +5LLM Agent Skill LearningLLM Agent Training

  36. Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training

    Jul 30, 2026Zhihong Pan, Jiyuan He, Kai Zhang +5Synthetic Data GenerationTerminal Agents

  37. MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

    Jul 29, 2026Yihao Chen, Shi Chang, Khaled Chawa +4Program SynthesisAutomated Software Engineering

  38. WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback

    Jul 29, 2026Haoliang Ming, Feifei Li, Wenhui QueMulti-Hop QAKG Construction

  39. Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

    Jul 28, 2026Jiabao Ji, Yujian Liu, Li An +4Tool-Using AgentsLLM Agent Training

  40. Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering

    Jul 27, 2026Rushi Qiang, Changhao Li, Haotian Sun +3LLM Agent OrchestrationLLM Agents

  41. ACM: Agentic Context Management for Long Horizon Tasks

    Jul 26, 2026Xiaochuan Li, Ryan Ming, Meng Chu +3LLM Agent TrainingLong-Horizon Agent Tasks

  42. AgentOmnia: Scaling Agentic Models for Full-Scenario Applications

    Jul 25, 2026Hao Jiang, Gangtao Xin, Yingdi Huang +35Tool-Augmented Language Model AgentsAgentic RL