LLM Agent Training

LLM: Large Language Model

Latest papers 354

All topics
CardsList
  1. Firefly: Illuminating Large-Scale Verified Tool-Call Data Generation from Real APIs

    May 17, 2026Yuxuan Lu, Ziyi Wang, Yingzhou Lu +12Tool-Augmented Language Model AgentsSynthetic Data Generation

  2. FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast

    May 15, 2026Igor Bogdanov, Chung-Horng Lung, Thomas Kunz +3LLM Agent MemoryLLM Agent Self-Improvement

  3. Look Before You Leap: Autonomous Exploration for LLM Agents

    May 15, 2026Ziang Ye, Wentao Shi, Yuxin Liu +6RL ExplorationLLM Agents

  4. AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs

    May 15, 2026Haizhong Zheng, Yizhuo Di, Jiahui Wang +7Agentic RLReinforcement Learning

  5. Orchard: An Open-Source Agentic Modeling Framework

    May 14, 2026Baolin Peng, Wenlin Yao, Qianhui Wu +11AI Coding AgentsComputer-Use Agents

  6. Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

    May 14, 2026Weimin Xiong, Shuhao Gu, Bowen Ye +5GUI AgentsLLM Agent Training

  7. Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model

    May 14, 2026Minghao Wu, Yuting Yan, Zhenyang Cai +9Agentic RLClinical Decision Support

  8. Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)

    May 13, 2026Marius S. Knorr, Robert Müller, Jan P. Bremer +1HealthcareRL for Language Model Reasoning

  9. Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling

    May 13, 2026Coleman Hooper, Minwoo Kang, Suhong Moon +7Tool-Using AgentsLLM Agents

  10. MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning

    May 13, 2026Yuxin Liu, Ziang Ye, Yueqing Sun +6LLM Agent TrainingLong-Horizon LLM Agents

  11. Revisiting DAgger in the Era of LLM-Agents

    May 13, 2026Changhao Li, Rushi Qiang, Jiawei Huang +4Software Engineering AgentsDataset Aggregation

  12. Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents

    May 13, 2026Harshita Chopra, Kshitish Ghate, Aylin Caliskan +3Human Behavior SimulationLLM Agent Evaluation

  13. Learning Agentic Policy from Action Guidance

    May 12, 2026Yuxiang Ji, Zengbin Wang, Yong Wang +6Agentic RLReinforcement Learning

  14. Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents

    May 11, 2026Shijue Huang, Hangyu Guo, Guanting Dong +8Multimodal IRTool-Using Vision-Language Agents

  15. Step Rejection Fine-Tuning: A Practical Distillation Recipe

    May 11, 2026Igor Slinko, Ilia Zavidnyi, Egor Bogomolov +1Supervised Fine-TuningLLM Agent Training

  16. DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning

    May 11, 2026Haoyu Huang, Jiaxin Bai, Shujie Liu +6Knowledge EditingKnowledge Augmentation for Language Models

  17. EGL-SCA: Structural Credit Assignment for Co-Evolving Instructions and Tools in Graph Reasoning Agents

    May 11, 2026Zike Yuan, Yukun Cao, Han Zhang +7Program SynthesisLLM Agent Training

  18. AHD Agent: Agentic Reinforcement Learning for Automatic Heuristic Design

    May 9, 2026Haoze Lv, Ning Lu, Ziang Zhou +1Agentic RLAutomated Heuristic Design

  19. CoCoDA: Co-evolving Compositional DAG for Tool-Augmented Agents

    May 8, 2026Ziyang Yu, Qiyue Li, Liang ZhaoLLM Tool UseLLM Agent Training

  20. SOD: Step-wise On-policy Distillation for Small Language Model Agents

    May 8, 2026Qiyong Zhong, Mao Zheng, Mingyang Song +5LLM Agent TrainingOn-Policy Distillation

  21. MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs

    May 8, 2026Hsin-Ling Hsu, Zizheng Wang, Donghua Zhang +9HealthcareMedical Diagnosis

  22. MedExAgent: Training LLM Agents to Ask, Examine, and Diagnose in Noisy Clinical Environments

    May 8, 2026Yicheng Gao, Xiaolin Zhou, Yahan Li +2HealthcareMedical Diagnosis

  23. Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization

    May 7, 2026Da Long, Lingyi Fu, Diya Michelle Rao +3Adversarial TrainingMulti-Agent LLM Systems

  24. Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents

    May 7, 2026Ziming Li, Jiatan Huang, Xiaoguang Guo +2LLM Agent TrainingInference-Time Compute Allocation

  25. Recursive Agent Optimization

    May 7, 2026Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang +2Agentic RLInference-Time Scaling