LLM Agent Training

LLM: Large Language Model

Latest papers 354

All topics
CardsList
  1. Environmental Feedback Modeling Matters: Rethinking Feedback Treatment in Agentic Hindsight Self-Distillation

    Oct 8, 2026Hangxi Guo, Fengyuan Liu, Yue Wang +4LLM Agent TrainingSelf-Distillation

  2. Training Advisors for LLM Agents from Task Outcomes

    Oct 7, 2026Sergei Polezhaev, Barys Liskavets, Ori Press +1LLM Agent TrainingRL for LLM Agents

  3. MIMESIS: Learning User Simulators as Training Environments for Interactive Agents

    Oct 7, 2026Hoang Phan, Dat Huynh, Andrey Zhmoginov +7User SimulationLLM Agent Training

  4. GraphOPD: Graph-Augmented On-Policy Distillation for LLM Agents

    Oct 6, 2026Bohan Lin, Liyi Chen, Zhuoning Guo +5LLM Agent TrainingOn-Policy Distillation

  5. AdvSim2Real : Training Web Agents Against Adaptive Prompt Injection in a Web World Model

    Oct 6, 2026Sarim Hashmi, Mukul Ranjan, Kshitij Mishra +3Adversarial TrainingSim-to-Real Transfer

  6. RAISED: Self-Distillation for Robustness to Prompt Injection in LLM Agents

    Oct 5, 2026Mohamed Dhouib, Clement Elliker, Alexi Canesse +5Prompt Injection DefenseLLM Agents

  7. Imagine to Act: High-Fidelity Data Synthesis via Image Editing World Model for Scalable GUI Agent Training

    Oct 5, 2026Yongxin Ning, Runliang Niu, Qianli Xing +4World ModelsSynthetic Data Generation

  8. Selecting Long-Horizon Trajectories for Reliable and Efficient Terminal-Agent Training

    Oct 5, 2026Cuong Dang, Hoang Anh Just, Ruoxi JiaSupervised Fine-TuningTrajectory Generation

  9. Sibyl: An Efficient Small-large Model Collaboration Framework for Long-horizon Tasks

    Oct 4, 2026Zhewei Fang, Yuxin Zhang, Zhenwei Shao +8LLM Agent TrainingLong-Horizon LLM Agents

  10. Harness Annealing: Learning to Act with Less External Control

    Oct 1, 2026Yingxuan Yang, Huacan Chai, Ying WenLanguage Model-Based ControlAgent Harness Optimization

  11. Federated Agent Optimization

    Oct 1, 2026Qiang Yang, Zhiqiang Kou, Xueyi Zhang +6LLM Agent TrainingFederated Learning

  12. It Takes Workflows to Evolve Better Workflows

    Oct 1, 2026Xuehang Guo, Haoyu Wang, Haifeng Chen +3LLM Agent Workflow OptimizationMulti-Agent Collaboration

  13. PG-SFT: Balancing Capability Acquisition and Retention in Offline Agent Fine-Tuning

    Oct 1, 2026Ronghua Li, Zi Liang, Zhishan Li +1Supervised Fine-TuningLLM Agent Training

  14. PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents

    Sep 30, 2026Yinghui He, Yapei Chang, Khushi Bhardwaj +4Language Model DistillationLLM Agent Training

  15. PhantomEnvironments: Training LLM Agents in Fictional Worlds

    Sep 30, 2026Anmol Kabra, Swathi Saravana Selvam, Albert Gong +5Multi-Hop QAReinforcement Learning

  16. Learning Reliable GUI Agents under Imperfect Priors

    Sep 30, 2026Bo Han, Qianyi Wang, Shuai Liu +9GUI AgentsLLM Agent Training

  17. WorkGenesis: Building the Worlds That Teach Agents to Work

    Sep 30, 2026Xinyu Zhu, Fenyi Liu, Yuzhu Cai +4LLM Agent TrainingSynthetic Data Generation for Language Models

  18. GraphForge: Training Working Agents with Graph-Anchored Workspace Synthesis

    Sep 30, 2026Qisheng Su, Hanchen Wang, Guanru Zhu +10AI Agent BenchmarksLLM Agent Training

  19. GraphCert: Bootstrap Agentic Graph Reasoning with Certified Evidence Rubrics

    Sep 30, 2026Weiqi Jiang, Yuchen Ying, Rui Wang +5LLM Reasoning with GraphsRL for Language Model Reasoning

  20. EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making

    Sep 29, 2026Yuhan Guo, Jinming Liu, Liang Xu +8LLM Agent TrainingGeneralization in RL

  21. Character Training for Risk-Averse Agents

    Sep 29, 2026Arav Dhoot, Punya Syon Pandey, Jamie Johnson +3Risk-Sensitive RLAI Agent Safety

  22. HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents

    Sep 29, 2026Tongbo Chen, Junbo Niu, Zhengxi Lu +8Computer-Use AgentsGUI Agents

  23. AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks

    Sep 29, 2026Hongjin Qian, Chaofan Li, Kun Luo +11LLM Self-RefinementLLM Agent Training

  24. AnthroDial: Benchmarking LLM Anthropomorphism in Autonomous Social Interaction

    Sep 29, 2026Wentao Liu, Xi Chen, Siyu Song +13LLM Agent EvaluationLLM Agent Training

  25. SkillGym: Training Skill-Use Agents with Automatic Verifiable Environment Generation

    Sep 29, 2026Renxi Wang, Mingshan Hee, Fajri Koto +2Supervised Fine-TuningLLM Agent Skill Learning

  26. Towards Communication-Efficient Social Intelligence in Language Agents

    Sep 28, 2026Linxiao Gong, Yijie Xu, Tianfu Wang +7LLM AgentsLLM Agent Training

  27. EvoIn: Bridging Evolution and Internalization for Agent Fine-Tuning

    Sep 28, 2026Shihan Dou, Shaofan Liu, Zhonghang Lu +8LLM Agent TrainingSelf-Improving Agents

  28. Action-Space Shaping for LLM Agents: Measuring and Mitigating Tool-Schema Bias

    Sep 28, 2026Yinhong Liu, Zhili Tan, Zilin Wang +1LLM Agent EvaluationLLM Tool Use

  29. Just-In-Time Agent Memory with Runtime Agentic Research

    Sep 28, 2026Bingyu Yan, Chaofan Li, Hongjin Qian +3Agent MemoryAgentic RAG

  30. When Successful Strategies Fail: Adaptation to Environmental Novelty in Terminal Agents

    Sep 27, 2026Janvijay Singh, Vaishnavi Shrivastava, Dilek Hakkani-Tur +2Long-Horizon Agent EvaluationAI Agent Benchmarks

  31. ParaAgent: Reinforcing Parallel Acting in Open-World Tool Environments

    Sep 27, 2026Shengbin Yue, Hongru Wang, Siyuan Wang +3LLM Agent TrainingTool Use

  32. Breaking the Environment Wall: A Unified Framework for Preparing and Evolving Agent-Native Environments

    Sep 24, 2026Yukai Wu, Yuanjing Yang, Le Zhou +8LLM Agent Self-ImprovementLLM Agent Training

  33. From Self-Distillation to Self-Practice: Privileged Information for Multi-Turn Agents

    Sep 24, 2026Xingyu Su, Abhishek Kumar, Qing Ping +5On-Policy Self-DistillationLLM Agent Training

  34. Forecast-Dojo: Replayable Environments for Benchmarking and Training LLM Forecasting Agents

    Sep 24, 2026Liqin Ye, Haorui Wang, Fardin Ahmed +8LLM Agent EvaluationForecasting Benchmarks

  35. The Fellowship of the Query: Learning Retrieval Actions

    Sep 23, 2026Mohammed Al-Maamari, Saber Zerhoudi, Michael Granitzer +1LLM Fine-TuningAgentic RAG

  36. Agent-Editing World Model: Rethinking World Modeling for LLM Agents

    Sep 23, 2026Shuang Sun, Guoxin Chen, Fanzhe Meng +6LLM World ModelsWorld Models

  37. SkillGym: Internalizing Human Skills into LLMs for Real-World Problem Solving

    Sep 23, 2026Zhilong Ge, Yuting Shao, Yutao Yang +6Tool-Augmented Language Model AgentsLLM Agent Skill Learning

  38. Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms

    Sep 23, 2026Xinjie Shen, Wei Fan, Xudong Guo +5Agentic RLReinforcement Learning

  39. Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents

    Sep 22, 2026Laizhen Li, Jiarui Li, Juanjuan Zhao +4Agent Harness OptimizationLLM Agent Workflow Optimization

  40. The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

    Sep 22, 2026Wenbo Pan, Zhichao Liu, Shujie Liu +6Software Engineering BenchmarksLong-Horizon Agent Evaluation

  41. Harness-Zero: Harness Distillation via Agent-as-Harness

    Sep 21, 2026Haoran Ye, Yuxing Lu, Haonan Dong +2LLM Agent TrainingKnowledge Distillation

  42. Dependency-Aware Trajectory Refinement for Efficient Multi-Turn Agent Fine-Tuning

    Sep 16, 2026Zhuo Chen, Zhen Zhang, Xinyu Wang +1LLM Inference EfficiencyLLM Agent Workflow Optimization

  43. SFT or RL for Tool-Calling Agents? A Controlled Study Across Data, Method, and Scale

    Sep 15, 2026Md Tahmid Rahman Laskar, Xue-Yong Fu, Shashi Bhushan TNSupervised Fine-TuningLLM Tool Use

  44. Behavior Quotient Learning for Low-Rank Adaptation of LLM Agents

    Sep 14, 2026Pengyang Zhou, Xiaobin Tu, Zhengxi Liu +7Low-Rank AdaptationLLM Agent Training