LLM Agent Training

LLM: Large Language Model

Latest papers 354

All topics
CardsList
  1. OpenForgeRL: Train Harness-native Agents in Any Environment

    Jul 23, 2026Xiao Yu, Baolin Peng, Ruize Xu +7Computer-Use AgentsLLM Agent Training

  2. PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning

    Jul 23, 2026Yipeng Shi, Zhipeng Ma, Yue Wang +4Agentic RLLLM Agent Skill Learning

  3. FedAgentKE: Federated Semantic Knowledge Evolution for Heterogeneous Agents

    Jul 23, 2026Weihao Li, Jun Bai, Ziyang SongFederated Knowledge DistillationLLM Agent Training

  4. RF-Agent: A Practical Framework for Building Language Agents for RFIC Design

    Jul 21, 2026Yueqi Xing, Houbo He, Jolie Wang +5Retrieval-Augmented GenerationLLM Fine-Tuning

  5. Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?

    Jul 20, 2026Fan Yang, Rui Meng, Yuxin WenAgentic SearchOn-Policy Self-Distillation

  6. DSWorld: A Data Science World Model for Efficient Autonomous Agents

    Jul 17, 2026Zherui Yang, Fan Liu, Hao LiuWorld Model LearningWorld Models

  7. ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

    Jul 17, 2026Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu +5Tool-Use EvaluationAgentic RL

  8. Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents

    Jul 17, 2026Zhengyu Chen, Teng Xiao, Huaisheng Zhu +3Agent Harness OptimizationLLM Agent Workflow Optimization

  9. HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents

    Jul 16, 2026Hy Vision Team, Huawen Shen, Zhengyang Tang +20GUI AgentsMobile GUI Agents

  10. Step-Level Preference Learning for Generative Agents in Social Simulations

    Jul 16, 2026Wenchang Gao, Pingyue Sheng, Lanlan Qiu +7Human Preference ModelingHuman Behavior Simulation

  11. NexForge: Scaling Executable Agent Tasks via Requirement-First Synthesis

    Jul 15, 2026Jiarong Zhao, Zhikai Lei, Zhiheng Xi +5Software Engineering AgentsSynthetic Data Generation

  12. Agentic Routing: The Harness-Native Data Flywheel

    Jul 13, 2026Xinchen Liu, Hang Zhou, Yingjie Zong +12LLM Agent TrainingLLM Agent Harnesses

  13. Mach-Mind-4-Flash Technical Report

    Jul 10, 2026Foundation Model TeamAgentic RLToken Efficiency

  14. Demonstrating TOFFEE: A Learned System for Synthesizing Data Agent Trajectories at Scale

    Jul 7, 2026Ziting Wang, Yin Li, Zuhao Yang +3LLM Agent Trajectory SynthesisLLM Agents

  15. CurateEvo: Data-Curation Evolving for Agentic Post-Training

    Jul 7, 2026Dingzirui Wang, Xuanliang Zhang, Keyan Xu +2Training Data CurationLLM Agent Training

  16. Multi-Turn On-Policy Distillation with Prefix Replay

    Jul 6, 2026Baohao Liao, Hanze Dong, Christof Monz +3LLM Agent TrainingOn-Policy Distillation

  17. Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

    Jul 2, 2026Mingzhe Du, Luu Anh Tuan, Tianyi Wu +4Software Engineering AgentsCybersecurity

  18. The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning

    Jul 1, 2026Daniel Thi Graviet, Lovre Pesut, Ivan Dagelic +2RL for Code GenerationSoftware Engineering Agents

  19. Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use

    Jul 1, 2026Song-Lin Lv, Weiming Wu, Rui Zhu +2Fine-TuningDistribution Shift

  20. Multi-Turn Agentic Scientific Literature Search via Workflow Induction

    Jul 1, 2026Jisen Li, Bingxuan Li, Nanyi Jiang +10Agentic SearchAgentic Workflows