LLM Agent Harnesses

LLM: Large Language Model

Momentum

48 papers in the last four weeks, up 92% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 190

All topics
CardsList
  1. Harness Engineering for Software Engineering via Modular Executable Dev-Primitives

    Oct 6, 2026Haibo Jin, Xinjie Li, Peng Kuang +1Multi-Agent LLM SystemsSoftware Engineering Agents

  2. Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions

    Oct 5, 2026Chubin Zhang, Zhenglin Wan, Xingrui Yu +4LLM Agent EvaluationTool-Using Agents

  3. Harness-Search: Guiding Long-Horizon Search through Multi-Agent Coordination

    Oct 4, 2026Shanyong Wang, Zhenwen Ji, Lei Jin +7Multi-Agent CoordinationMulti-Agent Systems

  4. MESH-Harness: Self-Improving Agent Harnesses via Bandit-Guided Compositional Evolution

    Oct 4, 2026Zhiwei Shang, Yu Huo, Mingrong Gong +6Agent Harness OptimizationLLM Agent Workflow Optimization

  5. Causal Improvement Graph for Agentic Harness Optimization

    Oct 4, 2026Junjie Zhang, Shunyu Liu, Haoyu Wang +3Agent Harness OptimizationGraph-Based Agent Memory

  6. Mingbird: A Local-First Agent Harness Enabling Small Open Models to Complete Real Tasks

    Oct 1, 2026Hao Wang, Ting HuangSmall Language ModelsAI Agent Benchmarks

  7. VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks

    Oct 1, 2026Caiqi Zhang, Rujun Han, Zifeng Wang +4LLM Agent VerificationLong-Horizon LLM Agents

  8. Finding the Right Fit: Model-Harness Interactions across Agent Tasks

    Oct 1, 2026Yixuan Li, Yiyun Zhou, Yao Long Teng +6Tool-Augmented Language Model AgentsLLM Agent Evaluation

  9. ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization

    Oct 1, 2026Sungho Park, Wonjoong Kim, Jue Zhang +8Agent Harness OptimizationCurriculum Learning

  10. ReLiveGym: Evaluating Long-Lived Agents over Weeks of Replayed Reality

    Sep 30, 2026Xisen Jin, Jingheng Li, Zhenglun Chen +2Continual Learning for LLM AgentsLong-Horizon Agent Evaluation

  11. Turbo Harness: Instance-Adaptive Harness Optimization

    Sep 30, 2026Tunyu Zhang, Hao Wang, Kai Xu +1Agent Harness OptimizationSelf-Improving Agents

  12. How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?

    Sep 30, 2026Kirill Brilliantov, Alejandro Hernández-Cano, Emmanuel AbbéAI Coding AgentsLLM Agent Evaluation

  13. Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

    Sep 30, 2026Minki Kang, Ryo Hachiuma, Shaokun Zhang +8Terminal AgentsTest-Time Scaling

  14. OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software

    Sep 30, 2026Dingyuan Dai, Heli Qi, Lei Liu +28Computer-Use Agent BenchmarksAI for Science

  15. Schema: Discovering Unknown Environments via Agentic Program Induction

    Sep 30, 2026Guanning Zeng, Jiani Wang, Wenjie Ma +8LLM Agent HarnessesLLM Agent Planning

  16. When Harnesses Lose the Signal: Causal Evaluation of Recovery in LLM Agents

    Sep 30, 2026Shuyao Xiao, Shengling Wang, Xuan Chen +7Long-Horizon Agent EvaluationCausal Interventions in Language Models

  17. Composing Task-specific Agent Harnesses at Test Time with Reusable Primitives

    Sep 30, 2026Peng Kuang, Haibo Jin, Dehao Wu +4Agent Harness OptimizationLLM Agent Harnesses

  18. MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution

    Sep 29, 2026Prithwish Jana, Mononito Goswami, Hao Liu +9Multi-Agent OrchestrationEvolutionary Optimization

  19. Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI

    Sep 29, 2026Cheng Qian, Kunlun Zhu, Beibin Li +2Agent Harness OptimizationLLM Agent Skill Learning

  20. AnthroDial: Benchmarking LLM Anthropomorphism in Autonomous Social Interaction

    Sep 29, 2026Wentao Liu, Xi Chen, Siyu Song +13LLM Agent EvaluationLLM Agent Training

  21. Distilling Agentic Systems: A Roadmap across Models, Artifacts, and Harnesses

    Sep 29, 2026Ziluowen Luo, Senzhang Wang, Chaozhuo Li +9AI Agent EvaluationKnowledge Distillation

  22. SRHarness: A Harness for Agentic Symbolic Regression

    Sep 28, 2026Zihan Yu, Shixuan Zhou, Hao Huang +2Long-Horizon LLM AgentsLarge Language Model-Guided Scientific Discovery

  23. LLMs are General Asynchronous Agents

    Sep 28, 2026George Yakushev, Denis Mazur, Vladimir Bartenev +4LLM AgentsLLM Agent Harnesses

  24. Planarian: Managing Agent State with Statepoints

    Sep 28, 2026Jinnan Guo, Hao Mark Chen, Kapil Vaswani +2LLM AgentsState Tracking

  25. Towards Reliable AI Data Scientists: Data Agents with Workflow Harnesses

    Sep 28, 2026Huachi Zhou, Yujing Zhang, Jiahe Du +7LLM Agent HarnessesLLM Agent Reliability

  26. NavHarness: Towards Lifelong Embodied Navigation

    Sep 28, 2026Xunyi Zhao, Jian Zhou, Sihao Lin +6Embodied NavigationMemory-Augmented Agents

  27. Vestrum: Improving Agent Harnesses by Adapting Their Verification, Structure and Memory

    Sep 27, 2026Jayant Parashar, Eugene F. Douglass, William C. Bastian +1LLM Agent MemoryAgent Harness Optimization

  28. Compositional Safety Failures in Harness Evolution: Identification and Runtime Monitoring

    Sep 27, 2026Zhixiang Zhang, Zesen Liu, Wai Ip Lai +2Runtime Enforcement for AI AgentsLLM Agent Harnesses

  29. Who Holds the Pen? Let Specifications, Not Agents, Sign Off

    Sep 24, 2026Haiqing Li, Xin Ma, Yinhao Wu +7LLM Agent VerificationRuntime Enforcement for AI Agents

  30. Control the Harness, Control the Cost: Routing and Governing AI Coding Agents in the Enterprise

    Sep 24, 2026Arian Abbasi, Alan Aqrawi, Ted KwartlerTool-Augmented Language Model AgentsCoding Agents

  31. Driving Epidemic Models with AI Agents: the Epydemix Agent Framework

    Sep 23, 2026Nicolò Gozzi, Ciro Cattuto, Alessandro VespignaniAI Agents for Scientific DiscoveryLLM Agent Harnesses

  32. Harness as a Language: A Minimalist Agent Framework With Maximal Expressivity

    Sep 22, 2026Zhening Li, Joshua Liu, Mateja Vukelic +7LLM Agent MemoryLLM Agent Self-Improvement

  33. Harness-Zero: Harness Distillation via Agent-as-Harness

    Sep 21, 2026Haoran Ye, Yuxing Lu, Haonan Dong +2LLM Agent TrainingKnowledge Distillation

  34. Qwen-Audio-Agent Technical Report

    Sep 21, 2026Chong Deng, Yunjie Ji, Yuxiang Kong +5Multi-Agent OrchestrationLLM Agent Orchestration

  35. How Do Agent Harnesses Create Value? Planning Information and Release Control in Stateful LLM Agents

    Sep 17, 2026Yukun Zhang, Kemu Xu, Yishen ChenAgent Harness OptimizationLLM Agent Verification

  36. AeroWeaver: An Embodied-Agent Harness for Weaving Aerial Skills into Distributed, Adaptive Swarm Execution

    Sep 16, 2026Jiabin Lou, Yirong Yang, Haopeng Wang +6Aerial RoboticsSwarm Robotics

  37. TuiML: Machine Learning for AI Agents

    Sep 16, 2026Nilesh Verma, Nick Lim, Albert Bifet +1Tool-Using AgentsML Reproducibility

  38. Agentic Societies Need a Social Harness

    Sep 15, 2026Tapan Chugh, Vidushi Singh, Krish Jain +2AI Agent ReliabilityMulti-Agent System Security

  39. Ecdysis: Efficient and Effective Training of Runtime Harnesses for LLM Agents

    Sep 12, 2026Ruiqing Yue, Yu Cui, Zhuoyu Sun +11Agent Harness OptimizationLLM Agent Harnesses

  40. RobustSGPO: Search-Space Control for Agent Harness Evolution

    Sep 10, 2026Zibo Zhao, Jijun Shi, Mo Zhou +9Agentic WorkflowsAgent Harness Optimization

  41. What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents

    Sep 7, 2026Chenqian Le, Jiayi Cheng, Qijia He +3RL for Code GenerationGroup Relative Policy Optimization

  42. Interface-Induced Trajectory Censoring

    Sep 3, 2026Wenbo WangTool-Use EvaluationAI Agent Evaluation

  43. A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors

    Sep 3, 2026Pengxun Li, Litian Zhang, Jianwei Hou +4AI Agent SecurityLLM Agent Harnesses

  44. Bioinfoysis Technical Report

    Sep 3, 2026Qingyang Shao, Xin Zhang, Zhouyang Yuan +24Multi-Agent LLM SystemsLLM Agent Harnesses

  45. What Do CAE Simulation Agents Really Need Beyond a Generic Harness?

    Sep 3, 2026Jiasheng Shi, Tianhan ZhangMulti-Agent LLM SystemsLLM Agent Evaluation

  46. Harness Engineering in LLM Tool Use via Agent-Native Reusable Tool Primitives

    Sep 1, 2026Haibo Jin, Suijin Wang, Xucheng Yu +2Tool-Augmented Language Model AgentsLLM Agent Orchestration

  47. CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?

    Sep 1, 2026Damien Sileo, Dimitri KachlerTemporal Reasoning in Language ModelsAI Agent Benchmarks

  48. Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement

    Sep 1, 2026Haoyang Yan, Min-le Su, Hangfan Zhang +6Agent Harness OptimizationSelf-Improving Agents