LLM Agent Harnesses

LLM: Large Language Model

Momentum

49 papers in the last four weeks, up 88% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 198

All topics
CardsList
  1. DuplexAgent-RSI: Recursive Harness Improvement for Full-Duplex Voice Agent Collaboration

    Oct 8, 2026Yingda Shen, Yuxiang Wang, Kunyu Feng +7LLM Agent HarnessesAgent Harness Optimization

  2. When Interfaces Speak: Data-Aware Generative UI Harness for Active Interaction

    Oct 8, 2026Xiaolong Li, Xiaohan Xu, Jinyang Li +5Human-AI InteractionLLM Agent Harnesses

  3. On the Clock: Towards Punctual and Productive Time-Budgeted AI Agents

    Oct 7, 2026Aaron Wang, Neelabh Madan, Vlad Sobal +5Runtime Enforcement for AI AgentsLLM Agent Harnesses

  4. CoTrace: Data Recipes for Training Terminal Agents with Harness-Model Co-Evolution

    Oct 7, 2026Jixuan Chen, Jiaxin Zhang, Qinyuan Ye +11Terminal AgentsLLM Agent Harnesses

  5. Harness Engineering for Software Engineering via Modular Executable Dev-Primitives

    Oct 6, 2026Haibo Jin, Xinjie Li, Peng Kuang +1Multi-Agent LLM SystemsSoftware Engineering Agents

  6. Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions

    Oct 5, 2026Chubin Zhang, Zhenglin Wan, Xingrui Yu +4LLM Agent EvaluationTool-Using Agents

  7. Harness-Search: Guiding Long-Horizon Search through Multi-Agent Coordination

    Oct 4, 2026Shanyong Wang, Zhenwen Ji, Lei Jin +7Multi-Agent CoordinationMulti-Agent Systems

  8. MESH-Harness: Self-Improving Agent Harnesses via Bandit-Guided Compositional Evolution

    Oct 4, 2026Zhiwei Shang, Yu Huo, Mingrong Gong +6Agent Harness OptimizationLLM Agent Workflow Optimization

  9. Causal Improvement Graph for Agentic Harness Optimization

    Oct 4, 2026Junjie Zhang, Shunyu Liu, Haoyu Wang +3Agent Harness OptimizationGraph-Based Agent Memory

  10. Harnessing LLMs as Agents: What Does It Cost?

    Oct 1, 2026Zelin Zhao, Xinyu Guo, Jingyuan Zhang +2LLM Agent HarnessesMemory-Augmented Language Model Agents

  11. Mingbird: A Local-First Agent Harness Enabling Small Open Models to Complete Real Tasks

    Oct 1, 2026Hao Wang, Ting HuangSmall Language ModelsAI Agent Benchmarks

  12. VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks

    Oct 1, 2026Caiqi Zhang, Rujun Han, Zifeng Wang +4LLM Agent VerificationLong-Horizon LLM Agents

  13. Finding the Right Fit: Model-Harness Interactions across Agent Tasks

    Oct 1, 2026Yixuan Li, Yiyun Zhou, Yao Long Teng +6Tool-Augmented Language Model AgentsLLM Agent Evaluation

  14. ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization

    Oct 1, 2026Sungho Park, Wonjoong Kim, Jue Zhang +8Agent Harness OptimizationCurriculum Learning

  15. ReLiveGym: Evaluating Long-Lived Agents over Weeks of Replayed Reality

    Sep 30, 2026Xisen Jin, Jingheng Li, Zhenglun Chen +2Continual Learning for LLM AgentsLong-Horizon Agent Evaluation

  16. Turbo Harness: Instance-Adaptive Harness Optimization

    Sep 30, 2026Tunyu Zhang, Hao Wang, Kai Xu +1Agent Harness OptimizationSelf-Improving Agents

  17. How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?

    Sep 30, 2026Kirill Brilliantov, Alejandro Hernández-Cano, Emmanuel AbbéAI Coding AgentsLLM Agent Evaluation

  18. Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

    Sep 30, 2026Minki Kang, Ryo Hachiuma, Shaokun Zhang +8Terminal AgentsTest-Time Scaling

  19. OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software

    Sep 30, 2026Dingyuan Dai, Heli Qi, Lei Liu +28Computer-Use Agent BenchmarksAI for Science

  20. Schema: Discovering Unknown Environments via Agentic Program Induction

    Sep 30, 2026Guanning Zeng, Jiani Wang, Wenjie Ma +8LLM Agent HarnessesLLM Agent Planning

  21. When Harnesses Lose the Signal: Causal Evaluation of Recovery in LLM Agents

    Sep 30, 2026Shuyao Xiao, Shengling Wang, Xuan Chen +7Long-Horizon Agent EvaluationCausal Interventions in Language Models

  22. Composing Task-specific Agent Harnesses at Test Time with Reusable Primitives

    Sep 30, 2026Peng Kuang, Haibo Jin, Dehao Wu +4Agent Harness OptimizationLLM Agent Harnesses

  23. MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution

    Sep 29, 2026Prithwish Jana, Mononito Goswami, Hao Liu +9Multi-Agent OrchestrationEvolutionary Optimization