Agent Harness Optimization

Momentum

46 papers in the last four weeks, up 130% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 118

All topics
CardsList
  1. AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

    Aug 13, 2026Yaxin Luo, Haobin Jiang, Jialv Zou +11AI Coding AgentsAgent Harness Optimization

  2. Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

    Aug 13, 2026Yiwei Li, Wanli Yang, Hexiang Tan +10Long-Horizon Agent EvaluationAgent Harness Optimization

  3. Recovering Wasted Compute in Autoresearch Agents

    Aug 11, 2026Au Kwok Chun, Abhigyan Acherjee, Amrutha Rao +4Inference-Time SearchAgent Harness Optimization

  4. SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

    Aug 10, 2026Wanying Qu, Qinghua Mao, Yu Li +12Agent Harness OptimizationLLM Agent Safety

  5. Evo-Bench: Can Language Models Improve Agent Harness?

    Aug 10, 2026Lisheng Huang, Chen Yang, Hao Zhou +6AI Agent EvaluationLong-Horizon Agent Evaluation

  6. Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

    Aug 8, 2026Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev +3AI Coding AgentsAgent Harness Optimization

  7. EvoHarness-RL: Learning Runtime Harness Coordination for Self-Evolving Agents

    Aug 5, 2026Xuying Ning, Dongqi Fu, Tianxin Wei +17Agent Harness OptimizationLong-Horizon Agent Tasks

  8. EvolveNet: Collaborative Harness Evolution for Agent Self-Improvement

    Aug 5, 2026Jun Nie, Yonggang Zhang, Qianshu Cai +3Agent Harness OptimizationMulti-Agent Collaboration

  9. ADIAS: Automated Design of Interactive Agentic Systems

    Aug 3, 2026Lekang Jiang, Bohan Tang, Stephan Goetz +1Agent Harness OptimizationSelf-Improving Agents

  10. Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

    Aug 3, 2026Shuai Shao, Kangning Zhang, Qingyao Li +7Agent Harness OptimizationLLM Agent Self-Improvement

  11. HarnessCompass: Guiding Automatic Harness Evolution toward Generalizable and Effective Agent Harnesses

    Aug 3, 2026Luan Zhang, Ruochen Zhou, Dandan Song +9Agent Harness OptimizationLLM Agents

  12. Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination

    Aug 2, 2026Tianyun Ji, Zhenya Huang, Jiayu Liu +3Continual Learning for LLM AgentsAgent Harness Optimization

  13. PATH-Bench: Path-Dependent Evaluation of Lifelong Agents

    Aug 2, 2026Xidong Yang, Xingyi Zhang, Wenhao Li +7Continual Learning for LLM AgentsLifelong Learning Agents

  14. RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems

    Jul 31, 2026Haoran Ling, Yuecheng Li, Zeyu Song +5Large Language Model-Guided OptimizationAgent Harness Optimization

  15. DarwinX: Evolving Agent Harnesses Through Natural Selection

    Jul 31, 2026Yifan Zhang, Yutong Dai, Juntao Tan +9Evolutionary OptimizationAgent Harness Optimization

  16. DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution

    Jul 29, 2026Hanghui Guo, Weijie Shi, Zhangze Chen +6Agent Harness OptimizationLLM Agent Harnesses

  17. Living-Harness Is an Interactive-Agent Evolver

    Jul 29, 2026Yuetian Du, Yucheng Wang, He Xu +9AI Agent ReliabilityAgent Harness Optimization

  18. CHILL-Harness: Counterfactual Harness Learning for Efficient Reasoning in Long-Horizon Agents

    Jul 28, 2026Jiarun Fu, Lizhong Ding, Sida Chen +6Agent Harness OptimizationLong-Horizon LLM Agents

  19. Automated Discovery Has No Universally Superior Harness

    Jul 20, 2026Akshat Gupta, Jermaine Lei, Alexander Lu +2Automated Algorithm DiscoveryAutomated Heuristic Design

  20. Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents

    Jul 17, 2026Zhengyu Chen, Teng Xiao, Huaisheng Zhu +3Agent Harness OptimizationLLM Agent Workflow Optimization

  21. Recursive Harness Self-Improvement

    Jul 17, 2026Hyunin Lee, Jinglue Xu, Jeffrey Seely +3Continual Learning for LLM AgentsAgent Harness Optimization