Agent Harness

Momentum

38 papers in the last four weeks, up 217% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 133

All topics
CardsList
  1. HERA: Harness-Environment Co-Evolution for Reliable Agentic Abstention

    Oct 5, 2026Han Luo, Bingbing Wen, Guang Yang +3Agent Harness

  2. MedicalHarness: A Controlled Evaluation of LLMs and Agent Harnesses on Medical Tasks

    Oct 5, 2026Ziqing Wang, Lili Zhao, Kaize DingAgent Harness

  3. Harness-Search: Guiding Long-Horizon Search through Multi-Agent Coordination

    Oct 4, 2026Shanyong Wang, Zhenwen Ji, Lei Jin +7Search AgentsLong-Horizon Agents

  4. MESH-Harness: Self-Improving Agent Harnesses via Bandit-Guided Compositional Evolution

    Oct 4, 2026Zhiwei Shang, Yu Huo, Mingrong Gong +6Agent Harness

  5. Causal Improvement Graph for Agentic Harness Optimization

    Oct 4, 2026Junjie Zhang, Shunyu Liu, Haoyu Wang +3Agent HarnessCausal Graph

  6. Mingbird: A Local-First Agent Harness Enabling Small Open Models to Complete Real Tasks

    Oct 1, 2026Hao Wang, Ting HuangAgent HarnessReal-World Tasks

  7. VideoEvolve: Evolving Agent Harnesses for Video Temporal Grounding

    Oct 1, 2026Bingjun Luo, Yuhuan Fan, Jialin Guo +1Video Temporal GroundingTemporal Grounding

  8. Harness Annealing: Learning to Act with Less External Control

    Oct 1, 2026Yingxuan Yang, Huacan Chai, Ying WenAgent HarnessInternalization

  9. Finding the Right Fit: Model-Harness Interactions across Agent Tasks

    Oct 1, 2026Yixuan Li, Yiyun Zhou, Yao Long Teng +6Agent HarnessAgentic Benchmarks

  10. Cogentic: Multi-Agent Orchestration for Automated Proof Discovery

    Sep 30, 2026Yang Cai, Vineet Gupta, Yanchen Jiang +4Theorem ProvingMulti-Agent Orchestration

  11. DynaHarness: A Dynamic Physical Harness for Self-Evolving Robot Agents

    Sep 30, 2026Haoyuan Deng, Jiebin Liu, Tengxiao Zhang +3Robot PoliciesAgent Harness

  12. How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?

    Sep 30, 2026Kirill Brilliantov, Alejandro Hernández-Cano, Emmanuel AbbéAgent HarnessCoding Agents

  13. Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

    Sep 30, 2026Minki Kang, Ryo Hachiuma, Shaokun Zhang +8Test-Time ScalingAgent Harness

  14. Better Deck or Different Judge? Evaluating Agentic Harness Gains in Corporate and Investment Banking

    Sep 30, 2026Ludovic Gibert, Matis Despujols, Andre-Louis RochetGradingLarge Language Model Judges

  15. Composing Task-specific Agent Harnesses at Test Time with Reusable Primitives

    Sep 30, 2026Peng Kuang, Haibo Jin, Dehao Wu +4Agent HarnessTest Time

  16. MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution

    Sep 29, 2026Prithwish Jana, Mononito Goswami, Hao Liu +9Agent HarnessMulti-Agent Evolution

  17. Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI

    Sep 29, 2026Cheng Qian, Kunlun Zhu, Beibin Li +2Agent HarnessReasoning Skills

  18. Retrieval-Augmented Skill Optimization via Cross-Harness Adaptation

    Sep 29, 2026Jaewon Chu, Ji Soo Lee, Jihwan Park +8SkillsAgentic Optimization

  19. AgentBug-Smith: Automatically Reproducing Real-World Harness Bugs in Agentic Systems

    Sep 29, 2026Yiming Cheng, Alfin Wijaya Rahardja, Mengshi Zhang +3Agent HarnessRepair

  20. SRHarness: A Harness for Agentic Symbolic Regression

    Sep 28, 2026Zihan Yu, Shixuan Zhou, Hao Huang +2Symbolic RegressionAgent Harness

  21. Beyond Skill Evolution: Self-Evolving Context Management Policies for Long-Horizon Agent Harnesses

    Sep 28, 2026Weiyuan Li, Jinghan Xu, Aili Chen +4Long-Horizon AgentsLarge Language Model Agents

  22. NavHarness: Towards Lifelong Embodied Navigation

    Sep 28, 2026Xunyi Zhao, Jian Zhou, Sihao Lin +6Object Goal NavigationNavigation

  23. Vestrum: Improving Agent Harnesses by Adapting Their Verification, Structure and Memory

    Sep 27, 2026Jayant Parashar, Eugene F. Douglass, William C. Bastian +1Agent Harness

  24. Control the Harness, Control the Cost: Routing and Governing AI Coding Agents in the Enterprise

    Sep 24, 2026Arian Abbasi, Alan Aqrawi, Ted KwartlerAgent HarnessCoding Agents

  25. Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents

    Sep 22, 2026Laizhen Li, Jiarui Li, Juanjuan Zhao +4Agent HarnessScaffolds

  26. Harness-Zero: Harness Distillation via Agent-as-Harness

    Sep 21, 2026Haoran Ye, Yuxing Lu, Haonan Dong +2Agent HarnessSymbolic Distillation

  27. RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

    Sep 21, 2026Peng Xia, Rujun Han, Zifeng Wang +11Self-Improving AgentsRecursive Self-Improvement

  28. An Empirical Study of Harness Design for Coding Agents

    Sep 17, 2026Run-Ze Fan, Zihao Zhang, Simin Ma +6Coding AgentsAgent Harness

  29. How Do Agent Harnesses Create Value? Planning Information and Release Control in Stateful LLM Agents

    Sep 17, 2026Yukun Zhang, Kemu Xu, Yishen ChenAgent HarnessLarge Language Model Planning

  30. Agentic Societies Need a Social Harness

    Sep 15, 2026Tapan Chugh, Vidushi Singh, Krish Jain +2Agent HarnessComplex Societies

  31. Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science

    Sep 14, 2026Honghao Lin, David P. Woodruff, Yuan Deng +3Theorem ProvingMathematics

  32. HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness

    Sep 14, 2026Yang Chen, Lirong Che, Zhenyu Huang +7Vision-Language NavigationEmbodied Agents

  33. RobustSGPO: Search-Space Control for Agent Harness Evolution

    Sep 10, 2026Zibo Zhao, Jijun Shi, Mo Zhou +9Agentic OptimizationAgent Harness

  34. From Evidence to Effect: Authority Semantics and Runtime Infrastructure for Stateful Agents

    Sep 8, 2026Yang Li, Zongsi Xu, Sergey Volkov +7AuthorityAgent Harness

  35. Environment Evolution for Terminal Agents

    Sep 3, 2026Zhiyuan Fan, Tinghao Yu, Yuanjun Cai +9Synthetic EnvironmentsEvolutionary Optimization Methods

  36. What Do CAE Simulation Agents Really Need Beyond a Generic Harness?

    Sep 3, 2026Jiasheng Shi, Tianhan ZhangAgent HarnessMulti-Agent Simulations

  37. CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?

    Sep 1, 2026Damien Sileo, Dimitri KachlerLifecycleAgent Harness

  38. HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

    Sep 1, 2026Yuhao Wu, Jingyuan Zhang, Jiajun Shi +16Agent Harness

  39. WHALE: A Simple Recipe for Joint Harness-Weight Optimization

    Aug 31, 2026Haechan Kim, Yoonho Lee, Gisang Lee +2Agent HarnessAgentic Optimization

  40. Harness-RL: Black-Box Reinforcement Learning with Action-Args Decoupling for Central-Agent Multi-Agent Harnesses

    Aug 30, 2026Xinke Jiang, Zhixin Zhang, Zhibang Yang +6Agentic Reinforcement LearningAgent Harness

  41. Logos: An Agent Harness on a Cross-Process Bus

    Aug 28, 2026Hanzhang Jia, Liheng Zeng, Hao Cheng +2Agent HarnessState Space

  42. DiG-bench: Discovery in Games

    Aug 12, 2026Ruairidh M. Battleday, Kai Sandbrink, Jimi Cullen-Drohan +13Agentic BenchmarksArtificial Intelligence Benchmarks

  43. Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

    Aug 10, 2026Rohan Bhagra, Mahantesh Halapannavar, Uddhav BhattaraiLarge Language Model PlanningRobot Autonomy

  44. Evo-Bench: Can Language Models Improve Agent Harness?

    Aug 10, 2026Lisheng Huang, Chen Yang, Hao Zhou +6Evolving HarnessAgent Harness

  45. A2EA^2E : An End-to-End Agent Auditing Engine

    Aug 7, 2026Haoning Wang, Mingxun Zhang, Chenyue Yu +4Agent HarnessAgentic Evaluations

  46. HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

    Aug 7, 2026Xiao Zhang, Yusheng Wang, Yuhao Fei +5Agent HarnessAttack-Success Rate

  47. HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

    Aug 6, 2026Varun Ursekar, Apaar Shanker, Yash Maurya +4Agent HarnessAgentic Benchmarks

  48. EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

    Aug 5, 2026Xuying Ning, Dongqi Fu, Tianxin Wei +13Long-Horizon AgentsAgent Harness

  49. Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

    Aug 5, 2026Jinyi Han, Yuanjian Xu, Ying Liao +6SkillsAgent Harness

  50. Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

    Aug 3, 2026Shuai Shao, Kangning Zhang, Qingyao Li +7Agent HarnessRuntime

  51. HarnessCompass: Guiding Automatic Harness Evolution toward Generalizable and Effective Agent Harnesses

    Aug 3, 2026Luan Zhang, Ruochen Zhou, Dandan Song +9Evolving HarnessAgent Harness