LLM Agent Harnesses

LLM: Large Language Model

Momentum

49 papers in the last four weeks, up 88% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 198

All topics
CardsList
  1. DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

    Jul 18, 2026Runming He, Zhen Hao Wong, Hao Liang +4LLM GroundingCode Generation

  2. Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents

    Jul 17, 2026Zhengyu Chen, Teng Xiao, Huaisheng Zhu +3Agent Harness OptimizationLLM Agent Workflow Optimization

  3. Recursive Harness Self-Improvement

    Jul 17, 2026Hyunin Lee, Jinglue Xu, Jeffrey Seely +3Continual Learning for LLM AgentsAgent Harness Optimization

  4. Harnessing LLMs for Reliable Academic Supervision: A Comparative Study

    Jul 16, 2026Akash RajLLM ReliabilityLLM Agent Harnesses

  5. AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities

    Jul 15, 2026Kai Chen, Zichen Ding, Jiaye Ge +20LLM Agent EvaluationAI Agent Benchmarks

  6. Self-Evolving Agent Harnesses via Gated Semantic Quality-Diversity

    Jul 15, 2026Xiaotian Luo, Fengxingyu Wang, Chuanrui Hu +2LLM Agent Self-ImprovementQuality-Diversity Optimization

  7. MyAG: A Graph-Based Framework for Designing and Analyzing Composable LLM Agent Systems

    Jul 15, 2026Zhisong ZhangLLM Agent OrchestrationLLM Agents

  8. Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

    Jul 14, 2026Ruhan Wang, Yucheng Shi, Zongxia Li +7Software Engineering AgentsLLM Agent Harnesses

  9. PalmClaw: A Native On-Device Agent Framework for Mobile Phones

    Jul 14, 2026Hongru Cai, Yongqi Li, Ran Wei +1Tool-Using AgentsLLM Agents

  10. Rethinking the Evaluation of Harness Evolution for Agents

    Jul 14, 2026Yike Wang, Huaisheng Zhu, Zhengyu Hu +8LLM Agent EvaluationAgent Harness Optimization

  11. ToFu: A White-Box, Token-Efficient Agent Harness for Researchers

    Jul 13, 2026Junhao Ruan, Yuan Ge, Bei Li +7Tool-Augmented Language Model AgentsSoftware Engineering Agents

  12. Agentic Routing: The Harness-Native Data Flywheel

    Jul 13, 2026Xinchen Liu, Hang Zhou, Yingjie Zong +12LLM Agent TrainingLLM Agent Harnesses

  13. StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure

    Jul 13, 2026Wenyi Wu, Sibo Zhu, Kun Zhou +3Computer-Use AgentsLong-Horizon LLM Agents

  14. Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents

    Jul 13, 2026Chenglin Yu, Li Yin, Ying Yu +4Instruction FollowingRuntime Enforcement for AI Agents

  15. LOGOS: A Living Logic for AI Agent Teams That Evolve With Humans

    Jul 12, 2026Yuma Ichikawa, Yamato Arai, Kosaku Kimura +2Multi-Agent LLM SystemsHuman-in-the-Loop AI

  16. MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation

    Jul 11, 2026Chengguang Gan, Hanjun Wei, Yunhao Liang +3Computer-Use AgentsWeb Agent Benchmarks

  17. Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents

    Jul 10, 2026Izumi Takahara, Teruyasu MizoguchiAI Agents for Scientific DiscoveryLLM Auditing

  18. TTHE: Test-Time Harness Evolution

    Jul 9, 2026Jun Nie, Yonggang Zhang, Jun Song +5Test-Time AdaptationAgent Harness Optimization

  19. Harnessing Code Agents for Automatic Software Verification

    Jul 7, 2026Shuangxiang Kan, Shuanglong Kan, Sebastian ErtelSoftware Engineering AgentsAutomated Theorem Proving

  20. Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

    Jul 5, 2026Haiwen Yi, Xinyuan SongSoftware Engineering AgentsLLM Agent Evaluation

  21. Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning

    Jul 5, 2026Haiwen Yi, Xinyuan SongOffline RLLLM Agent Harnesses