LLM Agent Harnesses

LLM: Large Language Model

Momentum

49 papers in the last four weeks, up 88% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 198

All topics
CardsList
  1. Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

    Aug 5, 2026Jinyi Han, Yuanjian Xu, Ying Liao +6LLM Agent EvaluationLLM Agent Skill Retrieval

  2. OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents

    Aug 4, 2026Jingsheng Zheng, Xinyuan Fang, Jintian Zhang +3LLM Agent MemoryLong-Horizon Agent Evaluation

  3. Formal Verification of Agentic Systems over Operational Data

    Aug 4, 2026Alejandro J. Mercado, Alessio LomuscioFormal VerificationLLM Agent Harnesses

  4. Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

    Aug 3, 2026Shuai Shao, Kangning Zhang, Qingyao Li +7Agent Harness OptimizationLLM Agent Self-Improvement

  5. Homebot: A Personal AI Agent for Conversational Home Assistance and Automation

    Aug 3, 2026Shengyuan Ye, Yixin Zhang, Han Liang +3Tool-Augmented Language Model AgentsTool-Using Agents

  6. Towards the Harness of Embodied Agents

    Aug 3, 2026Qi Wang, Tianyi Wang, Chengyang Li +6Tool-Using AgentsLong-Horizon Agent Tasks

  7. HarnessCompass: Guiding Automatic Harness Evolution toward Generalizable and Effective Agent Harnesses

    Aug 3, 2026Luan Zhang, Ruochen Zhou, Dandan Song +9Agent Harness OptimizationLLM Agents

  8. Constructing Executable Analytical Knowledge Representations for Meta-Analysis Synthesis Using an Agentic Harness

    Aug 3, 2026Lingbo Li, Anuradha Mathrani, Teo SusnjakAI-Assisted Scientific ResearchKnowledge Representation

  9. GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

    Aug 3, 2026Jiarui Tan, Zhongjian Zhang, YaBo Guo +5LLM Agent EvaluationAI Agent Benchmarks

  10. FinanceHarness: Autonomous Financial Deep Research Framework

    Jul 30, 2026Yijia Xiao, Rujun Han, Yanfei Chen +8Deep Research AgentsFinancial Forecasting

  11. Harness-G: A Graph-Structured Harness for Search Agents

    Jul 30, 2026Yanning Hou, Haoyuan Chen, Sihang Zhou +7Graph Retrieval-Augmented GenerationCredit Assignment in RL

  12. DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution

    Jul 29, 2026Hanghui Guo, Weijie Shi, Zhangze Chen +6Agent Harness OptimizationLLM Agent Harnesses

  13. Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

    Jul 29, 2026Sizhe Zhou, Sheldon Yu, Hui Wei +8Agent MemoryLLM Agent Memory

  14. Living-Harness Is an Interactive-Agent Evolver

    Jul 29, 2026Yuetian Du, Yucheng Wang, He Xu +9AI Agent ReliabilityAgent Harness Optimization

  15. Distributing Security Controls Through Harness Engineering

    Jul 28, 2026William Robert GoreAI Agent SecurityLLM Agent Security

  16. CogEEGAgent: Toward Autonomous Cognitive EEG Analysis with Grounded Execution and Selection-Aware Verification

    Jul 27, 2026Dengzhe Hou, Lingyu Jiang, Fangzhou Lin +1ElectroencephalographySelective Inference

  17. SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving

    Jul 27, 2026Yihui Zhang, Tianyu Wo, Jinghao Wang +7LLM Inference EfficiencyLLM Agent Serving

  18. OpenForgeRL: Train Harness-native Agents in Any Environment

    Jul 23, 2026Xiao Yu, Baolin Peng, Ruize Xu +7Computer-Use AgentsLLM Agent Training

  19. HARP: The Human--AI Research Platform

    Jul 22, 2026Zeshu Zhu, Natalie Friedman, Kevin Weatherwax +1Human-in-the-Loop EvaluationHuman-AI Interaction

  20. NVIDIA-labs OO Agents: Native Python Object-Oriented Agents

    Jul 22, 2026Paul Furgale, Severin Klingler, James Nolan +12LLM Agent OrchestrationTool-Using Agents

  21. FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

    Jul 20, 2026Krish Agarwal, Zhuoming Chen, Yanyuan Qin +3Efficient Multimodal InferenceLLM Inference Acceleration

  22. Agentic ERP: Multi-Agent Large Language Model Architecture for Autonomous Enterprise Resource Planning

    Jul 19, 2026Zhihao Liu, Tianyu Wang, Xi Vincent Wang +1Multi-Agent OrchestrationLLM Agent Evaluation