LLM Agent Harnesses

LLM: Large Language Model

Momentum

49 papers in the last four weeks, up 88% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 198

All topics
CardsList
  1. Interface-Induced Trajectory Censoring

    Sep 3, 2026Wenbo WangTool-Use EvaluationAI Agent Evaluation

  2. A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors

    Sep 3, 2026Pengxun Li, Litian Zhang, Jianwei Hou +4AI Agent SecurityLLM Agent Harnesses

  3. Bioinfoysis Technical Report

    Sep 3, 2026Qingyang Shao, Xin Zhang, Zhouyang Yuan +24Multi-Agent LLM SystemsLLM Agent Harnesses

  4. What Do CAE Simulation Agents Really Need Beyond a Generic Harness?

    Sep 3, 2026Jiasheng Shi, Tianhan ZhangMulti-Agent LLM SystemsLLM Agent Evaluation

  5. SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment

    Sep 2, 2026Qinghua Mao, Wanying Qu, Dadi Guo +8LLM Safety AlignmentLLM Agent Safety

  6. Harness Engineering in LLM Tool Use via Agent-Native Reusable Tool Primitives

    Sep 1, 2026Haibo Jin, Suijin Wang, Xucheng Yu +2Tool-Augmented Language Model AgentsLLM Agent Orchestration

  7. CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?

    Sep 1, 2026Damien Sileo, Dimitri KachlerTemporal Reasoning in Language ModelsAI Agent Benchmarks

  8. Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement

    Sep 1, 2026Haoyang Yan, Min-le Su, Hangfan Zhang +6Agent Harness OptimizationSelf-Improving Agents

  9. Agentic programs: an emerging form of scientific software in computational materials science

    Sep 1, 2026Yunsung Lim, Haekwan Jeon, Jaesun Kim +2LLM Agent HarnessesComputational Materials Science

  10. Runtime-Independent Persistent Agents: Preserving Identity, Memory, and Code Across Models, Harnesses, and Servers

    Sep 1, 2026Zhenyu Zhao, Roy ZhaoLLM Agent HarnessesAgent Memory Management

  11. Dr. Claw: An AI Scientist Workspace for Vibe Research

    Aug 31, 2026Dingjie Song, Hanrong Zhang, Dawei Liu +10AI Agents for Scientific DiscoveryCoding Agents

  12. A Human-in-the-Loop Autonomous Agent for Industry Time Series Forecasting

    Aug 31, 2026Xiaoyu Tao, Mingyue Cheng, Ze Guo +4Electricity Price ForecastingTime Series Forecasting

  13. Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection

    Aug 30, 2026Wujie Xiong, Rabimba Karanjai, Yang Lu +2LLM Agent SecurityInformation Flow Control

  14. Harness-RL: Black-Box Reinforcement Learning with Action-Args Decoupling for Central-Agent Multi-Agent Harnesses

    Aug 30, 2026Xinke Jiang, Zhixin Zhang, Zhibang Yang +6Multi-Agent LLM SystemsAgent Harness Optimization

  15. Logos: An Agent Harness on a Cross-Process Bus

    Aug 28, 2026Hanzhang Jia, Liheng Zeng, Hao Cheng +2Multi-Agent SystemsLLM Agent Harnesses

  16. SKILL.state: Scalable Long-Horizon Agent Skills

    Aug 26, 2026Sanket Badhe, Priyanka Tiwari, Jonghyun ChungLong-Horizon Agent TasksLong-Horizon LLM Agents

  17. Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents

    Aug 15, 2026Tianxin Wei, Zhan Shi, Minhua Lin +14Continual Learning for LLM AgentsLLM Agent Skill Learning

  18. Beyond Handcrafted Security: Towards Self-Evolving Defense for LLM Agents

    Aug 13, 2026Jiajun Ruan, Peiyang Li, Yukun Chen +2LLM Agent SecurityLLM Agent Safety

  19. @skills: Attention is all you have

    Aug 12, 2026Li Yin, Zhi Li, Zhan Shi +4LLM Agent Skill RetrievalLLM Agent Harnesses

  20. SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

    Aug 10, 2026Wanying Qu, Qinghua Mao, Yu Li +12Agent Harness OptimizationLLM Agent Safety

  21. STAIR: Effective Incident Response Using an End-to-End Agentic Planning Framework

    Aug 10, 2026Hanlin Jiang, Jionghao Huang, Shaofei Li +6Autonomous Cyber DefenseLLM Agent Orchestration

  22. The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task

    Aug 9, 2026Marc Alier Forment, María José Casañ Guerrero, Francisco José García-Peñalvo +1AI Coding AgentsLLM Agent Evaluation

  23. A2EA^2E : An End-to-End Agent Auditing Engine

    Aug 7, 2026Haoning Wang, Mingxun Zhang, Chenyue Yu +4Tool-Use EvaluationAI Agent Auditing

  24. HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

    Aug 7, 2026Xiao Zhang, Yusheng Wang, Yuhao Fei +5AI Agent SecurityAI Agent Safety Benchmarks

  25. SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

    Aug 6, 2026Xingyu Tan, Xiaoyang Wang, Qing Liu +4LLM Agent Skill RetrievalLLM Agent Harnesses