Long-Horizon LLM Agents

LLM: Large Language Model

Momentum

60 papers in the last four weeks, up 161% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 297

All topics
CardsList
  1. StepKV: Step-Aware KV Cache Compression for LLM Agents

    Aug 26, 2026Boyu Feng, Jiahong Liu, Yifan Li +7KV CachingKV-Cache Compression

  2. AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

    Aug 13, 2026Yaxin Luo, Haobin Jiang, Jialv Zou +11AI Coding AgentsAgent Harness Optimization

  3. LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

    Aug 12, 2026Zhixin Zhang, Xinke Jiang, Zhibang Yang +5LLM-Guided RLLLM Agents

  4. Self-Correcting Long-Horizon Search Agents via Tree-Structured Memory

    Aug 11, 2026Aijun Yang, Qianxue Guo, Ziyi Huang +3Agentic SearchLLM Agent Memory

  5. UserToolBench: A User-Profile-Hidden Benchmark for Personalized Decision Making in Tool-Use LLMs

    Aug 10, 2026Xuexiong Yin, Zechuan Chen, Yongsen Zheng +5Tool-Use EvaluationTool-Augmented Language Model Agents

  6. Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

    Aug 9, 2026Yijun Pan, Yukun Lian, Kunyu Shi +5LLM Agent EvaluationAI Agent Benchmarks

  7. Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents

    Aug 9, 2026Harshitha Kolukuluru, Reshma Ashok, Kirat Arora +7Deep Research AgentsAI Agent Evaluation

  8. Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

    Aug 8, 2026Yingpeng Ma, Jianhao Yan, Bei Shi +6Interactive StorytellingAI Agent Benchmarks

  9. Agent-MD: Selective LLM Intervention with Event-Driven Escalation for Stateful GCMC--MD Campaigns

    Aug 7, 2026Yijie Wang, Zhen-Yu Yin, Zhenheng Tang +1LLM Agent OrchestrationScientific Workflow Automation

  10. Toward Reliable Context Compression for Long-Horizon Agents: An Empirical Study of Execution Instability

    Aug 6, 2026Guanghui Min, Liang Wu, Mayank Darbari +2AI Agent EvaluationLong-Horizon LLM Agents

  11. Unified Agent: Managing Interactions across Devices

    Aug 6, 2026Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei +2AI Agent BenchmarksState Tracking

  12. DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

    Aug 6, 2026Wenhao Lin, Chenyu Yu, Xingwei Lin +6LLM World ModelsLLM Guardrails

  13. EvoHarness-RL: Learning Runtime Harness Coordination for Self-Evolving Agents

    Aug 5, 2026Xuying Ning, Dongqi Fu, Tianxin Wei +17Agent Harness OptimizationLong-Horizon Agent Tasks

  14. OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents

    Aug 4, 2026Jingsheng Zheng, Xinyuan Fang, Jintian Zhang +3LLM Agent MemoryLong-Horizon Agent Evaluation

  15. Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

    Aug 4, 2026Christophe D. Hounwanou, John Emeka Eze, Yaé Ulrich GabaLLM-Guided RLLong-Horizon LLM Agents

  16. MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents

    Aug 3, 2026Jiajun Dong, Yutao Hu, Fengrui Fan +3LLM Agent MemoryLong-Horizon LLM Agents

  17. TrajWiki: Source-Grounded Memory Trajectories for Long-Horizon Dialogue Agents

    Aug 2, 2026Jingyu Sun, Yuyang Xue, Mingyang Li +9Agent MemoryLLM Agent Memory

  18. PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents

    Aug 2, 2026Jingyu Sun, Yan Lin, Yuyang Xue +10Memory-Augmented VLMsMultimodal Memory

  19. HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation

    Jul 31, 2026An Liu, Bingxi Liu, Hongyu Ding +6Memory-Augmented VLMsVision-Language Navigation

  20. MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

    Jul 31, 2026Qiming Shi, Yulong Tao, Linbo Jin +10LLM Agent EvaluationLong-Horizon Agent Evaluation