Long-Horizon Agent Tasks

Latest papers 127

All topics
CardsList
  1. Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

    Jul 9, 2026Zongxia Li, Zhongzhi Li, Yucheng Shi +10Long-Horizon Agent EvaluationAI Agent Benchmarks

  2. From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization

    Jul 8, 2026Ying Chang, Jiahang Xu, Xuan Feng +3Agent Failure AnalysisLarge Language Model-Guided Optimization

  3. A Task-State Representation for Long-Horizon Mobile GUI Agents

    Jul 1, 2026Yujie Zheng, Zikang Liu, Xin Zhao +1Mobile GUI AutomationState Representation Learning

  4. What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States

    Jun 30, 2026Chen Liu, Ling Chen, Hanzhang Zhou +7RL for GUI AgentsGUI Agents

  5. Ask the World Before Acting: Environment Probing for Calibrated Agent World Models

    Jun 30, 2026Xinyuan Song, Zekun CaiBelief-Space PlanningWorld Model Learning

  6. Experience Graphs: The Data Foundation for Self-Improving Agents

    Jun 29, 2026Gang Liao, Yujia He, Abdullah Ozturk +22Self-Improving AgentsLong-Horizon Agent Tasks

  7. Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

    Jun 25, 2026Junhao Shi, Zezheng Huai, Siyin Wang +7LLM Agent OrchestrationRobotics

  8. Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

    Jun 22, 2026Yunan Wang, Minghui Song, Zihan Zhang +6Agentic RLReinforcement Learning

  9. Horizon Adaptive Offline Policy Learning via Value Stitching

    Jun 19, 2026Kexin Zheng, Xianyuan Zhan, Xintao YanValue Function EstimationOffline RL

  10. ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?

    Jun 18, 2026Jiajun Li, Mingshu Cai, Yixuan Li +5LLM Agent EvaluationAI Agent Benchmarks

  11. HiMPO: Hindsight-Informed Memory Policy Optimization for Less-Entangled Credit in Long-Horizon Agents

    Jun 15, 2026Jiangze Yan, Yi Shen, Wenjing Zhang +5Credit Assignment in RLLong-Horizon Agent Tasks

  12. WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning

    Jun 11, 2026Renmin Cheng, Changhao ChenCausal ReasoningLong-Horizon Agent Tasks

  13. Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents

    Jun 10, 2026Hao-Lun Hsu, Nikki Lijing Kuang, Boyi Liu +2Hierarchical MemoryLong-Horizon Agent Tasks

  14. A History-Aware Visually Grounded Critic for Computer Use Agents

    Jun 9, 2026Jaewoo Lee, Zaid Khan, Archiki Prasad +7Computer-Use AgentsLong-Horizon Agent Tasks

  15. SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?

    Jun 5, 2026Rishi Desai, Jesse Hu, Joan Cabezas +23AI Coding AgentsSoftware Engineering Benchmarks

  16. AdMem: Advanced Memory for Task-solving Agents

    Jun 5, 2026Runzhe Wang, Huilin Lu, Shengjie Liu +2Continual Learning for LLM AgentsLLM Agent Memory

  17. SentinelBench: A Benchmark for Long-Running Monitoring Agents

    Jun 3, 2026Matheus Kunzler Maldaner, Adam Fourney, Amanda Swearngin +5Computer-Use Agent BenchmarksWeb Agent Benchmarks

  18. AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?

    Jun 3, 2026Zhangchen Xu, Junda Chen, Yue Huang +16Long-Horizon Agent EvaluationAI Agent Benchmarks

  19. DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration

    Jun 2, 2026Wenkai Wang, Tao Xiong, Jingchen Ni +6Computer-Use Agent BenchmarksGUI Agents

  20. Multi-Agent Computer Use

    Jun 1, 2026Jing Yu Koh, Ruslan Salakhutdinov, Daniel FriedMulti-Agent CoordinationComputer-Use Agents

  21. Can LLM Agents Sustain Long-Horizon Organizational Dynamics?

    May 31, 2026Xuancheng Zhu, Yang Yue, Shuaibing Wan +4Multi-Agent CoordinationHuman Behavior Simulation