Long-Horizon Agent Tasks

Latest papers 127

All topics
CardsList
  1. TaReD: Tool-Aware Recursive Decomposition for Long-Horizon Tasks

    Oct 8, 2026Wei-Xiang Mao, Zhi-Kai Chen, De-Chuan Zhan +1Tool-Using AgentsLong-Horizon Agent Tasks

  2. TAP: Efficient Long-Horizon Agent Pruning via Trajectory-Anchored Recovery

    Oct 6, 2026Yuanzhe Li, Pengxin Wang, Yuxin Ren +5LLM PruningLLM Inference Acceleration

  3. Fork-and-Flush: Escaping Idea Basins in Autoresearch Agents

    Oct 5, 2026Ziyang Cai, Christos Ziakas, Vasilis Kontonis +5Local SearchLong-Horizon Agent Tasks

  4. Selecting Long-Horizon Trajectories for Reliable and Efficient Terminal-Agent Training

    Oct 5, 2026Cuong Dang, Hoang Anh Just, Ruoxi JiaSupervised Fine-TuningTrajectory Generation

  5. SCAD: Structured Credit Assignment and Distillation for Long-Horizon Agents

    Oct 2, 2026Shangyang Wu, Shuai Zhao, Ziyue Zhu +3Hierarchical PlanningStep-Level Credit Assignment in RL

  6. DAYJOB: A Benchmark for Long-Horizon Professional Work

    Oct 1, 2026Stephanie Finley, Liudas Panavas, Thomas Mikkelson +12LLM Agent EvaluationLong-Horizon Agent Tasks

  7. Consistent Plan-Act for Long-Horizon Agentic Tasks

    Sep 30, 2026Heng-Zhuang Li, Yi-Kai Zhang, Yu Wang +4Multi-Agent CoordinationLong-Horizon Agent Tasks

  8. CADOC: Cache-Aware Dynamic Object Context for Long-Horizon Agents

    Sep 29, 2026Junjie Yao, Zhangchen Zhou, Zhi-Qin John XuCost-Aware InferencePrefix Caching

  9. PrecogUI: Proactive GUI Agents via Pre-cognitive Simulation and Experience Retrieval

    Sep 29, 2026Bin Kang, Jiarui Ouyang, Li Jiang +2GUI AgentsLong-Horizon Agent Evaluation

  10. LongPuzzleBench: Evaluating GUI Agents on Long-Horizon Visual Puzzles

    Sep 28, 2026Bingo Zhang, Haochuan Lu, Zongjie Li +3GUI AgentsLong-Horizon Agent Evaluation

  11. Beyond Skill Evolution: Self-Evolving Context Management Policies for Long-Horizon Agent Harnesses

    Sep 28, 2026Weiyuan Li, Jinghan Xu, Aili Chen +4Agent Harness OptimizationLong-Horizon Agent Tasks

  12. Marathoner: Ultra-Long-Horizon Autonomous Intelligence

    Sep 28, 2026Zhang Ruiyang, Ou Jinpeng, Xie Yifan +4Long-Horizon Agent TasksLong-Horizon LLM Agents

  13. QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents

    Sep 27, 2026Weiqi Wang, Yuxin Zhou, Mouxiang Chen +9Reinforcement LearningLong-Horizon Agent Tasks

  14. Trajectory Unlearning on LLM-based Agents

    Sep 27, 2026Yingdan Shi, Ren WangLong-Horizon Agent TasksLLM Unlearning

  15. Dense Is Not Enough: Hierarchical Supervision Allocation for Long-Horizon On-Policy Distillation

    Sep 27, 2026Yuhao Sun, Binrui Wu, Zhuoer Xu +5On-Policy DistillationLong-Horizon Agent Tasks

  16. EmbodiedMemory-Bench: Benchmarking Embodied Memory for Long-Horizon Embodied Tasks

    Sep 23, 2026Lizhou Liang, Xinyu Zhong, Miao Pan +7Long-Horizon Agent TasksEmbodied AI

  17. Do Not Restart: Residual Completion for Stateful Agent Handoffs

    Sep 12, 2026Runzhi Deng, Yiming Zhong, Fang Zhao +1LLM Agent OrchestrationRuntime Enforcement for AI Agents

  18. Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks

    Sep 10, 2026Wasu Top Piriyakulkij, Rachel Lawrence, Alicia Curth +2LLM Agent OrchestrationLong-Horizon Agent Tasks

  19. From Version Conflicts to Decision Conflicts: Selective Revalidation for Long-Running AI Agents

    Sep 7, 2026Yongjian Lyu, Yang Ren, Ruofei Lai +1Tool-Using AgentsRuntime Enforcement for AI Agents

  20. E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

    Aug 31, 2026Wei Fan, Xinjie Shen, Xudong Guo +8Long-Horizon Agent EvaluationAI Agent Benchmarks

  21. HiRS-Agent: A Hierarchical Multi-Agent System for Reliable Long-Horizon Remote Sensing Task Solving

    Aug 31, 2026Boyang Mu, Zhiwei Wei, Mugen Peng +1Multi-Agent CollaborationRemote Sensing

  22. Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

    Aug 31, 2026Zixing Lei, Gengze Zhou, Xiong-Hui Chen +7Embodied NavigationRobot Foundation Models

  23. SKILL.state: Scalable Long-Horizon Agent Skills

    Aug 26, 2026Sanket Badhe, Priyanka Tiwari, Jonghyun ChungLong-Horizon Agent TasksLong-Horizon LLM Agents

  24. Persistent Recursive Worlds Enable Autonomous Software Evolution

    Aug 11, 2026Beichen Huang, Zhenyu Liang, Bowen Zheng +1Automated Software EngineeringRepository-Level Code Generation

  25. Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks

    Aug 11, 2026Zelei Cheng, Amritansh Mishra, Sambit Sahu +1Efficient AttentionLong-Horizon Agent Tasks

  26. SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

    Aug 8, 2026Keyang Zhong, Kuo Wang, Peng Liu +5Temporal Video GroundingGroup Relative Policy Optimization

  27. MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents

    Aug 7, 2026Zhisheng Chen, Bingfan Zeng, Bangde Cao +8Long-Horizon Agent TasksMemory-Augmented Agents

  28. Online Monitoring and Corrective Steering of Programming Agents

    Aug 7, 2026Shuyang Liu, Saman Dehghan, Ji Young Kim +3Software Engineering AgentsLLM Agent Workflow Optimization

  29. Recursive Synthesis for Long-Horizon Terminal Tasks

    Aug 5, 2026Zhongzhi Li, Yucheng Shi, Zongxia Li +8Terminal AgentsSynthetic Benchmark Generation

  30. EvoHarness-RL: Learning Runtime Harness Coordination for Self-Evolving Agents

    Aug 5, 2026Xuying Ning, Dongqi Fu, Tianxin Wei +17Agent Harness OptimizationLong-Horizon Agent Tasks

  31. Project2Task: Graph-Guided Project-Level Planning for Autonomous Research

    Aug 5, 2026Huirui Xu, Runtao Xu, Shuo Ren +1AI Agents for Scientific DiscoveryGraph-Based Planning

  32. Towards the Harness of Embodied Agents

    Aug 3, 2026Qi Wang, Tianyi Wang, Chengyang Li +6Tool-Using AgentsLong-Horizon Agent Tasks

  33. From Failures to Supervision: DynamicEnvPlan for Robust Long-Horizon Embodied Planning

    Aug 1, 2026Hao Yuan, Yuxin Wang, Lei Ji +1Robot Failure RecoveryRobot Task Planning

  34. Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems

    Jul 29, 2026Xu Zheng, Zhuomin Chen, Chaohao Lin +4Long-Horizon Agent TasksLong-Horizon LLM Agents

  35. OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

    Jul 29, 2026Jingbo Zhou, Yusai Zhao, Qi Bao +12Computer-Use Agent BenchmarksComputer-Use Agents

  36. AgentGUI: An Interface for Observing and Steering Long-Running AI Agents

    Jul 28, 2026Xuan Zhao, Jiwoong Sohn, Qinyue Zheng +1GUI AgentsHuman-in-the-Loop AI

  37. ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning

    Jul 28, 2026Jiaqi Zhang, Tong Chen, Junliang Yu +2Group Relative Policy OptimizationAgentic Reasoning

  38. Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering

    Jul 27, 2026Rushi Qiang, Changhao Li, Haotian Sun +3LLM Agent OrchestrationLLM Agents

  39. ACM: Agentic Context Management for Long Horizon Tasks

    Jul 26, 2026Xiaochuan Li, Ryan Ming, Meng Chu +3LLM Agent TrainingLong-Horizon Agent Tasks

  40. VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

    Jul 23, 2026Jiabin Lou, Haopeng Wang, Yuanshuai Wang +6Embodied NavigationRobot Navigation

  41. Offline RL with Hierarchical Action Chunking

    Jul 23, 2026Ahad JawaidHierarchical RLOffline RL

  42. Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks

    Jul 22, 2026Kaibing Yang, Guangfeng Cai, Shengtian Yang +6Group Relative Policy OptimizationRL Exploration

  43. SEE: Structure-aware Exploring & Exploiting for Long-horizon GUI Agent Trajectory Synthesis

    Jul 20, 2026Zhuohang Fan, Beichen Zhang, Yuanfa Li +4Trajectory GenerationSynthetic Data Generation

  44. Beyond Sequential Interaction: Benchmarking Parallel Execution and Coordination for GUI Agents

    Jul 17, 2026Zedong Yu, Qianxing Li, Zhi Gao +8Computer-Use Agent BenchmarksGUI Agents

  45. ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

    Jul 17, 2026Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu +5Tool-Use EvaluationAgentic RL

  46. Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics

    Jul 14, 2026Yue Chang, Rufeng Chen, Yifan Tian +73D SGGLong-Horizon Agent Tasks