LLM Agent Planning

LLM: Large Language Model

Momentum

22 papers in the last four weeks, up 175% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 144

All topics
CardsList
  1. SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon Strategy Game Planning

    Jun 29, 2026Tianyu Jin, Shuo Chen, Yida Wang +6Multi-Agent LLM SystemsGame-Playing Agents

  2. LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents

    Jun 28, 2026Mingyu Jeon, Bokyeong Kim, Suwan Cho +2Retrieval-Augmented GenerationLegal Document Analysis

  3. NormAct: A Benchmark for Hidden Social Norm Compliance in Embodied Planning

    Jun 26, 2026Shiyun Zhao, Xinwei Song, Tianyu Guo +7AI Agent BenchmarksMultimodal Agents

  4. Agent vs. Parametric World Models: Hybrid Planning for Reliable Language Agents

    Jun 26, 2026Xinyuan Song, Zekun CaiWorld ModelsWorld Model-Based Planning

  5. Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning

    Jun 25, 2026Tianyi Men, Zhuoran Jin, Pengfei Cao +3GUI AgentsLLM Agent Training

  6. HEART: Coordination of Heterogeneous Expert Agents for Physically Grounded Robotic Task Planning

    Jun 24, 2026Junho Lee, Seabin Lee, Wonjong Lee +3Large Language Model-Based Robot PlanningRobot Task Planning

  7. LemonHarness Technical Report

    Jun 23, 2026Kailong Ren, Fubo Sun, Jiachen Liu +18LLM Agent OrchestrationLong-Horizon LLM Agents

  8. CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation

    Jun 20, 2026Yifei Wang, Ruiyin Li, Peng Liang +4Repository-Level Code GenerationMulti-Agent Coding

  9. Steer, Don't Solve: Training Small Critic Models for Large Code Agents

    Jun 20, 2026Shubham Gandhi, Yiqing Xie, Atharva Naik +2LLM-as-a-JudgeAI Coding Agents

  10. Trip+: Benchmarking Agents in Personalized Interactive Travel Planning

    Jun 19, 2026Junle Chen, Wei Chen, Yehong Xu +6LLM Agent EvaluationAI Agent Benchmarks

  11. ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep Research

    Jun 18, 2026Zhibang Yang, Xinke Jiang, Yuzhen Xiao +9Long-Form Document GenerationDeep Research Agents

  12. WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning

    Jun 11, 2026Renmin Cheng, Changhao ChenCausal ReasoningLong-Horizon Agent Tasks

  13. ProPlay: Procedural World Models for Self-Evolving LLM Agents

    Jun 11, 2026Yijun Ma, Zehong Wang, Yiyang Li +5World ModelsLLM Agent Planning

  14. TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation

    Jun 10, 2026Siyu Li, Toan Tran, Lingyi Zhao +2Trajectory GenerationHuman Behavior Simulation

  15. AerialClaw: An Open-Source Framework for LLM-Driven Autonomous Aerial Agents

    Jun 10, 2026Ke Li, Jianfei Yang, Luyao Zhang +8Aerial RoboticsLarge Language Model-Based Robot Planning

  16. HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning

    Jun 9, 2026Juncheng Diao, Zhicong Lu, Peiguang Li +6Hierarchical RLLong-Horizon LLM Agents

  17. Bridging the Agent-World Gap: Text World Models for LLM-based Agents

    Jun 8, 2026Yixia Li, Hongru Wang, Peng Lai +13LLM World ModelsWorld Models

  18. When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents

    Jun 4, 2026Dongsheng Zhu, Xuchen Ma, Yucheng Shen +5AI Agent ReliabilityAI Agent Benchmarks

  19. From Risk Classification to Action Plan Remediation: A Guardrail Feedback Driven Framework for LLM Agents

    Jun 4, 2026Yuhao Sun, Jiacheng Zhang, Shaanan Cohney +3LLM GuardrailsLLM Agent Training

  20. AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

    Jun 4, 2026Jiayu Liu, Cheng Qian, Zhenhailong Wang +10LLM PlanningLLM Agent Evaluation

  21. Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance

    Jun 3, 2026Kaustav Kundu, Ritvik Shrivastava, Maxim Arap +13LLM PlanningEgocentric Video Understanding

  22. Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents

    Jun 3, 2026Haoyu Sun, Wenxuan Wang, Mingyang Song +5Tool-Augmented Language Model AgentsLLM Agent Evaluation

  23. Plan First, Judge Later, Run Better: A DMAIC-Inspired Agentic System for Industrial Anomaly Detection

    Jun 3, 2026Yongzi Yu, Ao Li, Le Wang +4Multi-Agent LLM SystemsLLM Agent Orchestration

  24. Inducing Reasoning Primitives from Agent Traces

    Jun 2, 2026Zhihan Lei, Jiarui Yan, Joshua Momo +1LLM Agent Skill LearningAgentic Reasoning

  25. Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents

    May 28, 2026Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua +2LLM Agent EvaluationLLM Agent Planning

  26. DisasterBench: Benchmarking LLM Planning under Typed Tool Interface Constraints

    May 27, 2026Zhitong Chen, Kai Yin, Weifeng Zhang +7Tool-Use PlanningAI Agent Benchmarks