Large Language Model Agents

Latest papers 875

All topics
CardsList
  1. Safeguarding LLM Agents from Misalignment through Provenance Analysis

    May 1, 2026Yining She, Yiliang Liang, Eunsuk KangProvenanceLarge Language Model Agents

  2. Are Tools All We Need? Unveiling the Tool-Use Tax in LLM Agents

    Apr 30, 2026Kaituo Zhang, Zhen Xiong, Mingyu Zhong +4Large Language Model AgentsSearch-Augmented Reasoning

  3. Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception

    Apr 30, 2026Neemias B da Silva, Rodrigo Minetto, Daniel Silver +1Artificial Intelligence PersonasPersona Consistency

  4. Exploring LLM Agent Designs and Interaction Modalities for Scientific Visualization

    Apr 30, 2026Jackson Vonderhorst, Kuangshi Ai, Haichao Miao +2Visual AnalyticsLarge Language Model Agents

  5. Modeling Clinical Concern Trajectories in Language Model Agents

    Apr 30, 2026Sukesh Subaharan, Venkatesan VS, Murugadasan P +3EscalationLarge Language Model Agents

  6. Autonomous LLM Agents & CTFs: A Second Look

    Apr 29, 2026Youness Bouchari, Matteo Boffa, Marco Mellia +3Attacker Large Language ModelLarge Language Model Agents

  7. When Continual Learning Moves to Memory: A Study of Experience Reuse in LLM Agents

    Apr 29, 2026Qisheng Hu, Quanyu Long, Wenya WangSemantic MemoryContinual Learning

  8. SWE-Edit: Rethinking Code Editing for Efficient SWE-Agent

    Apr 28, 2026Yikai Zhang, Jiaxin Pei, Kenan Li +9Swe-Bench VerifiedCoding Agents

  9. Operating-Layer Controls for Onchain Language-Model Agents Under Real Capital

    Apr 28, 2026T. J. Barton, Chris Constantakis, Patti Hauseman +4Large Language Model AgentsValidation

  10. From Coarse to Fine: Self-Adaptive Hierarchical Planning for LLM Agents

    Apr 25, 2026Haoran Tan, Zeyu Zhang, Chen Ma +3Multi-Agent PlanningLarge Language Model Agents

  11. From Demographics to Survey Anchors: Evaluating LLM Agents for Modeling Retirement Attitudes

    Apr 24, 2026Rubén Garzón, Pauline Baron, Vincent Grari +3SurveyDemographics

  12. Superminds Test: Actively Evaluating Collective Intelligence of Agent Society via Probing Agents

    Apr 24, 2026Xirui Li, Ming Li, Yunze Xiao +4IntelligenceLarge Language Model Agents

  13. RouteGuard: Internal-Signal Detection of Skill Poisoning in LLM Agents

    Apr 24, 2026Wenjie Xiao, Xuehai Tang, Biyu Zhou +2Malicious AgentsPoisoning

  14. When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors

    Apr 23, 2026Chenghao Yang, Yuning Zhang, Zhoufutu Wen +4Large Language Model AgentsSimilarity and Metrics

  15. FSFM: A Biologically-Inspired Framework for Selective Forgetting of Agent Memory

    Apr 22, 2026Yingjie Gu, Wenjian Xiong, Liqiang Wang +7Agentic MemoryCatastrophic Forgetting

  16. SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks

    Apr 22, 2026Shanshan Zhong, Yi Lu, Jingjie Ning +7Agent Skill RetrievalSkills

  17. Separable Pathways for Causal Reasoning: How Architectural Scaffolding Enables Hypothesis-Space Restructuring in LLM Agents

    Apr 21, 2026John Alderete, Sebastian Benthal, Connie Xu +1Agentic ReasoningHypothesis-Driven Model Expansion

  18. Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment

    Apr 21, 2026Bobo Li, Rui Wu, Zibo Ji +5Large Language Model AgentsAsymmetry

  19. Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture the Flag Challenges

    Apr 21, 2026Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek +3Large Language Model AgentsIntermediate Checkpoints

  20. Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration

    Apr 20, 2026Qifan Zhang, Dongyang Ma, Tianqing Fang +5On-Policy Self-EvolutionSelf-Evolution

  21. Provable Coordination for LLM Agents via Message Sequence Charts

    Apr 19, 2026Benedikt Bollig, Matthias Függer, Thomas NowakMulti-Agent CoordinationLarge Language Model Agents

  22. TrafficClaw: A Generalizable LLM Agent in the Unified Physical Environment for Urban Traffic Control

    Apr 19, 2026Siqi Lai, Pan Zhang, Yuping Zhou +3Traffic Signal ControlUrban Environments

  23. Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks

    Apr 18, 2026Tyler H. Merves, Michael H. Conaway, Joseph M. Escobar +2Attacker Large Language ModelLarge Language Model Agents

  24. HiveMind: OS-Inspired Scheduling for Concurrent LLM Agent Workloads

    Apr 18, 2026Justice Owusu Agyemang, Jerry John Kponyo, Obed Kwasi Somuah +3Multi-Llm AgentsLarge Language Model Agents

  25. On Safety Risks in Experience-Driven Self-Evolving Agents

    Apr 18, 2026Weixiang Zhao, Yichen Zhang, Yingshuo Wang +8Self-Evolving AgentsLarge Language Model Agents

  26. ClimAgent: LLM as Agents for Autonomous Open-ended Climate Science Analysis

    Apr 18, 2026Hao Wang, Jindong Han, Wei Fan +1ClimateData Science Agents

  27. HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents

    Apr 18, 2026Jinchang Zhu, Jindong Li, Cheng Zhang +2Episodic MemoryLarge Language Model Agents

  28. Complete Cyclic Subtask Graphs for Tool-Using LLM Agents: Flexibility, Cost, and Bottlenecks in Multi-Agent Workflows

    Apr 17, 2026Luay Gharzeddine, Samer SaabMulti-Agent WorkflowsAgent Loop

  29. Experience Compression Spectrum: Unifying Memory, Skills, and Rules in LLM Agents

    Apr 17, 2026Xing Zhang, Guanghui Wang, Yanwei Cui +4Large Language Model AgentsLong-Term Agent Memory

  30. MemEvoBench: Benchmarking Safety Risks from Memory Misevolution in LLM Agents

    Apr 17, 2026Weiwei Xie, Shaoxiong Guo, Fan Zhang +5Large Language Model SafetyLarge Language Model Agents

  31. CoopEval: Benchmarking Cooperation-Sustaining Mechanisms and LLM Agents in Social Dilemmas

    Apr 16, 2026Emanuel Tewolde, Xiao Zhang, David Guzman Piedrahita +2CooperationLarge Language Model Agents

  32. Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis

    Apr 16, 2026Zhiyuan Zhai, Wenjing Yan, Xiaodan Shao +1Large Language Model AgentsAgentic

  33. AnyPoC: Universal Proof-of-Concept Test Generation for Scalable LLM-Based Bug Detection

    Apr 13, 2026Zijie Zhao, Chenyuan Yang, Weidong Wang +3Bug DetectionBug

  34. UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents

    Apr 13, 2026Yijuan Liang, Xinghao Chen, Yifan Ge +5Tool InvocationLarge Language Model Agents

  35. Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios

    Apr 11, 2026Nicolae Cudlenco, Mihai Masala, Marius LeordeanuLarge Language Model Agents

  36. Agentic Tool Use in Large Language Models

    Apr 1, 2026Jinchao Hu, Meizhi Zhong, Kehai Chen +2Large Language Model AgentsAgentic

  37. From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

    Mar 27, 2026Trilok Padhi, Ramneet Kaur, Krishiv Agarwal +9Large Language Model AgentsConformal Inference

  38. Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents

    Mar 27, 2026Nicholas Edwards, Sebastian SchusterCoding AgentsLarge Language Model Agents

  39. T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

    Mar 21, 2026Hyomin Lee, Sangwoo Park, Yumin Choi +3Attacker Large Language ModelRed-Teaming

  40. LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks

    Mar 20, 2026Xiang Long, Li Du, Yilong Xu +11Agentic BenchmarksClaw-Like Agent