LLM Agent Safety

LLM: Large Language Model

Momentum

24 papers in the last four weeks, up 50% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 193

All topics
CardsList
  1. The Irreversibility Budget: Fleet-Level Risk Accounting and Admission Control for Agent Operating Systems

    Aug 31, 2026Bardia Mohammadi, Laurent BindschaedlerAI Risk ManagementRuntime Enforcement for AI Agents

  2. Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection

    Aug 30, 2026Wujie Xiong, Rabimba Karanjai, Yang Lu +2LLM Agent SecurityInformation Flow Control

  3. Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

    Aug 27, 2026Chenhao Wu, Haoxuan Jia, Yang Liu +11LLM Agent SafetyAI Agent Safety Benchmarks

  4. Beyond Handcrafted Security: Towards Self-Evolving Defense for LLM Agents

    Aug 13, 2026Jiajun Ruan, Peiyang Li, Yukun Chen +2LLM Agent SecurityLLM Agent Safety

  5. Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

    Aug 13, 2026Xutao Mao, Liangjie Zhao, Xiang Zheng +1LLM Agent Skill LearningAI Agent Safety Benchmarks

  6. AI Guardrail Survival under Single-Cycle Agentic Self-Summarization

    Aug 11, 2026Ted Kwartler, Alan Aqrawi, Arian AbbasiLLM GuardrailsLLM Safety Evaluation

  7. REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

    Aug 11, 2026Zixing Chen, Xingyuan Liu, Jie Zhu +6LLM Red TeamingLLM Agents

  8. SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

    Aug 10, 2026Wanying Qu, Qinghua Mao, Yu Li +12Agent Harness OptimizationLLM Agent Safety

  9. Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

    Aug 10, 2026Rohan Bhagra, Mahantesh Halapannavar, Uddhav BhattaraiLarge Language Model-Based Robot PlanningAdversarial Robustness

  10. HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

    Aug 7, 2026Xiao Zhang, Yusheng Wang, Yuhao Fei +5AI Agent SecurityAI Agent Safety Benchmarks

  11. ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

    Aug 6, 2026Abdulkadir Külçe, Alihan Esen, Çağla Fikir +4Conversational AgentsLLM Agent Safety

  12. DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

    Aug 6, 2026Wenhao Lin, Chenyu Yu, Xingwei Lin +6LLM World ModelsLLM Guardrails

  13. When Memory Becomes Authority: Benchmarking Authority Collapse at the Memory Consolidation Boundary

    Aug 3, 2026Qiuyang Zhan, Rui Zhang, Sheng Guo +2Agent MemoryMemory Agent Benchmarks

  14. S3S^3: Improving Agent Safety through Multi-Stage Defense

    Aug 3, 2026Zibo Xiao, Haoyu Wang, Jun SunLLM Agent OrchestrationAI Agent Safety Benchmarks

  15. Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

    Jul 31, 2026Minghui Pan, Jiayuxuan Yang, Yuanyuan Yuan +2LLM GuardrailsPrompt Injection Attacks on AI Agents

  16. MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck

    Jul 30, 2026Dongyi Liu, Haixing He, Xiaobao Wu +1Agent Memory PoisoningLLM Agent Safety

  17. Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions

    Jul 29, 2026Shi Lin, Peng Qian, Dinghao Liu +5Language Model Safety EvaluationLLM Agent Safety

  18. CogEEGAgent: Toward Autonomous Cognitive EEG Analysis with Grounded Execution and Selection-Aware Verification

    Jul 27, 2026Dengzhe Hou, Lingyu Jiang, Fangzhou Lin +1ElectroencephalographySelective Inference

  19. MemTX: Transactional Belief Commit for Stateful Agent Memory

    Jul 27, 2026Xiaoyang Li, Yiqi Wang, Haohui Lu +5Belief RevisionLLM Agent Safety

  20. Mission-Level Runtime Assurance for LLM-Assisted ISR Swarms over a Verification-Aware Fabric

    Jul 26, 2026Nikolaos Kekatos, Panagiotis Katsaros, Alexios Lekidis +2Swarm RoboticsAI Agent Monitoring