LLM Agent Safety

LLM: Large Language Model

Momentum

24 papers in the last four weeks, up 50% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 193

All topics
CardsList
  1. The Cold-Start Safety Gap in LLM Agents

    Jun 5, 2026Chung-En Sun, Linbo Liu, Tsui-Wei WengLLM Agent SecurityAI Agent Safety Benchmarks

  2. Evaluating Agentic Configuration Repair for Computer Networks

    Jun 4, 2026Rufat Asadli, Benjamin Hoffman, Ioannis Protogeros +1LLM Agent EvaluationAI Agent Benchmarks

  3. From Risk Classification to Action Plan Remediation: A Guardrail Feedback Driven Framework for LLM Agents

    Jun 4, 2026Yuhao Sun, Jiacheng Zhang, Shaanan Cohney +3LLM GuardrailsLLM Agent Training

  4. RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

    Jun 2, 2026Xian Qi Loye, Qinglin Su, Zhexin Zhang +5Reinforcement LearningAI Agent Safety

  5. SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning

    Jun 1, 2026Lichao Wang, Zhaoxing Ren, Tianzhuo Yang +4LLM Agent Safety

  6. Defenses & Enablers For Skill Injection Attacks on Terminal Based Agents

    Jun 1, 2026Yoshinari Fujinuma, Varun Gangal, Traian Rebedea +4Adversarial Attacks on LLMsLLM Agent Security

  7. A New Framework for Cybersecurity Refusals in AI Agents

    May 31, 2026Eliot Krzysztof Jones, Mateusz Dziemian, Matt Fredrikson +1LLM Agent EvaluationLLM Refusal Behavior

  8. COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

    May 29, 2026Wenkai Shen, Pengyang Zhou, Jiahe Xu +5LLM Safety AlignmentLLM Agents

  9. Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

    May 28, 2026Aditya Nawal, Manit Baser, Mohan GurusamyAI Agent Security BenchmarksLLM Safety Evaluation

  10. SafeRx-Agent: A Knowledge-Grounded Multi-Agent Framework for Safe and Explainable Medication Recommendation

    May 27, 2026Xinyu Wang, Hanwei Wu, Zhenghan Tai +7Multi-Agent LLM SystemsHealthcare

  11. LACUNA: Safe Agents as Recursive Program Holes

    May 27, 2026Yaoyu Zhao, Yichen Xu, Oliver Bračevac +3AI Agent ReliabilityLLM Agents

  12. Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents

    May 27, 2026Yongxiang Li, Moxin Li, Zhixin Ma +2LLM Agent SecurityAI Agent Security Benchmarks

  13. TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling

    May 26, 2026Jiaqian Li, Yanshu Li, Boxuan Zhang +2LLM AuditingLLM Agent Safety

  14. Voluntary Collusion with Secret Tools in Competing LLM Agents

    May 26, 2026Xijie Zeng, Frank RudziczLLM Agent EvaluationLLM Agent Safety

  15. FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents

    May 26, 2026Haoxuan Jia, Yang Liu, Bin Chong +10AI Agent ReliabilityLLM Guardrails

  16. Open-source LLMs administer maximum electric shocks in a Milgram-like obedience experiment

    May 20, 2026Roland Pihlakas, Jan Llenzl DagohoyLLM Refusal BehaviorLLM Safety Evaluation

  17. POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents

    May 18, 2026Qiaoyuan Zheng, Yiqu Yang, Qi Gao +1LLM Agent EvaluationLLM Agent Security

  18. Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On

    May 18, 2026Yixiang Yao, Yuhang Yao, Xinyi Fan +5Multi-Agent LLM SystemsMulti-Agent Coordination

  19. Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment

    May 18, 2026S. Bensalem, Y. Dong, M. Franzle +6AI Agent ReliabilityLLM Guardrails

  20. Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents

    May 18, 2026Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu +2Long-Horizon Agent EvaluationLLM Safety Evaluation

  21. ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents

    May 17, 2026Udari Madhushani Sehwag, Zhengyang Shan, Heming Liu +3LLM Agent SecurityAI Agent Security Benchmarks

  22. State Contamination in Memory-Augmented LLM Agents

    May 16, 2026Yian Wang, Agam Goyal, Yuen Chen +1LLM Agent MemoryLLM Agent Safety