LLM Agent Safety

LLM: Large Language Model

Momentum

24 papers in the last four weeks, up 50% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 193

All topics
CardsList
  1. On Safety Risks in Experience-Driven Self-Evolving Agents

    Apr 18, 2026Weixiang Zhao, Yichen Zhang, Yingshuo Wang +8LLM Safety EvaluationOver-Refusal

  2. MemEvoBench: Benchmarking Safety Risks from Memory Misevolution in LLM Agents

    Apr 17, 2026Weiwei Xie, Shaoxiong Guo, Fan Zhang +5Long-Horizon Agent EvaluationAI Agent Security Benchmarks

  3. Subliminal Transfer of Unsafe Behaviors in AI Agent Distillation

    Apr 16, 2026Jacob Dang, Brian Y. Xie, Omar G. YounisSubliminal LearningLanguage Model Distillation

  4. HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?

    Apr 16, 2026Yukun Jiang, Yage Zhang, Michael Backes +2LLM Agent SecurityAI Agent Security Benchmarks

  5. Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems

    Apr 14, 2026Jiacheng Liu, Xiaohan Zhao, Xinyi Shang +1AI Coding AgentsLLM Agent Orchestration

  6. AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

    Apr 3, 2026Yunhao Feng, Yifan Ding, Yingshui Tan +6LLM Safety BenchmarksComputer-Use Agent Benchmarks

  7. Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety

    Oct 18, 2025Vamshi Krishna Bonagiri, Ponnurangam Kumaragurum, Khanh Nguyen +1LLM Agent EvaluationTool-Using Agents

  8. Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks

    Oct 16, 2025Trilok Padhi, Pinxian Lu, Abdulkadir Erol +5Adversarial Attacks on LLMsAI Agent Security Benchmarks

  9. Measuring Harmfulness of Computer-Using Agents

    Jul 31, 2025Aaron Xuxiang Tian, Ruofan Zhang, Janet Tang +3Computer-Use Agent BenchmarksComputer-Use Agents

  10. AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents

    Jun 4, 2025Akshat Naik, Emma Gouné, Patrick Quinn +4AI AlignmentLLM Agent Evaluation

  11. Emergent Risks in Generative Multi-Agent Systems

    Date pendingYue Huang, Yu Jiang, Wenjie Wang +12Multi-Agent LLM SystemsMulti-Agent Systems