AI Agent Safety Benchmarks

Momentum

22 papers in the last four weeks, up 83% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 143

All topics
CardsList
  1. ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

    Jun 7, 2026Lu Jia, Haibo Tong, Feifei Zhao +5AI Agent Safety BenchmarksLLM Agent Safety

  2. The Cold-Start Safety Gap in LLM Agents

    Jun 5, 2026Chung-En Sun, Linbo Liu, Tsui-Wei WengLLM Agent SecurityAI Agent Safety Benchmarks

  3. Beyond Goodhart's Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems

    Jun 5, 2026Yiyang Zhao, Zhuo Zhang, Qingxuan Le +2Multi-Agent LLM SystemsAI Agent Safety

  4. AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety

    Jun 3, 2026Yanjing Ren, Reza Ebrahimi, TengTeng MaLLM Safety BenchmarksLLM-as-a-Judge

  5. PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

    Jun 3, 2026Hainiu Xu, Italo Luis da Silva, Jiangnan Ye +7LLM Safety BenchmarksMoral Reasoning in Language Models

  6. Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety

    Jun 3, 2026Catherine Ge-Wang, Tyler Crosse, Benjamin Hadad +3Adversarial AttacksAI Agent Safety

  7. What Benchmarks Don't Measure: The Case for Evaluating Abstention Competence in Autonomous Agents

    Jun 1, 2026Victor Ojewale, Suresh VenkatasubramanianAgent EvaluationAI Agent Safety

  8. SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents

    Jun 1, 2026Hao Cheng, Changtao Miao, Tianle Song +21AI Agent EvaluationLLM Agent Security

  9. SafeVLA-Bench: A Benchmark for the Success-Safety Gap in Vision-Language-Action Models

    May 30, 2026Jialiang Fan, Weizhe Xu, Zijun Wang +3Robot SafetyRobotic Manipulation

  10. ROGUE: Evaluating Corrigibility Failures in Frontier Computer-Use Agents

    May 29, 2026Jeremy Tien, Abishek Anand, Yu-Rou Tuan +3Agent ReliabilityComputer-Use Agents

  11. EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents

    May 29, 2026Dongwook Choi, Taeyoon Kwon, Bogyung Jeong +6LLM GuardrailsAI Agent Safety

  12. Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

    May 26, 2026Aman Priyanshu, Supriti Vijay, Esha PahwaData LeakageMulti-Agent LLM Systems

  13. Position: AI Safety Requires Effective Controllability

    May 26, 2026Yige Li, Yunhao Feng, Jun SunLLM Safety AlignmentAI Agent Safety

  14. Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

    May 21, 2026Piercosma Bisconti, Matteo Prandi, Federico Pierucci +11LLM Safety BenchmarksComputer-Use Agent Benchmarks

  15. Measuring Security Without Fooling Ourselves: Why Benchmarking Agents Is Hard

    May 21, 2026Sahar Abdelnabi, Chris Hicks, Konrad Rieck +1AI Agent EvaluationAI Agent Security

  16. Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks

    May 18, 2026Yubin Qu, Ying Zhang, Yanjun Zhang +4Computer-Use Agent BenchmarksCoding Agents

  17. LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection

    May 18, 2026Lei Zhao, Abhay Bhaskar, Edgar DobribanAI Agent SecurityAI Agent Safety

  18. Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

    May 17, 2026Lecheng Yan, Ruizhe Li, Xicheng Han +5AI Agent ReliabilityLLM Agent Evaluation

  19. ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents

    May 17, 2026Udari Madhushani Sehwag, Zhengyang Shan, Heming Liu +3LLM Agent SecurityAI Agent Security Benchmarks

  20. Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks

    May 14, 2026Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray +1LLM Safety BenchmarksBenchmark Auditing

  21. AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills

    May 13, 2026Haomin Zhuang, Hanwen Xing, Yujun Zhou +5AI Agent SecurityLLM Agent Security

  22. SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

    May 12, 2026Chang Jin, An Wang, Zeming Wei +7LLM Agent SecurityAI Agent Security Benchmarks

  23. LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

    May 11, 2026Chiyu Zhang, Huiqin Yang, Bendong Jiang +8AI Agent Security BenchmarksLLM Jailbreak Attacks

  24. Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values

    May 11, 2026Haonan Dong, Qiguan Feng, Kehan Jiang +3AI AlignmentAI Agent Evaluation

  25. FORTIS: Benchmarking Over-Privilege in Agent Skills

    May 9, 2026Shawn Li, Chenxiao Yu, Han Wang +8LLM Agent SecurityAI Agent Security Benchmarks