AI Agent Safety Benchmarks

Momentum

22 papers in the last four weeks, up 83% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 143

All topics
CardsList
  1. Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

    May 8, 2026Zhengyang Tang, Yi Zhang, Chenxin Li +18Computer-Use AgentsAgent Evaluation

  2. Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors

    May 7, 2026Jonas Wiedermann-Möller, Leonard Dung, Maksym AndriushchenkoAI Agent EvaluationAI Agent Safety

  3. MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

    May 7, 2026Ashwani Anand, Ivi Chatzi, Ritam Raha +1Computer-Use Agent BenchmarksAI Agent Reliability

  4. Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges

    May 7, 2026Shihao Weng, Yang Feng, Xiaofei XieLLM-as-a-JudgeAI Agent Safety

  5. MOSAIC-Bench: Measuring Compositional Vulnerability Induction in Coding Agents

    May 5, 2026Jonathan Steinberg, Oren GalLanguage Model Safety EvaluationAI Coding Agents

  6. A Comparative Evaluation of AI Agent Security Guardrails

    Apr 27, 2026Qi Li, Jiu Li, Pingtao Wei +8LLM GuardrailsAI Agent Security

  7. SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

    Apr 21, 2026Josue Torres-Fonseca, Naihao Deng, Yinpei Dai +5LLM Safety BenchmarksLarge Language Model-Based Robot Planning

  8. Owner-Harm: A Missing Threat Model for AI Agent Safety

    Apr 20, 2026Dongcheng Zhang, Yiqing JiangAI Agent SecurityAI Agent Safety

  9. HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?

    Apr 16, 2026Yukun Jiang, Yage Zhang, Michael Backes +2LLM Agent SecurityAI Agent Security Benchmarks

  10. HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark

    Apr 15, 2026Jiacheng Wang, Jinchang Hou, Fabian Wang +3AI Agent AuditingLong-Horizon Agent Evaluation

  11. AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

    Apr 3, 2026Yunhao Feng, Yifan Ding, Yingshui Tan +6LLM Safety BenchmarksComputer-Use Agent Benchmarks

  12. Quantifying Frontier LLM Capabilities for Container Sandbox Escape

    Mar 1, 2026Rahul Marchand, Art O Cathain, Jerome Wynne +5LLM Safety BenchmarksLLM Agent Security

  13. Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

    Oct 1, 2025Shoumik Saha, Jifan Chen, Sam Mayers +3AI Coding AgentsAI Agent Security

  14. SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking

    Aug 21, 2025Xiangyang Zhu, Yuan Tian, Chunyi Li +3LLM Safety BenchmarksSynthetic Benchmark Generation

  15. Measuring Harmfulness of Computer-Using Agents

    Jul 31, 2025Aaron Xuxiang Tian, Ruofan Zhang, Janet Tang +3Computer-Use Agent BenchmarksComputer-Use Agents