AI Agent Safety Benchmarks

Momentum

22 papers in the last four weeks, up 83% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 143

All topics
CardsList
  1. SchemeArena: Factorized Stress Testing of Scheming in LLM Agents

    Sep 8, 2026Jie Ruan, Inderjeet Nair, Amy Liu +3LLM Agent EvaluationAI Agent Monitoring

  2. HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals

    Sep 3, 2026Jasmine Brazilek, Miles Tidmarsh, Matthias Endres +2Moral Reasoning in Language ModelsLLM Safety Alignment

  3. FiMI Banking: A Sovereign Model for Indian Retail Banking

    Sep 3, 2026NPCI AI Research Team, Aman Kumar, Asit Desai +15Financial ServicesRL for Language Models

  4. Agent Memory Is a Surface for Endogenous Authorization Laundering

    Sep 1, 2026Tommaso Cerruti, Mika Okamoto, Ansel Kaplan ErolLLM Agent MemoryLLM Agent Security

  5. Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions

    Aug 31, 2026Jaewoo Ahn, Junseo Kim, Hyunseo Kim +4Social Deduction GamesAI Agent Safety Benchmarks

  6. GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space

    Aug 31, 2026Boqi Chen, Xudong Liu, Yunke Ao +2HealthcareConstrained RL

  7. Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

    Aug 27, 2026Chenhao Wu, Haoxuan Jia, Yang Liu +11LLM Agent SafetyAI Agent Safety Benchmarks

  8. AeroCopilotBench: Safety-Gated Evaluation of LLM Agents on Aircraft Emergency Procedures in an Executable Cockpit

    Aug 17, 2026Yuchen Yuan, Zhenghuang Wu, Yuangan Li +2LLM Safety BenchmarksAI Agent Safety Benchmarks

  9. Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

    Aug 13, 2026Xutao Mao, Liangjie Zhao, Xiang Zheng +1LLM Agent Skill LearningAI Agent Safety Benchmarks

  10. REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

    Aug 11, 2026Zixing Chen, Xingyuan Liu, Jie Zhu +6LLM Red TeamingLLM Agents

  11. ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents

    Aug 10, 2026Hongwei Yao, Yiming Liu, Meihui Chen +6AI Agent SecurityAI Agent Safety

  12. Coupled Graph--Policy Distillation for Personalized Medication Safety in Older Adults with Multimorbidity

    Aug 10, 2026Zihan Wang, Anglin Liu, Rongyi Wang +6Multi-Agent LLM SystemsHealthcare

  13. HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

    Aug 7, 2026Xiao Zhang, Yusheng Wang, Yuhao Fei +5AI Agent SecurityAI Agent Safety Benchmarks

  14. StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection

    Aug 6, 2026Zhuoxin Zhan, Akbar Rafiey, Avery Ma +2Computer-Use AgentsAI Agent Safety

  15. Risky Business: Measuring The Faithfulness-Safety Tension

    Aug 4, 2026Dominik Meier, Luca Joshua Francis, Marco Bernhard Kaiser +3CoT FaithfulnessLanguage Model Safety Evaluation

  16. Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems

    Aug 4, 2026Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo +13AI Agent ReliabilityMulti-Agent LLM Systems

  17. Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation

    Aug 4, 2026Saqib Shouqi, Abdullah Nazly, Januki Wanniarachchi +1Adversarial Attacks on LLMsLLM Agent Evaluation

  18. S3S^3: Improving Agent Safety through Multi-Stage Defense

    Aug 3, 2026Zibo Xiao, Haoyu Wang, Jun SunLLM Agent OrchestrationAI Agent Safety Benchmarks

  19. MasDrift: Benchmarking Authorization Preservation Across Multi-Agent Architectures

    Aug 2, 2026Zhuoning Xu, Xiucheng Zhang, Hanjun Luo +3Multi-Agent CoordinationMulti-Agent Orchestration

  20. OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

    Aug 1, 2026Yunhao Chen, Xin Wang, Yixu Wang +6Adversarial AttacksLong-Horizon Agent Evaluation

  21. InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk

    Jul 31, 2026Yuan Gao, Zeren Yang, Junnan Li +6AI Agent ReliabilityAI Agent Evaluation

  22. MulRobBench: A Decision-Level Benchmark for Safe and Security-Policy-Compliant Multimodal UAV Agents

    Jul 26, 2026Belal S. Alsinglawi, Weizheng Wang, Junyi Wu +3Aerial RoboticsAI Agent Security Benchmarks

  23. GuardianAgentBench: Where Agents Fail and How to Guard Them

    Jul 23, 2026Vishal Ishwar Naik, Chenyu Xu, Donna Dong +5AI Agent ReliabilityLLM Guardrails

  24. OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills

    Jul 22, 2026Qiyuan Liu, Tingfeng Hui, Kun Zhan +2LLM Agent EvaluationAI Agent Safety