AI Agent Safety Benchmarks

Momentum

22 papers in the last four weeks, up 83% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 143

All topics
CardsList
  1. ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D

    Jul 21, 2026Lena Libon, Ben Rank, Jehyeok Yeon +5AI Agent MonitoringAI Control

  2. SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

    Jul 21, 2026Chunxiao Li, Yuan Xiong, Lijun Li +4LLM Safety BenchmarksAI Agent Safety Benchmarks

  3. SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents

    Jul 16, 2026Huaigang Yang, Ya Li, Min Ren +3Robot SafetyAI Agent Safety Benchmarks

  4. ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs

    Jul 15, 2026Aryan Keluskar, Amrita Bhattacharjee, Huan LiuLLM AlignmentAI Agent Safety Benchmarks

  5. Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents

    Jul 13, 2026Chenglin Yu, Li Yin, Ying Yu +4Instruction FollowingRuntime Enforcement for AI Agents

  6. ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

    Jul 11, 2026Kefan Song, Yanjun QiAI Agent AuditingLLM Auditing

  7. AgentAbstain: Do LLM Agents Know When Not to Act?

    Jul 11, 2026Xun Liu, Yi Evie Zhang, Vira Kasprova +5AI Agent ReliabilityLLM Agent Evaluation

  8. SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

    Jul 9, 2026Shilin Ou, Yifan Xu, Luyao ZhangAlgorithmic AuditingAI Agent Evaluation

  9. Evaluating calibrated refusal and safe usefulness in dual-use biology settings

    Jul 6, 2026Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis +13LLM Refusal BehaviorSafety Filtering

  10. Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

    Jul 2, 2026Yunhao Feng, Ruixiao Lin, Ming Wen +12AI Agent SafetyAI Agent Safety Benchmarks

  11. Evaluating Agentic Harness Systems for Autonomous Computational Pathology

    Jul 1, 2026Jie Lin, Zongyi Chen, Qiaoling Zheng +6Computational PathologyLLM Agent Evaluation

  12. EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

    Jun 30, 2026Siddhant Panpatil, Arth Singh, Mijin Koo +3VLM RobustnessEgocentric Video Understanding

  13. LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

    Jun 22, 2026Rongxu Cui, Zongzheng Zhang, Jingrui Pang +11Robot SafetyVision-Language-Action Models

  14. Agent MechSuits: Mechanistic Subspace Safety Steering for Multi-Turn CLI Agents

    Jun 21, 2026Weidi Luo, Qiming Zhang, Yihao Quan +5Computer-Use AgentsLLM Interpretability

  15. NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms

    Jun 18, 2026Hanwool Lee, Dasol Choi, Bokyeong Kim +2Multi-Agent LLM SystemsSafety-Critical Control

  16. TRAP: Benchmark for Task-completion and Resistance to Active Privacy-extraction

    Jun 17, 2026Moon Ye-Bin, Nam Hyeon-Woo, Baek Seong-Eun +2Privacy-Preserving Language ModelsPrivacy Leakage in Language Models

  17. Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models

    Jun 16, 2026Jasmine Brazilek, Joel Christoph, Maheep Chaudhary +4AI Agent EvaluationAI Agent Safety

  18. PseudoBench: Measuring How Agentic Auto-Research Fuels Pseudoscience

    Jun 16, 2026Xinyang Liao, Lingyu Li, Huacan Liu +5AI-Assisted Scientific ResearchAI Agent Safety Benchmarks

  19. ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures

    Jun 13, 2026Kenneth Ge, Andre AssisAgent Failure AnalysisAI Coding Agents

  20. Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

    Jun 13, 2026Ömer Veysel Çağatan, Xuandong ZhaoReward HackingLanguage Model Safety Evaluation

  21. OSGuard: A Benchmark for Safety in Computer-Use Agents

    Jun 13, 2026Mina Mohammadmirzaei, Jeffrey FlaniganComputer-Use AgentsLLM Guardrails

  22. SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

    Jun 12, 2026Xiaoxin Lu, Ranran Haoran Zhang, Rui ZhangLarge Language Model-Based Robot PlanningLLM Planning

  23. Hidden in Plain Sight: Benchmarking Agent Safety Against Decomposition Attacks with DECOMPBENCH

    Jun 12, 2026Vikhyath Kothamasu, Virginia Smith, Chhavi YadavAI Agent SafetyAI Agent Safety Benchmarks

  24. SafeGEO: Understanding Generative Engine Optimization Risks in Recommendation Agents

    Jun 8, 2026Qianfeng Wen, Yifan Simon Liu, Xin Liu +4Generative Engine OptimizationLLM Agent Security