Safety Benchmarks

Momentum

7 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 82

All topics
CardsList
  1. Multimodal Safety Evaluation Should Measure Controllability Beyond Classification

    Oct 5, 2026Junhyeong Park, Hanwool Lee, DongGeon Lee +4Safety BenchmarksMultimodal Evaluation

  2. SCOUT: Synergizing Reasoning and Tool-Use for Computer-Use Safety

    Sep 28, 2026Jianxing Chen, Xiao Yu, Shipra Agrawal +1Safety BenchmarksSecurity Evaluation

  3. AnesTRACE: Benchmarking Intraoperative Anesthesia from Multimodal Perception to Multi-step Decision-Making

    Sep 26, 2026Ziwei Huang, Qi Gao, Zhe Ji +5Safety BenchmarksPerception

  4. CasCVS-Net: A Staged Multi-Task Cascade for Critical View of Safety Assessment

    Sep 23, 2026Bock-Zien Toh, Yuanchuan Ren, Tay Aw Yu +3ColonoscopyComputer Vision

  5. Evaluation Metrics for Safe Reinforcement Learning

    Sep 14, 2026Lindsay Spoor, Aske Plaat, Thomas MoerlandSafety BenchmarksMarkov Decision Processes

  6. Scenario-Independent Criticality Assessment and Prediction for Vulnerable Road Users in Autonomous Driving

    Sep 14, 2026Jörg Gamerdinger, Victor Schwarzenberger, Philipp Schmid +2Automated VehiclesAutonomous Driving

  7. Beyond Semantic Accuracy: Consequence-Aware Evaluation for Safety-Critical Language Understanding

    Aug 25, 2026Yujing Chang, Thinh Pham, Van-Phat Thai +4Safety BenchmarksLarge Language Model Safety

  8. SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

    Aug 8, 2026Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah +11Multilingual SafetyLarge Language Model Safety

  9. How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots

    Aug 7, 2026Eric Nichols, Alva Markelius, Hatice GunesMulti-Dimensional EvaluationSafety Benchmarks

  10. Item Response Theory for AI Safety

    Aug 5, 2026Joshua Fonseca Rivera, Neil Shah, David Demitri Africa +1Item Response TheorySafety Benchmarks

  11. ADMITBench: A Safety-Governed Reference Framework for Evaluating the Admissibility of Industrial LLM Advisories

    Aug 4, 2026Yash Misra, Javal Vyas, Siddharth Gutta +1Safety BenchmarksSafety Claims

  12. Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning

    Aug 4, 2026Zhitian Hou, Yuhang Liu, Pengkai Wang +8Medication LeafletPatients

  13. When May a Model Replace the Experiment? Audits, Licenses, and the Price of Trust in Surrogate-Driven Design

    Aug 2, 2026Shuangxiu, Ma, Wenhe +1Model AuditingSurrogate Gradient

  14. OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

    Aug 1, 2026Yunhao Chen, Xin Wang, Yixu Wang +6Red-TeamingArtificial Intelligence Safety

  15. SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

    Jul 29, 2026Yi Cui, Zilin Wang, Yijie Xu +5Safety BenchmarksHazard

  16. QuantiBias: Benchmarking Quantization-Induced Bias in LLMs

    Jul 23, 2026Emilio FerraraLarge Language Model BiasLarge Language Model Quantization

  17. OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills

    Jul 22, 2026Qiyuan Liu, Tingfeng Hui, Kun Zhan +2Reusable Agent SkillsSkills

  18. Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

    Jul 22, 2026Gabriele Franchini, Giulio Mallardi, Michele De Carolis +1HealthcareSafety Benchmarks

  19. SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

    Jul 21, 2026Chunxiao Li, Yuan Xiong, Lijun Li +4Safety BenchmarksHazard

  20. SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents

    Jul 16, 2026Huaigang Yang, Ya Li, Min Ren +3Safety BenchmarksEmbodied Agents

  21. A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models

    Jul 13, 2026Rahul Gupta, Abhinav Mohanty, Payal Motwani +8Realistic Threat ModelRise

  22. Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

    Jul 2, 2026Yunhao Feng, Ruixiao Lin, Ming Wen +12Safety Benchmarks

  23. EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

    Jun 30, 2026Siddhant Panpatil, Arth Singh, Mijin Koo +3Safety BenchmarksEgocentric Video

  24. OopsieVerse: A Safety Benchmark with Damage-Aware Simulation for Robot Manipulation

    Jun 30, 2026Arnav Balaji, Arpit Bahety, Sriniket Ambatipudi +3Robotic ManipulationSafety Benchmarks

  25. EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures

    Jun 29, 2026Buğra Alperen Uluırmak, Rifat KurbanSafety BenchmarksModel Auditing

  26. SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

    Jun 29, 2026Jiacheng Zhang, Haoyu He, Sen Zhang +5Safety Benchmarks

  27. Evaluation Awareness Is Not One Capability: Evidence from Open Language Models

    Jun 22, 2026Nilesh Nayan, Aishwarya Sampath Kumar, Rishiraj Girmal +5Safety Benchmarks

  28. NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms

    Jun 18, 2026Hanwool Lee, Dasol Choi, Bokyeong Kim +2Red-TeamingSafety Benchmarks

  29. OSGuard: A Benchmark for Safety in Computer-Use Agents

    Jun 13, 2026Mina Mohammadmirzaei, Jeffrey FlaniganSafety BenchmarksComputer-Use Agents

  30. Quality Is Not a Safety Proxy Under Quantization

    Jun 8, 2026Sahil KadadekarQuantizedSafety Benchmarks

  31. Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges

    Jun 8, 2026Yongtaek Lim, Hyeji Choi, Minwoo KimSafety BenchmarksJudges

  32. The Cold-Start Safety Gap in LLM Agents

    Jun 5, 2026Chung-En Sun, Linbo Liu, Tsui-Wei WengLarge Language Model AgentsLarge Language Model Safety

  33. DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment

    Jun 4, 2026Yi Nian, Tiankai Yang, Yudi Zhang +7Safety AlignmentLarge Language Model Alignment

  34. Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety

    Jun 3, 2026Catherine Ge-Wang, Tyler Crosse, Benjamin Hadad +3Artificial Intelligence SafetyArtificial Intelligence Control

  35. What Benchmarks Don't Measure: The Case for Evaluating Abstention Competence in Autonomous Agents

    Jun 1, 2026Victor Ojewale, Suresh VenkatasubramanianAgentic EvaluationsAutonomous Agents

  36. LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

    May 29, 2026Krishnapriya Vishnubhotla, Sowmya Vajjala, Akriti Vij +1Large Language Model JudgesJudges

  37. Configurable Reward Model for Balanced Safety Alignment

    May 28, 2026Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj +5Safety AlignmentLarge Language Model Alignment

  38. Efficient Safety Benchmarking via Item Response Theory

    May 26, 2026Fabio Spagliardi, Mírian Silva, Ayan Datta +3Safety BenchmarksItem Response Theory

  39. Semantic Robustness Probing via Inpainting: An Interactive Tool for Safety-Critical Object Detection

    May 26, 2026Nico Steckhan, Krutarth Prajapati, Weija Shao +1InspectionInpainting

  40. Decomposing and Measuring Evaluation Awareness

    May 21, 2026Changling Li, Terry Jingchen Zhang, Jie Zhang +4Safety BenchmarksFrontier Models

  41. Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

    May 21, 2026Piercosma Bisconti, Matteo Prandi, Federico Pierucci +11Large Language Model SafetySafety Benchmarks

  42. Guiding Neuro-Symbolic Scenario Generation with Spatio-Temporal Logic

    May 18, 2026Lorenzo Bonin, Francesco Giacomarra, Luca Bortolussi +2Scenario GenerationSafety-Critical Scenarios

  43. Reinterpreting Safety Thresholds as Neuron Spiking Thresholds

    May 18, 2026Enrico Del Re, Mohamed Sabry, Cristina Olaverri-MonrealEmergency Braking Intensity PredictionSpiking Neural Networks

  44. REBAR: Reference Ethical Benchmark for Autonomy Readiness

    May 18, 2026Jonathan Diller, David Barnes, Rebekah Bogdanoff +14EthicsSafety Benchmarks

  45. Safety-Oriented Evaluation of Language Understanding Systems for Air Traffic Control

    May 12, 2026Yujing Chang, Yash Guleria, Duc-Thinh Pham +4Air Traffic ControlSafety Benchmarks

  46. Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks

    May 11, 2026Regina Gugg, Selina Niederländer, Andreas Stöckl +1Large Language Model EvaluationToxicity

  47. IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs

    May 11, 2026Songlin Bai, Xintong Wang, Linlin Yu +12Safety BenchmarksLarge Language Model Evaluation