AI Safety Evaluation

Momentum

3 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 91

All topics
CardsList
  1. Warning labels shift perceptions of sycophantic AI, but not its influence

    Jun 19, 2026Lujain Ibrahim, Myra Cheng, Cinoo Lee +4LLM SycophancyAI Safety Evaluation

  2. AI Sandboxes: A Threat Model, Taxonomy, and Measurement Framework

    Jun 16, 2026Inderjeet Singh, Haitham Mahmoud, Andrés MurilloCyber-Physical SystemsAI Assurance

  3. SAE Interventions are Unreliable: Post-Intervention Recovery of Suppressed Behavior

    Jun 16, 2026Mingyue Cui, Linghui Shen, Xingyi YangSparse AutoencodersMechanistic Interpretability

  4. When and How Severely: Scenario-Specific Safety Envelopes for Driving VLAs

    Jun 12, 2026Abhinaw Priyadershi, Jelena FrtunikjVLMs for Autonomous DrivingLanguage Model Safety Evaluation

  5. A Virtuous AI is an Existential Risk

    Jun 11, 2026Guillermo Del Pinal, Youngchan Lee, Min OhnLLM Safety AlignmentAI Agent Safety

  6. DrugBench: Evaluating AI Control Protocols for Medication Harm Mitigation

    Jun 10, 2026Guido Freire, Agustín Martínez-Suñé, Viviana CotikHealthcareAI Control

  7. Position: Preventing AI-Generated CSAM Necessitates New Approaches to AI Safety

    Jun 9, 2026Neil Kale, Rebecca Portnoff, Pratiksha Thaker +5AI Safety EvaluationAI Safety

  8. Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models

    Jun 5, 2026Dewi Gould, Francis Rhys Ward, Anders Cairns Woodruff +18LLM EvaluationAI Safety Evaluation

  9. Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?

    Jun 4, 2026Jingheng Ye, Huiqi Zou, Simon Yu +1AI Coding AgentsAI Agent Monitoring

  10. AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety

    Jun 3, 2026Yanjing Ren, Reza Ebrahimi, TengTeng MaLLM Safety BenchmarksLLM-as-a-Judge

  11. Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety

    Jun 3, 2026Catherine Ge-Wang, Tyler Crosse, Benjamin Hadad +3Adversarial AttacksAI Agent Safety

  12. Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability

    Jun 2, 2026Krishnapriya Vishnubhotla, Hillary Dawkins, Isar Nejadgholi +1Language Model Safety EvaluationLLM Fine-Tuning

  13. RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

    Jun 1, 2026Huiqiong Li, Jiayu Wang, Zhiting Mei +3World ModelsAI Safety Evaluation

  14. Quantifying the Salience of Geo-Cultural Values for Pluralistic Safety Alignment

    May 29, 2026Arkadiy Saakyan, Charvi Rastogi, Lora AroyoLanguage Model Safety EvaluationCultural Alignment

  15. Safe2Drive: Evaluating Safe Driving Behaviors of E2E Autonomous Driving Models

    May 29, 2026Nishad Sahu, Kalpana Panda, Congyuan Yu +3Autonomous Driving BenchmarksEnd-to-End Autonomous Driving

  16. EUDAIMONIA: Evaluating Undesirable Dynamics in AI

    May 28, 2026Jun Rui Huang, Wang Bill Zhu, Ziyi Liu +3LLM AlignmentLanguage Model Safety Evaluation

  17. A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities

    May 28, 2026Kenji Imamura, Masao Ideuchi, Atsushi FujitaAI Safety EvaluationLLM Safety Evaluation

  18. Models That Know How Evaluations Are Designed Score Safer

    May 27, 2026Katharina Deckenbach, Haritz Puerto, Jonas Geiping +1Language Model Safety EvaluationAI Safety Evaluation

  19. Retrying vs Resampling in AI Control

    May 25, 2026James Lucassen, Adam KaufmanAI Agent SafetyAI Agent Monitoring

  20. Referential Security as a New Paradigm for AI Evaluations

    May 25, 2026Dan Ristea, Vasilios MavroudisAI AssuranceAlgorithmic Auditing

  21. AI Assurance: A Comprehensive Testing Strategy for Enterprise AI Systems

    May 22, 2026Chitra Badagi, Divye Singh, Animesh Sen +1AI AssuranceAI Safety Evaluation

  22. General Hazard Detection

    May 22, 2026Stephanie Ng, CP Lim, SueJen Looi +5VLM EvaluationAI Safety Evaluation

  23. Can AI Make Conflicts Worse? An Alignment Failure in LLM Deployment Across Conflict Contexts

    May 21, 2026Andrii KryshtalLLM AlignmentLanguage Model Safety Evaluation

  24. Adversarial Stress Testing of SPARK Humanoid Safety Filters

    May 18, 2026Saurav Ghosh, Abdou Sow, Luke ZhangAdversarial RobustnessRobotics

  25. REBAR: Reference Ethical Benchmark for Autonomy Readiness

    May 18, 2026Jonathan Diller, David Barnes, Rebekah Bogdanoff +14AI AccountabilityAI Safety Evaluation