AI Safety Evaluation

Momentum

3 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 91

All topics
CardsList
  1. Distillation for Incrimination and Distillation for Capabilities

    Oct 7, 2026Sebastian Prasanna, Jacqueline Tay, Alek WestoverLLM Safety AlignmentLanguage Model Distillation

  2. Systemization of Knowledge (SoK): Human-Centered AI Safety for Youth

    Oct 6, 2026Pratyasha Saha, Yaman Yu, Yang WangAI Risk ManagementAI Safety Evaluation

  3. Not What a Child Expressed: Auditing the Sign-to-Text Safety Interface in Child-Facing AI

    Oct 5, 2026Muhammad Rafiullah Memon, Viet Vo, Wanlun Ma +1Sign Language TranslationAI Safety Evaluation

  4. Inspect Robots: Evaluating the Capabilities and Safety of Embodied AI

    Oct 5, 2026Christopher Leet, Achu Menon, Sravanthi Machcha +12AI Agent EvaluationRobotic Policy Evaluation

  5. Reliability Engineering for AI Systems: Challenges, Methods, and Directions

    Sep 28, 2026Rong Pan, Yili Hong, Min XieAI Agent ReliabilityAI Safety Evaluation

  6. From Protocols to Evidence: Bounded Claims for AI in Service of the Common Good

    Sep 10, 2026Nitesh V. Chawla, Paulo BenantiAI AccountabilityAI Safety Evaluation

  7. Reducing Catastrophic Risk from AI with Systematic Monitoring and Evaluation of Rogue AI Progression

    Sep 2, 2026T. Bauer, W. P. Kegelmeyer, E. Begoli +15AI Risk ManagementAI Safety Evaluation

  8. Beyond "I Can't Help With That": How Child Safety Experts Evaluate AI Chatbot Safety

    Aug 8, 2026Hannah Cha, Neha Shukla, Solon Barocas +3Human-in-the-Loop EvaluationAI Safety Evaluation

  9. Studying People to Study AI: Expert Perspectives on the Epistemic Fit and Barriers of Human Research in AI Safety & Ethics

    Aug 6, 2026Jessica Y. Bo, Paula Akemi Aoyagui, Shalaleh Rismani +3AI Safety EvaluationHuman-Centered AI

  10. Why Public Service AI Governance Frameworks Risk Failing in the Age of General-Purpose AI: Lessons from Policing

    Jul 28, 2026Sam Relins, Daniel BirksAI Safety EvaluationAI Governance

  11. MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection

    Jul 16, 2026Goktug OzkanSynthetic Benchmark GenerationAI Safety Evaluation

  12. Adversarial Prompting Framework for AI Safety Assessment

    Jul 15, 2026Yash Bhatnagar, Kunal Banerjee, Anirban ChatterjeeAdversarial Prompt GenerationAdversarial Attacks on LLMs

  13. The Foreign Policy AI Evaluation Gap

    Jul 3, 2026Charles Pozniak, Jeba SaniaAI Safety EvaluationAI Governance

  14. Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits

    Jul 1, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangAI AssuranceBenchmark Auditing

  15. Evaluating Intellectual Property Guardrails of Generative Image Models: A Technical Report

    Jul 1, 2026Austin T. Hoag, Apostolos Modas, Yunhao Ba +9Image GenerationAI Safety Evaluation

  16. Defeat Devices in AI Systems

    Jun 27, 2026Emilio FerraraDeception in Language ModelsAI Safety Evaluation

  17. RedVox: Safety and Fairness Gaps in Speech Models Across Languages

    Jun 25, 2026Beatrice Savoldi, Sara Papi, Wafa Aissa +2Audio-Language Model EvaluationAI Safety Evaluation

  18. The Inattentional Gap: Task-Conditioned Language and Vision Models Omit the Safety-Critical Signals They Can Otherwise Report

    Jun 25, 2026Kwan Soo Shin, In Seok Kang, Yunkyung Min +2Language Model Safety EvaluationAI Safety Evaluation

  19. PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation

    Jun 23, 2026Leyi Sheng, Han Sun, Zhen Sun +4AI Safety EvaluationMultimodal Jailbreak Attacks

  20. Safety-Aware Evaluation of LLM-Generated Driver Intervention Messages through Multi-Task Risk Fusion

    Jun 21, 2026Keito InoshitaLLM EvaluationAutonomous Driving