AI Safety

Momentum

10 papers in the last four weeks, up 150% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 88

All topics
CardsList
  1. Harmonizing AI Safety Thresholds

    Jul 17, 2026Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza +1AI Risk ManagementAI Governance

  2. Unsafe at any AUC: Unlearned Lessons from Sociotechnical Disasters for Responsible AI

    Jul 15, 2026Joshua A. Kroll, Andrew Smart, R. Stuart Geiger +1AI AccountabilityAI Risk Management

  3. FLARE-AI: Flaw Reporting for AI

    Jun 30, 2026Shayne Longpre, Elaine Zhu, Carson Ezell +15AI AssuranceAI Accountability

  4. Safety from Honesty in a Disinterested AI Predictor

    Jun 28, 2026Yoshua Bengio, Oliver Richardson, Tomáš Gavenčiak +13AI AlignmentAI Safety

  5. Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions

    Jun 24, 2026Kaicheng Shen, Lingyu Li, Wen Wu +3Language Model Safety EvaluationLong-Horizon Agent Evaluation

  6. KidRisk: Benchmark Dataset for Children Dangerous Action Recognition

    Jun 24, 2026Minh-Kha Nguyen, Trung-Hieu Do, Kim Anh Phung +3Human Activity RecognitionVideo Action Recognition

  7. ForceForget: Reinforcement Concept Removal for Enhancing Safety in Text-to-Image Models

    Jun 12, 2026Dong Han, Yong LiSafe T2I GenerationAI Safety

  8. A Virtuous AI is an Existential Risk

    Jun 11, 2026Guillermo Del Pinal, Youngchan Lee, Min OhnLLM Safety AlignmentAI Agent Safety

  9. AI Researchers Must Help Lead Arms Control to Mitigate Military AI Risks

    Jun 10, 2026Ted Fujimoto, Jacob BenzAI GovernanceAI Safety

  10. Position: AI Must Become Planet-Centered, Not Just Human-Centered

    Jun 9, 2026Maria Perez-OrtizAI AlignmentHuman-Centered AI

  11. Position: Preventing AI-Generated CSAM Necessitates New Approaches to AI Safety

    Jun 9, 2026Neil Kale, Rebecca Portnoff, Pratiksha Thaker +5AI Safety EvaluationAI Safety

  12. Diffuse AI Control on Fuzzy Tasks

    Jun 8, 2026Mikhail Terekhov, Caglar Gulcehre, Vivek Hebbar +1Adversarial Prompt GenerationLanguage Model Safety Evaluation

  13. Safe Embodied AI for Long-horizon Tasks: A Cross-layer Analysis of Robotic Manipulation

    Jun 4, 2026Dabin Kim, Daemin Park, Sangyub Lee +4Long-Horizon Robotic ManipulationRobot Safety

  14. AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety

    Jun 3, 2026Yanjing Ren, Reza Ebrahimi, TengTeng MaLLM Safety BenchmarksLLM-as-a-Judge

  15. EUDAIMONIA: Evaluating Undesirable Dynamics in AI

    May 28, 2026Jun Rui Huang, Wang Bill Zhu, Ziyi Liu +3LLM AlignmentLanguage Model Safety Evaluation

  16. Understanding Safety-Sensitive Expert Behavior in Mixture-of-Experts LLMs

    May 28, 2026Zhibo Zhang, Yuxi Li, Zhen Ouyang +2Mixture-of-Experts Language ModelsLLM Auditing

  17. Semantic Robustness Probing via Inpainting: An Interactive Tool for Safety-Critical Object Detection

    May 26, 2026Nico Steckhan, Krutarth Prajapati, Weija Shao +1Object DetectionAI Safety

  18. Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications

    May 24, 2026Xiaoyue Lu, Xianglin Yang, Haijun Liu +4Automated Software TestingLanguage Model Safety Evaluation

  19. JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data

    May 23, 2026Junlan Feng, Fanyu Meng, Chong Long +12LLM Safety AlignmentLLM Safety

  20. Reframing AI Loss of Control: What It Is, How to Have It, How to Lose It

    May 19, 2026Ze Shen Chin, Maurice Chiodo, Dennis Müller +1AI Risk ManagementAI Governance

  21. Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South

    May 18, 2026Charvi Rastogi, Mukul Bhutani, Minsuk Kahng +13Demographic Bias in T2I ModelsAI Safety

  22. Formal Methods Meet LLMs: Auditing, Monitoring, and Intervention for Compliance of Advanced AI Systems

    May 15, 2026Parand A. Alamdari, Toryn Q. Klassen, Sheila A. McIlraithLLM AuditingFormal Verification