Large Language Model Safety

Recent momentum

emerging

0 papers in the last 28 days · 0.0% of indexed attention

Twelve weeks of publication activity for this topic as it is defined today.

Weekly history

Recent digests

What was published in this field, kept on the site without email delivery.

Period ending 2026-09-21

27 new papers

A weekly snapshot of new work published in Large Language Model Safety.

Period ending 2026-09-14

12 new papers

A weekly snapshot of new work published in Large Language Model Safety.

Inside this field

Focused directions

855 papers

Latest in Large Language Model Safety

  1. REBAR: Reference Ethical Benchmark for Autonomy Readiness

    May 18, 2026Jonathan Diller, David Barnes, Rebekah Bogdanoff +14AutonomyAdversarial Evaluation

  2. Muse Spark Safety & Preparedness Report

    May 14, 2026Cristina Menghini, Peter Ney, Hamza Kwisaba +117Large Language Model SafetyThreat Models

  3. Selective Safety Steering via Value-Filtered Decoding

    May 14, 2026Bat-Sheva Einbinder, Hen Davidov, Yee Whye Teh +2Large Language Model SafetySafety

  4. Tracing Persona Vectors Through LLM Pretraining

    May 13, 2026Viktor Moskvoretskii, Dominik Glandorf, Jorge Medina Moreira +2PersonalityLarge Language Model Safety