Large Language Model Safety

Recent momentum

-71%

27 papers in the last 28 days · 0.7% of indexed attention

Twelve weeks of publication activity for this topic as it is defined today.

Weekly history

Recent digests

What was published in this topic, kept on the site without email delivery.

Period ending 2026-09-14

11 new papers

A weekly snapshot of new work published in Large Language Model Safety.

Period ending 2026-09-07

14 new papers

A weekly snapshot of new work published in Large Language Model Safety.

565 papers

Latest in Large Language Model Safety

Open your feed →
CardsList
  1. Towards an Automated Test of LLM Security Knowledge

    Jul 20, 2026Shufan Chai, Liangliang Sun, Jessica StaddonLarge Language Model Safety

  2. Online Safety Monitoring for LLMs

    Jul 2, 2026Mona Schirmer, Metod Jazbec, Alexander Timans +3Large Language Model SafetyAI Safety Alignment