LLM Safety

LLM: Large Language Model

Momentum

36 papers in the last four weeks, up 200% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 272

All topics
CardsList
  1. Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

    Aug 3, 2026Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel +1Language Model Safety EvaluationLLM Safety Alignment

  2. Long-term Measurements: Towards a Longitudinal Understanding of Human-AI Interactions

    Aug 3, 2026Nicole Mitchell, Dhruv Agarwal, Maty Bohacek +2Language Model Safety EvaluationHuman-AI Interaction

  3. EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers

    Aug 3, 2026Junyeong Park, Jieun Han, Haneul Yoo +3LLM Safety BenchmarksGenerative AI in Education

  4. A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models

    Aug 3, 2026Shu Quan, Tianfang Hao, Sitong Fang +8LLM Safety BenchmarksLLM Safety

  5. Auditable Release Control for Pedagogical Leakage in LLM Tutors

    Aug 1, 2026Nizam KadirLLM AuditingLLM Guardrails

  6. Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

    Jul 30, 2026Pingyu Wu, Lingyao Zhu, Weiming Zhang +1Adversarial Attacks on LLMsSafety Filtering

  7. Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support

    Jul 29, 2026Shayndhan Sivanathan, Shravan Nageswaran, Mehdi Zadem +10Clinical TriageClinical Decision Support

  8. Shieldstral

    Jul 28, 2026Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli +273Language Model Safety EvaluationContent Moderation

  9. Many-body Tipping Dynamics of ChatGPT-like AIs

    Jul 28, 2026Frank Yingjie Huo, Neil F. JohnsonLLM ReliabilityLLM Safety

  10. Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

    Jul 27, 2026Xi Li, Shu Zhao, Xiaohan Zou +6Adversarial Attacks on VLMsMultimodal Large Language Models

  11. Not All LLM Reasoning is Visible in the Chain-of-Thought

    Jul 24, 2026Vatsal Baherwani, Tom Goldstein, Ashwinee PandaCoT FaithfulnessLLM Interpretability

  12. Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation

    Jul 23, 2026Linjun LiMulti-Agent LLM SystemsLLM Safety

  13. IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests

    Jul 22, 2026Ankur Singh, Jinqiu Yang, Tse-Hsun ChenAI Coding AgentsAI Agent Security

  14. Sound Probabilistic Safety Bounds for Large Language Models

    Jul 22, 2026Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani +1Language Model Safety EvaluationConfidence Estimation in Language Models

  15. Risk Governance for Generative AI Mental Health Support: A Multi-Turn Safety Architecture

    Jul 17, 2026Anabela C. Areias, Catarina Botelho, António Farinhas +7Emotional Support ConversationMental Health

  16. Securing LLMs in the Wild: Privacy and Security Challenges at the Edge

    Jul 13, 2026Ren-Yi Huang, Mingchen Li, Dumindu Samaraweera +1LLM Inference EfficiencyEdge Computing

  17. HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models

    Jul 13, 2026Aznaur Aliev, Carlos Hinojosa, Abdelrahman Eldesokey +3LLM Fine-TuningLLM Safety Alignment

  18. Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA

    Jul 9, 2026Samuel Tetteh, Udip Shrestha, Joshua R. Waite +1LLM AuditingLLM Safety

  19. A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis

    Jul 9, 2026Fan Ma, Mauro Giuffrè, Donald Wright +12Scientific ReasoningMedical Diagnosis

  20. Alignment Plausibility: A New Standard for Assuring AI in Healthcare

    Jul 8, 2026Gwydion Williams, Sara Zannone, Bilal A MateenLLM AlignmentHealthcare

  21. DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

    Jul 7, 2026He Liu, Changtao Miao, Xinjie Yang +12Reasoning DistillationLLM Guardrails

  22. Out-of-Distribution Generalization of Risk Aversion in Language Models

    Jul 2, 2026Kristina Zhang, Junior Chinomso Okoroafor, Benjamin Maltbie +3LLM Safety BenchmarksOOD Generalization

  23. Online Safety Monitoring for LLMs

    Jul 2, 2026Mona Schirmer, Metod Jazbec, Alexander Timans +3Language Model Safety EvaluationLLM Safety