LLM Safety

LLM: Large Language Model

Momentum

36 papers in the last four weeks, up 200% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 272

All topics
CardsList
  1. Inform, Coach, Relate, Listen: Auditing LLM Caregiving Support Roles

    May 28, 2026Drishti Goel, Agam Goyal, Veda Duddu +8HealthcareLLM Auditing

  2. Robust and Efficient Guardrails with Latent Reasoning

    May 27, 2026Siddharth Sai, Xiaofei Wen, Muhao ChenLLM GuardrailsContent Moderation

  3. Evolving and Detecting Multi-Turn Deception using Geometric Signatures

    May 26, 2026Surender Suresh Kumar, Mary L. CummingsAdversarial Prompt GenerationDeception in Language Models

  4. BAIT: Boundary-Guided Disclosure Escalation LLM Jailbreaking via Self-Conditioned Reasoning

    May 26, 2026Xuan Luo, Yue Wang, Geng Tu +2Jailbreak AttacksLLM Safety

  5. ReasonOps: A Unified Operational Paradigm for Trustworthy Verified LLM Reasoning

    May 26, 2026Adnan RashidLLM SafetyLLM Reasoning

  6. Conceptual Steganography

    May 26, 2026Zhejian Zhou, Jonathan MayCoT ReasoningLLM Security

  7. Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks

    May 26, 2026Kevin Kuo, Virginia Smith, Chhavi YadavLLM Fine-TuningAdversarial Attacks on LLMs

  8. Model Unlearning Objectives Vary for Distinct Language Functions

    May 26, 2026Berk Atil, Vipul Gupta, Rebecca J. PassonneauLLM SafetyMachine Unlearning

  9. D2D^2-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation Signals

    May 25, 2026Aoxi Liu, Yupeng Chen, James Oldfield +5Language Model Safety EvaluationLLM Safety

  10. Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety

    May 25, 2026Fay Elhassan, David Sasu, Alexandra Kulinkina +2LLM Safety BenchmarksHuman Preference Evaluation

  11. StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs

    May 25, 2026Yang Luo, Xinran Liu, Tiantian Ji +3Adversarial Attacks on VLMsLanguage Model Safety Evaluation

  12. Furina: Fragmented Uncertainty-Driven Refusal Instability Attack

    May 24, 2026Tongxi Wu, Jian Zhang, Yang GaoAdversarial Attacks on VLMsLLM Safety

  13. Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications

    May 24, 2026Xiaoyue Lu, Xianglin Yang, Haijun Liu +4Automated Software TestingLanguage Model Safety Evaluation

  14. Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models

    May 23, 2026Seokil Ham, Jaehyuk Jang, Wonjun Lee +1LLM Fine-TuningLLM Safety Alignment

  15. JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data

    May 23, 2026Junlan Feng, Fanyu Meng, Chong Long +12LLM Safety AlignmentLLM Safety

  16. Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts

    May 22, 2026Md Nurul Absar SiddikyMixture-of-Experts Language ModelsExpert Routing

  17. Test-Time Training Undermines Safety Guardrails

    May 21, 2026Simone Antonelli, Sadegh Akhondzadeh, Aleksandar BojchevskiLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  18. Latent-space Attacks for Refusal Evasion in Language Models

    May 20, 2026Giorgio Piras, Raffaele Mura, Fabio Brau +4Adversarial Attacks on LLMsLLM Safety

  19. CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety

    May 20, 2026Heajun An, Qi Zhang, Vedanth Achanta +1LLM GuardrailsLLM Safety Alignment

  20. Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs

    May 20, 2026Dylan Feng, Pragya Srivastava, Anca Dragan +1Language Model Safety EvaluationLLM Guardrails

  21. REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

    May 20, 2026Jiachen Ma, Jiawen Zhang, Xiangtian Li +3LLM Self-RefinementLLM Safety

  22. Robotics-Inspired Guardrails for Foundation Models in Socially Sensitive Domains

    May 19, 2026Rebecca Ramnauth, Drazen Brscic, Brian ScassellatiLLM GuardrailsHuman-AI Interaction

  23. Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction

    May 18, 2026Jiahe Guo, Xiangran Guo, Jiaxuan Chen +6Multimodal Large Language ModelsLLM Safety

  24. Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

    May 18, 2026Ziwei Wang, Jing Chen, Ruichao Liang +6LLM SafetyLLM Jailbreak Attacks

  25. DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

    May 18, 2026Wenzhuo Xu, Zhipeng Wei, Zonghao Ying +4Multimodal Large Language ModelsLLM Safety