LLM Safety

LLM: Large Language Model

Momentum

36 papers in the last four weeks, up 200% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 272

All topics
CardsList
  1. Fast Multi-dimensional Refusal Subspaces via RFM-AGOP

    Jul 2, 2026Thomas WinningerLLM InterpretabilityLLM Safety

  2. kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

    Jul 2, 2026Mahmoud Abdelfattah, Hamid Nasiri, Peter GarraghanLLM GuardrailsSafety Filtering

  3. HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

    Jul 1, 2026Shei Pern Chua, Hao Wu, Qianli Ma +1Adversarial Attacks on LLMsLLM Safety Alignment

  4. Addressing Over-Refusal in LLMs with Competing Rewards

    Jun 30, 2026Taeyoun Kim, Aviral KumarRL for Language Model ReasoningLLM Safety

  5. Defending Against Harmful Supervision Hidden in Benign Samples

    Jun 29, 2026Bang An, Yibo Yang, Dandan Guo +3Supervised Fine-TuningFine-Tuning

  6. CAREBench: A Child-Safety Risk Benchmark for Language Models

    Jun 29, 2026Kaavya Krishna-Kumar, Elaine Lau, Vaughn Robinson +6LLM Safety BenchmarksLanguage Model Safety Evaluation

  7. The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

    Jun 27, 2026Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm +8LLM Safety BenchmarksMultilingual Language Model Evaluation

  8. TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment

    Jun 26, 2026Changyue Li, Jiaming He, Youliang Yuan +4Supervised Fine-TuningLLM Safety Alignment

  9. RAS: Measuring LLM Safety Through Refusal Alignment

    Jun 24, 2026Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu +1LLM Safety AlignmentLLM Safety

  10. MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

    Jun 24, 2026Congbo Ma, Hu Wang, Yichun Zhang +1LLM GuardrailsLLM Safety

  11. A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

    Jun 24, 2026Abrar Alotaibi, Raed Mughus, Moataz AhmedMultilingual Language Model EvaluationLLM Evaluation

  12. One Year Later...The Harms Persist, But So Do We!

    Jun 22, 2026Annika Marie Schoene, Cansu Canca, Gautham Vijay Kumar +1Mental HealthAdversarial Attacks on LLMs

  13. Skin-Deep: A Geometric Diagnostic for Alignment Fragility in Large Language Model Representations

    Jun 21, 2026Dongyub Jude Lee, Jungseob Lee, Seungyoon Lee +5LLM InterpretabilityLLM Fine-Tuning

  14. SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling

    Jun 18, 2026Haotian Xu, Zeyang Zhang, Linbao Li +3Speculative DecodingLLM Inference Acceleration

  15. A Variational Framework for LLM Generator-Regulator Games

    Jun 16, 2026Quanyan ZhuLLM SafetyText Generation

  16. RepSelect: Robust LLM Unlearning via Representation Selectivity

    Jun 15, 2026Filip Sondej, Yushi Yang, Adam MahdiLLM SafetyRepresentation Geometry in Language Models

  17. Adaptive and Explicit safe: Triggering Latent Safety Awareness in Large Reasoning Models

    Jun 15, 2026Ke Miao, Jiaxin Li, Hongliang Chen +2LLM Safety AlignmentLLM Safety

  18. GAS-Leak-LLM: Genetic Algorithm-Based Suffix Optimization for Black-Box LLM Jailbreaking

    Jun 14, 2026Aman Anifer, Vignesh Kumar Kembu, Vishnu M +4Adversarial Prompt GenerationLLM Safety

  19. CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

    Jun 13, 2026Wenbo Yu, Bohua Wang, Hao Fang +10LLM Safety BenchmarksLanguage Model Safety Evaluation