Large Language Model Safety

Latest papers 470

All topics
CardsList
  1. G-CARB: Graph-Localized Conformal Agent Risk Budget for Compositional Harm

    Oct 4, 2026Zijun Yu, Yu Gu, Vahid Partovi Nia +1Large Language Model Safety

  2. EmoRSS: Mitigating Emotion-Induced Over-Refusal in Large Language Models

    Oct 4, 2026Shuyi Miao, Yaojin Ma, Chenhang Cui +5Large Language Model Safety

  3. KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

    Oct 1, 2026Pengfei Li, Naufal Suryanto, Sicheng Zhang +1Large Language Model SafetyCybersecurity

  4. TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety

    Oct 1, 2026Fengpeng Li, Kemou Li, Qizhou Wang +3Large Language Model SafetyAttack-Success Rate

  5. Explainable Suicide Risk Assessment on Social Media with Multi-Task QLoRA

    Sep 30, 2026Xuan Zhong Feng, Geoffrey Martin, Hexin Dong +1Suicide RiskRisk Stratification

  6. Faithful Dual-constrained Erasure for Robust LLM Safety Alignment

    Sep 30, 2026Jiaqing Li, Shide Zhou, Zhibo Zhang +3Large Language Model UnlearningLarge Language Model Safety

  7. MASCRDM: Multi-Agent System for Compliance Risk Detection and Mitigation in Training Process of Large Language Models

    Sep 30, 2026Yan Zhang, Chuming Wei, Ruien Li +3Large Language Model SafetyCompliance

  8. Trustworthy Runtime Error Healing in Real-World Repositories: A Benchmark and Guardrail

    Sep 30, 2026Gou Tan, Pengfei Chen, Zhensu Sun +9RuntimeLarge Language Model Safety

  9. ACTR: Aligning Thoughts and Responses for Multilingual Safety in Reasoning LLMs

    Sep 29, 2026Xianhui Zhang, Jian Yu, Chengyu Xie +6Multilingual SafetyLarge Language Model Safety

  10. Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning

    Sep 29, 2026Muhammad Zeeshan Akram, Mufid Kamel Marican, Anvesh Reddy Yenugu +2Model-Agnostic DefenseLarge Language Model Safety

  11. ThinkingGuard: Decoding Implicit Hazards via Step-by-Step Risk Attribution in Multimodal Large Language Models

    Sep 29, 2026Ruochen Zhang, Yao Huang, Yitong Sun +5Large Language Model SafetyMultimodal Large Language Models

  12. See it, Say it, Sorted: Mechanistic Diagnosis and Parameter-Space Mitigation of Emergent Misalignment in LLMs

    Sep 28, 2026Weiqiao Que, Ruizhe Li, Chengyu Wang +3Large Language Model SafetyEmergent Misalignment

  13. When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety

    Sep 28, 2026Tianyi Guan, Jianhui Chen, Liangming PanLarge Language Model SafetyRole

  14. How to Tame a Multi-Headed Hydra? Adaptive Multi-Category Safety Steering for Large Language Models

    Sep 28, 2026Chenxi Wang, Ruiyang Huang, Li Huang +1Large Language Model SafetyLinear Activation Steering

  15. PROACT-Agent: Progressive Runtime Oversight and Active Circuit-breaking for Real-Time Safety

    Sep 28, 2026Ding Jia, Wei Liu, Xianglong Du +5Large Language Model SafetySafety-Critical Scenarios

  16. Safety Reconstructed: Generative Modeling via Masked Diffusion Builds Strong Safety Guardrails

    Sep 27, 2026Gert Lek, Abele Malan, Chaoyi Zhu +3Large Language Model SafetyMasked Diffusion Language Models

  17. Beyond Average Safety: Chance-Constrained LLM Fine-tuning

    Sep 24, 2026Taha Entesari, Mahyar FazlyabLarge Language Model SafetyLarge Language Model Fine-Tuning

  18. ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts

    Sep 24, 2026Firoj Alam, Md. Rafiul Biswas, Mohamed Bayan Kmainasi +5Hate Speech DetectionMemes

  19. Baszta: Data-Centric Fine-Tuning of a Polish Multi-Label Safety Classifier

    Sep 24, 2026Adam Górski, Mateusz Jąkalak, Rafał JakubowskiLarge Language Model SafetyClassifier

  20. Xeno-Interpretability: Investigating the Alien Minds of LLMs

    Sep 17, 2026F. Pierucci, M. Bracale Syrnikov, M. Prandi +3Large Language Model Safety

  21. Local Sparsity Enables Unsupervised LLM Safety Detection

    Sep 17, 2026Xin Chen, Gil Kur, Alexander Shevchenko +1Large Language Model SafetySparsity

  22. From Intent to Action: Benchmarking LLM Safety in Vehicle Voice Command Authorization

    Sep 17, 2026Diba Afroze, Xingli Zhang, Yazhou Tu +1Large Language Model SafetyLarge Language Model Decisions

  23. Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models

    Sep 16, 2026Alizishaan Khatri, Chiquita Prabhu, Omkar NeogiLarge Language Model SafetyGuardrail

  24. The Role of Fine-grained Harm Signals in LLM Safety

    Sep 16, 2026Soyeon Park, Seogyeong Jeong, Sunwoo Kim +1Large Language Model SafetyHarmful Content

  25. First Token Matters: Understanding Safety Collapse in Large Reasoning Models

    Sep 16, 2026Yizheng Yang, Haining Yu, Yuechen Wang +4Large Language Model SafetyLarge Reasoning Models

  26. Inoculation Midtraining with Learned Neologisms

    Sep 14, 2026Kyle O'Brien, Edward James Young, Puria Radmard +4Large Language Model SafetyInoculation Prompting

  27. K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations

    Sep 14, 2026Laura M. Vowels, Matthew J. Vowels, Shivali Sharma +9Large Language Model SafetyMental Health

  28. Divide, Consult, Conquer: Capability Laundering Through Aligned LLMs

    Sep 14, 2026Mark Russinovich, Blake Bullwinkel, Giorgio Severi +2Large Language Model SafetyStrong Large Language Model

  29. SIRF: A Spec-Internalized Risk Foundation Model for Industrial Content Risk Control

    Sep 12, 2026Suwan Wu, Yumeng Lin, Pengcheng Yuan +1Conformal Risk ControlArtificial Intelligence Risk

  30. An Efficient and Modular Framework for Targeted Harm Mitigation in LLMS

    Sep 12, 2026Roberto Campbell, Momin Abbass, Muneeza Azmat +5Large Language Model SafetyLarge Language Model Alignment

  31. RAG-Safety-Bench: Reliable Evaluation of Retrieval-Augmented LLM Safety

    Sep 11, 2026Adithiyan Rajan Indira Saravanan, Kathleen C. FraserLarge Language Model SafetyAgentic Retrieval-Augmented Generation Systems

  32. CS-Guard: Benchmarking LLM Guardrails for Code Generation Security

    Sep 9, 2026Jinyang Li, Mingyu Guo, Hung X. NguyenLarge Language Model SafetyCode Generation

  33. Benchmark Scores Are Pipeline-Dependent: A Reliability Audit of Cybersecurity LLM Benchmarks

    Sep 8, 2026Aymene Berriche, Cathrine Shalby, Mohannad Alhanahnah +1Large Language Model SafetyCybersecurity

  34. Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts

    Sep 8, 2026Yongxi Zhou, Wenbo Ye, Yuanzhe Liu +2Large Language Model SafetyJailbreak Success Rates

  35. Risk-Conditioned Fine-Tuning of Large Language Models

    Sep 8, 2026Zixuan Liu, Fangzheng Wu, Brian Summa +1Large Language Model SafetyReinforcement Learning From Human Feedback

  36. SAFIRE: Safety-Critical Benchmark for Fine-grained Fire and Smoke Understanding in Multimodal LLMs

    Sep 7, 2026Pengfei Li, Naufal Suryanto, Sicheng Zhang +2Multimodal Large Language ModelsLarge Language Model Safety

  37. Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibration

    Sep 6, 2026Zixuan Wang, Bingjie Zhang, He Zhao +1Large Language Model SafetyRefusals

  38. Representational alignment yields generalizable safety in language models

    Sep 3, 2026Lingyu Li, Yan Teng, Yingchun Wang +1Large Language Model SafetyLarge Language Model Alignment

  39. IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks

    Sep 3, 2026Saikat Mondal, Mamta, Deeksha Varshney +2Large Language Model SafetyLarge Language Model Evaluation

  40. SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group Dialogue

    Sep 1, 2026Stephanie Fong, Yiwen Jiang, Zimu Wang +12Large Language Model Safety

  41. The Safeguard Worked. Is the LLM System Safer?

    Sep 1, 2026Pingyu Wu, Weiming Zhang, Nenghai YuLarge Language Model SafetySafer

  42. Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language Models

    Aug 31, 2026Guoli Wang, Haonan Shi, Tu Ouyang +1Diffusion Language ModelsLarge Language Model Safety

  43. Capability-Gated Language Models: Security Composes, Utility Does Not

    Aug 31, 2026Patrikas Vanagas, Augustas Mačijauskas, Laurynas LopataLarge Language Model SafetyAccess Control

  44. Distributed Implicit Harm: A Compositional Safety Blind Spot in MLLM-Based Video Moderation

    Aug 31, 2026Ruotong Wang, Zihao Zhu, Siwei Lyu +2Video Multimodal Large Language ModelsMultimodal Large Language Models

  45. Interpreting and Steering for Safe and Correct Code Generation

    Aug 30, 2026Hao Yan, Ziyu YaoLarge Language Model SafetyVulnerable Code

  46. When Safety Speaks a Language: A Mechanistic Analysis of Safety-Language Identity Entanglement in LLMs

    Aug 30, 2026Apoorva Upadhyaya, Sandipan SikdarMultilingual SafetyLarge Language Model Safety