Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

    Aug 9, 2026Yu Ma, Hongli Shi, Jing Li +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  2. HoloAegis: Frozen Representation, Topological Inference --- Minimally Parametric Safety Manifolds and Their Capability Boundaries for LLM Guardrails

    Aug 9, 2026Tak Ho Alex Li, Kaijie Liu, Lik-Hang Lee +3Language Model Safety EvaluationLLM Guardrails

  3. Calling the Bluff: Detecting Ever-Shifting Harmful Chat Dialogue via Ordered Reasoning Chain Regularization

    Aug 9, 2026Haojie Yu, Ziyou Jiang, Junjie Wang +4Language Model Safety EvaluationText Classification

  4. SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

    Aug 8, 2026Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah +11LLM Safety BenchmarksMultilingual Language Model Evaluation

  5. What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

    Aug 6, 2026Ro Encarnación, Tina Behzad, Emma Lurie +1LLM Safety BenchmarksLLM Evaluation

  6. Measuring and Detecting Harmful AI Sycophancy

    Aug 6, 2026Bohan Jiang, Dawei Li, Yasin Silva +1LLM SycophancyLanguage Model Safety Evaluation

  7. From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

    Aug 6, 2026Jiawei Qiu, Yichen Xu, Jianzhe Ma +5LLM Safety BenchmarksLanguage Model Safety Evaluation

  8. Item Response Theory for AI Safety

    Aug 5, 2026Joshua Fonseca Rivera, Neil Shah, David Demitri Africa +1LLM Safety BenchmarksLanguage Model Safety Evaluation

  9. Risky Business: Measuring The Faithfulness-Safety Tension

    Aug 4, 2026Dominik Meier, Luca Joshua Francis, Marco Bernhard Kaiser +3CoT FaithfulnessLanguage Model Safety Evaluation

  10. When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

    Aug 4, 2026Yu Feng, Chunting Zang, Chen Shen +4Language Model Safety EvaluationLLM Guardrails

  11. Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

    Aug 3, 2026Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel +1Language Model Safety EvaluationLLM Safety Alignment

  12. Long-term Measurements: Towards a Longitudinal Understanding of Human-AI Interactions

    Aug 3, 2026Nicole Mitchell, Dhruv Agarwal, Maty Bohacek +2Language Model Safety EvaluationHuman-AI Interaction

  13. Same violence, different answer: how AI responds to coercive control against women across languages

    Aug 2, 2026Lyu Chang, Sònia Estradé Albiol, Núria Vergés BoschMultilingual Language Model EvaluationLanguage Model Safety Evaluation

  14. ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification

    Aug 2, 2026Wajdi Zaghouani, Md. Rafiul Biswas, Kholoud Khalil Aldous +1LLM Safety BenchmarksArabic NLP

  15. Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

    Aug 1, 2026Yongxi Zhou, Junwei Yao, Yuanzhe Liu +4LLM Safety BenchmarksPrompt Sensitivity

  16. Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions

    Jul 29, 2026Shi Lin, Peng Qian, Dinghao Liu +5Language Model Safety EvaluationLLM Agent Safety

  17. Shieldstral

    Jul 28, 2026Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli +273Language Model Safety EvaluationContent Moderation

  18. When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

    Jul 27, 2026Tong Zhang, Zexin Li, Simin Chen +1LLM Inference EfficiencyLanguage Model Safety Evaluation

  19. Asymmetric Collapse in Model Merging: When Refusal Over- writes Recognition

    Jul 26, 2026Aarnav Choudhary, Matheus Fonseca Rocha, Jiwon Seo +2Language Model Safety EvaluationTask Vector Merging

  20. Trustworthiness Costs of Domain Adaptation in Small Language Models:A Cross-Architecture Empirical Study

    Jul 23, 2026Ramesh B. ParamkushamLanguage Model Safety EvaluationDomain Adaptation