Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. Confidently Deceptive: On the Relationship Between Confidence and Deception in LLMs

    May 12, 2026Ali Asad, Stephen Obadinma, Anshul Pattoo +2Language Model Safety EvaluationConfidence Estimation in Language Models

  2. To Whom Do Language Models Align? Measuring Principal Hierarchies Under High-Stakes Competing Demands

    May 12, 2026Fangyi Yu, Nabeel Seedat, Jonathan Richard Schwarz +1LLM AlignmentLanguage Model Safety Evaluation

  3. Safety-Oriented Evaluation of Language Understanding Systems for Air Traffic Control

    May 12, 2026Yujing Chang, Yash Guleria, Duc-Thinh Pham +4LLM GroundingAir Traffic Management

  4. Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers

    May 11, 2026Nikita Kezins, Urbas Ekka, Pascal Berrang +1Neural Network VerificationLanguage Model Safety Evaluation

  5. RUBEN: Rule-Based Explanations for Retrieval-Augmented LLM Systems

    May 11, 2026Joel Rorseth, Parke Godfrey, Lukasz Golab +2Retrieval-Augmented GenerationLanguage Model Safety Evaluation

  6. Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks

    May 11, 2026Regina Gugg, Selina Niederländer, Andreas Stöckl +1Language Model Safety EvaluationLanguage Model Bias Evaluation

  7. Acceptance Cards:A Four-Diagnostic Standard for Safe Fine-Tuning Defense Claims

    May 11, 2026Phongsakon Mark Konrad, Toygar Tanyel, Serkan AyvazFine-TuningLanguage Model Safety Evaluation

  8. FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments

    May 10, 2026Astha Mehta, Niruthiha Selvanayagam, Cedric Lam +10LLM Safety BenchmarksLanguage Model Safety Evaluation

  9. Do Linear Probes Generalize Better in Persona Coordinates?

    May 10, 2026Prasad Mahadik, Adrians SkaparsLanguage Model Safety EvaluationDeception in Language Models

  10. MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks

    May 10, 2026Xinkai Zhang, Zhipeng Wei, Huanli Gong +4Language Model Safety EvaluationJailbreak Attacks

  11. The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring

    May 9, 2026Ismail Hossain, Tanzim Ahad, Md Jahangir Alam +3Adversarial Prompt GenerationLanguage Model Safety Evaluation

  12. Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success

    May 9, 2026Carsten Maple, Abhishek Kumar, Riya TapwalLanguage Model Safety EvaluationJailbreak Attacks

  13. The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play

    May 8, 2026Gabriele La Malfa, Emanuele La Malfa, Saar Cohen +4Self-Play RLLanguage Model Safety Evaluation

  14. A Systematic Investigation of RL-Jailbreaking in LLMs

    May 7, 2026Montaser Mohammedalamen, Kevin Roice, Reginald McLean +1Language Model Safety EvaluationAdversarial Attacks on LLMs

  15. When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels

    May 7, 2026Sushant Gautam, Finn Schwall, Annika Willoch Olstad +6LLM Safety BenchmarksLLM Evaluation

  16. Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance

    May 7, 2026Jan Fillies, Ronald E. Robertson, Jeffrey HancockLanguage Model Safety EvaluationAdversarial Text Attacks

  17. How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation

    May 7, 2026Shai Feldman, Yaniv RomanoLLM EvaluationLanguage Model Safety Evaluation

  18. Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models

    May 7, 2026Haoxiang Wang, Da Yu, Huishuai ZhangLLM EvaluationLanguage Model Generation Evaluation

  19. Evaluation Awareness in Language Models Has Limited Effect on Behaviour

    May 7, 2026Amelie Knecht, Lucas Florin, Thilo HagendorffLLM AlignmentLanguage Model Safety Evaluation

  20. One Turn Too Late: Learning When to Intervene Against Multi-Turn Malicious Intent

    May 7, 2026Xinjie Shen, Rongzhe Wei, Peizhi Niu +6Language Model Safety EvaluationLLM Guardrails

  21. The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models

    May 6, 2026Alif Al Hasan, Sumon BiswasLLM Safety BenchmarksLanguage Model Safety Evaluation

  22. SoK: Robustness in Large Language Models against Jailbreak Attacks

    May 6, 2026Feiyue Xu, Hongsheng Hu, Chaoxiang He +9Language Model Safety EvaluationLLM Security

  23. Misaligned by Reward: Socially Undesirable Preferences in LLMs

    May 6, 2026Gayane Ghazaryan, Esra DönmezReward ModelingLanguage Model Safety Evaluation

  24. MOSAIC-Bench: Measuring Compositional Vulnerability Induction in Coding Agents

    May 5, 2026Jonathan Steinberg, Oren GalLanguage Model Safety EvaluationAI Coding Agents