LLM Safety Evaluation

LLM: Large Language Model

Momentum

16 papers in the last four weeks, level with the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 177

All topics
CardsList
  1. Generating Attacks for LLMs with GFlowNets

    Aug 10, 2026Berkay Ozcam, Irem Onen, Mehmet Fatih Amasyali +1Adversarial Prompt GenerationAdversarial Attacks on LLMs

  2. Measuring the Wrong Thing: Internal Harmfulness Scores Anti-Rank Successful Jailbreaks

    Aug 10, 2026Mingyu Luo, Ming Deng, Zilang Qiu +8Safety FilteringLLM Jailbreak Attacks

  3. Safety Cost of Steering Vectors Is Separable and Reducible

    Aug 9, 2026Yuxiao Li, Gjergji KasneciLanguage Model SteeringLLM Safety Alignment

  4. Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools

    Aug 7, 2026Afreen Alam, Evgenija Popchanovska, Ana Gjorgjevikj +4AI Risk ManagementLLM Security

  5. DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

    Aug 5, 2026Jared Moore, Andrea Mock, Yifan Mai +9LLM Safety BenchmarksLLM Safety

  6. EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers

    Aug 3, 2026Junyeong Park, Jieun Han, Haneul Yoo +3LLM Safety BenchmarksGenerative AI in Education

  7. A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models

    Aug 3, 2026Shu Quan, Tianfang Hao, Sitong Fang +8LLM Safety BenchmarksLLM Safety

  8. RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

    Jul 29, 2026Benyamin Tafreshian, Prathamesh DhakeAdversarial AttacksAdversarial Attacks on LLMs

  9. Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation

    Jul 23, 2026Linjun LiMulti-Agent LLM SystemsLLM Safety

  10. Stress Testing Concept Erasure with Large Language Model Agents

    Jul 20, 2026Yuyang Xue, Feng Chen, Zhihua Liu +4LLM Agent EvaluationLLM Safety Evaluation

  11. JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

    Jul 20, 2026Qingjia Huang, Jingyu Zhang, Jianguo Wu +6LLM Safety BenchmarksLLM Jailbreak Attacks

  12. Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

    Jul 15, 2026Jan Betley, Johannes Treutlein, Jan Dubiński +5LLM AlignmentLanguage Model Bias Evaluation

  13. AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

    Jul 13, 2026Yi Ting Shen, Kentaroh Toyoda, Alex LeungLLM Safety BenchmarksAdversarial Attacks on LLMs

  14. ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

    Jul 11, 2026Kefan Song, Yanjun QiAI Agent AuditingLLM Auditing

  15. Operational Reframing and Approval-Framed Delegation in Multi-Agent LLM Safety

    Jul 8, 2026Lifei Liu, Haoran Yu, Xiaochong Jiang +3Multi-Agent LLM SystemsLLM Safety Evaluation

  16. Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

    Jul 7, 2026Mingchen Li, Meikang Qiu, Zifan Peng +4Software Vulnerability DetectionLLMs for Cybersecurity

  17. Scaling Trends for Lie Detector Oversight in Preference Learning

    Jul 2, 2026Oskar J. Hollinsworth, Ann-Kathrin Dombrowski, Sam Adam-Day +2Scalable OversightDeception in Language Models