LLM Safety Evaluation

LLM: Large Language Model

Momentum

16 papers in the last four weeks, up 14% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 175

All topics
CardsList
  1. Dynamic Budget Allocation for LLM Evaluation under Hard Resource Constraints

    Oct 5, 2026Shai Feldman, Yaniv RomanoLLM EvaluationLLM Safety Evaluation

  2. Refusals That Bend: Measuring and Predicting Task Malleability in Embodied VLM Planners

    Sep 30, 2026Leo Y. Lin, Mikhail Kuznetsov, Muslum Ozgur Ozmen +1Robot SafetyLLM Safety Evaluation

  3. Evaluating Whether GPT-6 Astra Performs Unsanctioned Supply-Chain Attacks

    Sep 29, 2026Alexandra Souly, Kai Fronsdal, Abby D'Cruz +2LLM AuditingAI Agent Security

  4. ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts

    Sep 24, 2026Firoj Alam, Md. Rafiul Biswas, Mohamed Bayan Kmainasi +5LLM Safety BenchmarksArabic NLP

  5. From Intent to Action: Benchmarking LLM Safety in Vehicle Voice Command Authorization

    Sep 17, 2026Diba Afroze, Xingli Zhang, Yazhou Tu +1LLM Safety BenchmarksLLM Safety Evaluation

  6. Divide, Consult, Conquer: Capability Laundering Through Aligned LLMs

    Sep 14, 2026Mark Russinovich, Blake Bullwinkel, Giorgio Severi +2Adversarial Attacks on LLMsCybersecurity

  7. DeFiFlowBench: Benchmarking and Improving Safe Executability in Natural-Language DeFi Workflow Synthesis

    Sep 11, 2026Abhinav Rajeev Kumar, Harshit Arora, Varun Singh +1LLM Safety BenchmarksLLM Guardrails

  8. CS-Guard: Benchmarking LLM Guardrails for Code Generation Security

    Sep 9, 2026Jinyang Li, Mingyu Guo, Hung X. NguyenLLM GuardrailsAdversarial Attacks on LLMs

  9. SAFIRE: Safety-Critical Benchmark for Fine-grained Fire and Smoke Understanding in Multimodal LLMs

    Sep 7, 2026Pengfei Li, Naufal Suryanto, Sicheng Zhang +2LLM Safety BenchmarksLLM Safety Evaluation

  10. Probing the Structure and Dynamics of LLM Value Expression through Value Conflicts

    Sep 7, 2026Kaicheng Zhang, Jingyi Xiao, Renjun Hu +3LLM AlignmentLLM Safety Evaluation

  11. FLY-EVAL++: An Evidence-Driven Evaluation Protocol for Safety-Constrained Flight Prediction with Large Language Models

    Sep 3, 2026Yalun Wu, Junfeng Fang, Jiawei Wang +6LLM Safety BenchmarksLLM Safety Evaluation

  12. SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group Dialogue

    Sep 1, 2026Stephanie Fong, Yiwen Jiang, Zimu Wang +12LLM Safety BenchmarksSocial Bias in Language Models

  13. The Safeguard Worked. Is the LLM System Safer?

    Sep 1, 2026Pingyu Wu, Weiming Zhang, Nenghai YuLLM GuardrailsLLM Safety

  14. Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

    Aug 27, 2026Benlei Cui, Shen Pang, Yuke Wang +7VLM RobustnessAdversarial Attacks on VLMs

  15. Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

    Aug 18, 2026Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon +2LLM GuardrailsAdversarial Attacks on LLMs

  16. TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

    Aug 16, 2026Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu +1Adversarial TrainingLLM Jailbreak Attacks

  17. Quantifying the Relationship Between Clinical Safety and Environmental Impact in Therapeutic LLMs

    Aug 12, 2026Alireza A. Safaei, Laura M. Vowels, Matthew J. Vowels +2Energy-Efficient MLLLM Safety Evaluation

  18. AI Guardrail Survival under Single-Cycle Agentic Self-Summarization

    Aug 11, 2026Ted Kwartler, Alan Aqrawi, Arian AbbasiLLM GuardrailsLLM Safety Evaluation

  19. REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

    Aug 11, 2026Zixing Chen, Xingyuan Liu, Jie Zhu +6LLM Red TeamingLLM Agents

  20. ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

    Aug 11, 2026Xinzhe Huang, Biwu Yao, Kedong Xiu +4LLM GuardrailsLanguage Model Calibration

  21. TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent

    Aug 10, 2026Waleed Jamil, Raphael SchmittLLM Safety BenchmarksLLM Safety Evaluation

  22. Generating Attacks for LLMs with GFlowNets

    Aug 10, 2026Berkay Ozcam, Irem Onen, Mehmet Fatih Amasyali +1Adversarial Prompt GenerationAdversarial Attacks on LLMs

  23. Measuring the Wrong Thing: Internal Harmfulness Scores Anti-Rank Successful Jailbreaks

    Aug 10, 2026Mingyu Luo, Ming Deng, Zilang Qiu +8Safety FilteringLLM Jailbreak Attacks

  24. Safety Cost of Steering Vectors Is Separable and Reducible

    Aug 9, 2026Yuxiao Li, Gjergji KasneciLanguage Model SteeringLLM Safety Alignment

  25. Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools

    Aug 7, 2026Afreen Alam, Evgenija Popchanovska, Ana Gjorgjevikj +4AI Risk ManagementLLM Security

  26. DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

    Aug 5, 2026Jared Moore, Andrea Mock, Yifan Mai +9LLM Safety BenchmarksLLM Safety

  27. EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers

    Aug 3, 2026Junyeong Park, Jieun Han, Haneul Yoo +3LLM Safety BenchmarksGenerative AI in Education

  28. A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models

    Aug 3, 2026Shu Quan, Tianfang Hao, Sitong Fang +8LLM Safety BenchmarksLLM Safety

  29. RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

    Jul 29, 2026Benyamin Tafreshian, Prathamesh DhakeAdversarial AttacksAdversarial Attacks on LLMs

  30. Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation

    Jul 23, 2026Linjun LiMulti-Agent LLM SystemsLLM Safety

  31. Stress Testing Concept Erasure with Large Language Model Agents

    Jul 20, 2026Yuyang Xue, Feng Chen, Zhihua Liu +4LLM Agent EvaluationLLM Safety Evaluation

  32. JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

    Jul 20, 2026Qingjia Huang, Jingyu Zhang, Jianguo Wu +6LLM Safety BenchmarksLLM Jailbreak Attacks

  33. Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

    Jul 15, 2026Jan Betley, Johannes Treutlein, Jan Dubiński +5LLM AlignmentLanguage Model Bias Evaluation

  34. AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

    Jul 13, 2026Yi Ting Shen, Kentaroh Toyoda, Alex LeungLLM Safety BenchmarksAdversarial Attacks on LLMs

  35. ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

    Jul 11, 2026Kefan Song, Yanjun QiAI Agent AuditingLLM Auditing

  36. Operational Reframing and Approval-Framed Delegation in Multi-Agent LLM Safety

    Jul 8, 2026Lifei Liu, Haoran Yu, Xiaochong Jiang +3Multi-Agent LLM SystemsLLM Safety Evaluation

  37. Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

    Jul 7, 2026Mingchen Li, Meikang Qiu, Zifan Peng +4Software Vulnerability DetectionLLMs for Cybersecurity

  38. Scaling Trends for Lie Detector Oversight in Preference Learning

    Jul 2, 2026Oskar J. Hollinsworth, Ann-Kathrin Dombrowski, Sam Adam-Day +2Scalable OversightDeception in Language Models

  39. Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine

    Jul 1, 2026Jiaxian Lv, Shiyao Cui, Yingkang Wang +3Toxicity DetectionSafety Filtering