LLM Safety Evaluation

LLM: Large Language Model

Momentum

16 papers in the last four weeks, level with the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 177

All topics
CardsList
  1. Dynamic Budget Allocation for LLM Evaluation under Hard Resource Constraints

    Oct 5, 2026Shai Feldman, Yaniv RomanoLLM EvaluationLLM Safety Evaluation

  2. Refusals That Bend: Measuring and Predicting Task Malleability in Embodied VLM Planners

    Sep 30, 2026Leo Y. Lin, Mikhail Kuznetsov, Muslum Ozgur Ozmen +1Robot SafetyLLM Safety Evaluation

  3. Evaluating Whether GPT-6 Astra Performs Unsanctioned Supply-Chain Attacks

    Sep 29, 2026Alexandra Souly, Kai Fronsdal, Abby D'Cruz +2LLM AuditingAI Agent Security

  4. ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts

    Sep 24, 2026Firoj Alam, Md. Rafiul Biswas, Mohamed Bayan Kmainasi +5LLM Safety BenchmarksArabic NLP

  5. From Intent to Action: Benchmarking LLM Safety in Vehicle Voice Command Authorization

    Sep 17, 2026Diba Afroze, Xingli Zhang, Yazhou Tu +1LLM Safety BenchmarksLLM Safety Evaluation

  6. Divide, Consult, Conquer: Capability Laundering Through Aligned LLMs

    Sep 14, 2026Mark Russinovich, Blake Bullwinkel, Giorgio Severi +2Adversarial Attacks on LLMsCybersecurity

  7. DeFiFlowBench: Benchmarking and Improving Safe Executability in Natural-Language DeFi Workflow Synthesis

    Sep 11, 2026Abhinav Rajeev Kumar, Harshit Arora, Varun Singh +1LLM Safety BenchmarksLLM Guardrails

  8. CS-Guard: Benchmarking LLM Guardrails for Code Generation Security

    Sep 9, 2026Jinyang Li, Mingyu Guo, Hung X. NguyenLLM GuardrailsAdversarial Attacks on LLMs

  9. SAFIRE: Safety-Critical Benchmark for Fine-grained Fire and Smoke Understanding in Multimodal LLMs

    Sep 7, 2026Pengfei Li, Naufal Suryanto, Sicheng Zhang +2LLM Safety BenchmarksLLM Safety Evaluation

  10. Probing the Structure and Dynamics of LLM Value Expression through Value Conflicts

    Sep 7, 2026Kaicheng Zhang, Jingyi Xiao, Renjun Hu +3LLM AlignmentLLM Safety Evaluation

  11. FLY-EVAL++: An Evidence-Driven Evaluation Protocol for Safety-Constrained Flight Prediction with Large Language Models

    Sep 3, 2026Yalun Wu, Junfeng Fang, Jiawei Wang +6LLM Safety BenchmarksLLM Safety Evaluation

  12. Before the Script, Set the Stage: How Worldview Simulation Amplifies Psychologically Grounded Persuasion in Multi-Turn Jailbreaking

    Sep 2, 2026Siyu Chen, Haoran Wang, Xiaojian Li +3Multi-Turn Jailbreak AttacksLLM Safety Evaluation

  13. ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models

    Sep 2, 2026Da Cheng Gu, Yifei Dong, Xinghao Yang +2LLM Jailbreak AttacksLLM Safety Evaluation

  14. SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group Dialogue

    Sep 1, 2026Stephanie Fong, Yiwen Jiang, Zimu Wang +12LLM Safety BenchmarksSocial Bias in Language Models

  15. The Safeguard Worked. Is the LLM System Safer?

    Sep 1, 2026Pingyu Wu, Weiming Zhang, Nenghai YuLLM GuardrailsLLM Safety

  16. Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

    Aug 27, 2026Benlei Cui, Shen Pang, Yuke Wang +7VLM RobustnessAdversarial Attacks on VLMs

  17. Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

    Aug 18, 2026Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon +2LLM GuardrailsAdversarial Attacks on LLMs

  18. TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

    Aug 16, 2026Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu +1Adversarial TrainingLLM Jailbreak Attacks

  19. Quantifying the Relationship Between Clinical Safety and Environmental Impact in Therapeutic LLMs

    Aug 12, 2026Alireza A. Safaei, Laura M. Vowels, Matthew J. Vowels +2Energy-Efficient MLLLM Safety Evaluation

  20. AI Guardrail Survival under Single-Cycle Agentic Self-Summarization

    Aug 11, 2026Ted Kwartler, Alan Aqrawi, Arian AbbasiLLM GuardrailsLLM Safety Evaluation

  21. REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

    Aug 11, 2026Zixing Chen, Xingyuan Liu, Jie Zhu +6LLM Red TeamingLLM Agents

  22. ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

    Aug 11, 2026Xinzhe Huang, Biwu Yao, Kedong Xiu +4LLM GuardrailsLanguage Model Calibration

  23. TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent

    Aug 10, 2026Waleed Jamil, Raphael SchmittLLM Safety BenchmarksLLM Safety Evaluation