LLM Safety Evaluation

LLM: Large Language Model

Momentum

16 papers in the last four weeks, level with the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 178

All topics
CardsList
  1. Scaling Trends for Lie Detector Oversight in Preference Learning

    Jul 2, 2026Oskar J. Hollinsworth, Ann-Kathrin Dombrowski, Sam Adam-Day +2Scalable OversightDeception in Language Models

  2. Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine

    Jul 1, 2026Jiaxian Lv, Shiyao Cui, Yingkang Wang +3Toxicity DetectionSafety Filtering

  3. EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures

    Jun 29, 2026Buğra Alperen Uluırmak, Rifat KurbanAI AlignmentLLM Safety Alignment

  4. SCARCE: Scalable Cascade Analysis for Rare-event Characterisation via Embeddings

    Jun 28, 2026Yingjie Wang, Yi Dong, Edmund Lau +3LLM Safety EvaluationRare-Event Estimation

  5. Paved with True Intents: Intent-Aware Training Improves LLM Safety Classification Across Training Regimes

    Jun 25, 2026Jeremias Ferrao, Niclas Müller-Hof, Iustin Sîrbu +2LLM Safety EvaluationLLM Post-Training

  6. RAS: Measuring LLM Safety Through Refusal Alignment

    Jun 24, 2026Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu +1LLM Safety AlignmentLLM Safety

  7. A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

    Jun 24, 2026Abrar Alotaibi, Raed Mughus, Moataz AhmedMultilingual Language Model EvaluationLLM Evaluation

  8. Do Thinking Tokens Help with Safety?

    Jun 23, 2026Narutatsu Ri, Abhishek Panigrahi, Sanjeev AroraLLM Refusal BehaviorLLM Safety Evaluation

  9. Distributed Quality-Diversity Search for Toxicity in Large Language Models

    Jun 23, 2026Onkar Shelar, Travis DesellAdversarial Prompt GenerationLLM Red Teaming

  10. FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming

    Jun 18, 2026Chaeyun Kim, Daeyoung Park, Junghwan Kim +4LLM Safety BenchmarksFinancial Services

  11. Analyzing the Narration Gap in LLM-Solver Loops

    Jun 17, 2026Zunchen Huang, Songgaojun DengAdversarial Attacks on LLMsFormal Verification

  12. SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

    Jun 17, 2026Linghao Feng, Yinqian Sun, Dongqi Liang +8LLM Safety BenchmarksAI for Science

  13. Automated jailbreak attack targeting multiple defense strategies

    Jun 15, 2026Qi Wang, Chengcheng Wan, Weijia He +4Adversarial Prompt GenerationLLM Jailbreak Attacks

  14. Risk-Aware LLM Agents for Geospatial Data Retrieval: Design and Preliminary Adversarial Evaluation

    Jun 13, 2026Kyle Gao, Joel Cumming, Jonathan Li +2Multi-Agent LLM SystemsLLM Tool Use

  15. BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

    Jun 12, 2026Leonhard Waibl, Felix Michalak, Hadrien MariacciaLLM Safety BenchmarksLLM Guardrails

  16. Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models

    Jun 9, 2026Malikeh Ehghaghi, Boglárka Ecsedi, Marsha Chechik +1LLM AlignmentNeural Network Robustness

  17. Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges

    Jun 8, 2026Yongtaek Lim, Hyeji Choi, Minwoo KimLLM-as-a-JudgeLLM Safety Evaluation

  18. Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs

    Jun 8, 2026Yanyan Luo, Xue Han, Ruiqiao Bai +10LLM PersonalizationLLM Safety

  19. SafeRun: Enabling Determinism in LLM Planning for Running

    Jun 8, 2026Meilin Chen, Zepeng Zhai, Jiaxuan Zhao +1LLM PlanningLLM Safety Evaluation

  20. Sycophancy Towards Researchers Drives Performative Misalignment

    Jun 7, 2026David D. Baek, Xinnuo Li, Anay Gupta +4LLM SycophancyLLM Alignment

  21. Building Comparative Motivation Profiles with Instrumental Interventions

    Jun 6, 2026David Vella Zarb, Rustem Turtayev, Taywon Min +2LLM Safety EvaluationCausal Interventions in Language Models

  22. SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents

    Jun 6, 2026Tanush Swaminathan, Runmin Jiang, Letian Zhang +1AI Agents for Scientific DiscoveryLLM Safety Evaluation

  23. The Governance of Human-LLM Interaction: Safety Gating, Civility Steering, and Affective Default Lock-In

    Jun 6, 2026Manuele Reani, Hongjian Zhang, Hongyu TianLanguage Model SteeringLLM Safety Evaluation