LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks

    May 27, 2026Nishal Thomas, Noel ThomasMathematical Reasoning BenchmarksBenchmark Auditing

  2. Position: Retire the "Positive Backdoor" Label -- Secret Alignment Requires Strict and Systematic Evaluation

    May 27, 2026Jianwei Li, Jung-Eun KimLLM Backdoor AttacksLanguage Model Safety Evaluation

  3. Efficient and Scalable Provenance Tracking for LLM-Generated Code Snippets

    May 27, 2026Andrea Gurioli, Davide D'Ascenzo, Federico Pennino +2Data ProvenanceLLM Auditing

  4. SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models

    May 27, 2026Chao Ding, Mouxiao Bian, Tianbin Li +12HealthcareLLM Auditing

  5. Whose Name Comes Up? III: Persona Prompting Effects in LLM-Based Scholar Recommendation

    May 27, 2026Annabella Sánchez-Guzmán, Lukas Eberhard, Denis Helic +1LLM AuditingLLM Prompting

  6. MIRA: A Bilingual Benchmark for Medical Information Response Audit

    May 27, 2026Mengyu Xu, Qiaoxin Yang, Qianqian Wang +3Multilingual Language Model EvaluationHealthcare

  7. TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling

    May 26, 2026Jiaqian Li, Yanshu Li, Boxuan Zhang +2LLM AuditingLLM Agent Safety

  8. Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)

    May 26, 2026Samer Awad, Javier Conde, Carlos Arriaga +3LLM EvaluationLanguage Model Decoding

  9. ContextGuard: Structured Self-Auditing for Context Learning in Language Models

    May 26, 2026Hongbo Jin, Chi Wang, Haoran Tang +5LLM AuditingInstruction Following

  10. Vectors Are Not Neutral: Sensitive-Information Inference from Exported LLM Representations in Summarization

    May 26, 2026Weixin Liu, Bowen Qu, Juming Xiong +3LLM AuditingPrivacy Leakage in Language Models

  11. Detecting Unfaithful Chain-of-Thought via Circuit-Guided Internal-External Discrepancy

    May 25, 2026Xu Shen, Zhen Tan, Song Wang +4CoT FaithfulnessLLM Auditing

  12. AI Content Moderation in Therapy Conversations

    May 25, 2026Jiwon Kim, Claire Wang, Taeung Yoon +2LLM AuditingLLM Guardrails

  13. From Automation to Collaboration: Human-in-the-Loop Methods for Safe and Trustworthy NLP

    May 24, 2026Most. Sharmin Sultana Samu, MD. Tanvir Ahmed Seum, Md. Rakibul IslamLLM AuditingHuman-in-the-Loop Annotation

  14. RouteScan: A Non-Intrusive Approach to Auditing MoE LLMs Safety via Expert Routing Telemetry

    May 24, 2026Bo Lv, Zhiheng Xu, KeDong Xiu +4Mixture-of-Experts Language ModelsLLM Auditing

  15. Measuring the Depth of LLM Unlearning via Activation Patching

    May 23, 2026Jaeung Lee, Dohyun Kim, Jaemin JoLLM AuditingLLM Unlearning

  16. Unlocking Apple's Private Cloud Compute: An Analysis of Privacy-Preserving Artificial Intelligence

    May 22, 2026Yannik Dittmar, Marvin Jerome Stephan, Thomas Völkl +2Privacy AuditingPrivacy-Preserving Language Models

  17. How Well Do Models Follow Their Constitutions?

    May 22, 2026Arya Jakkli, Senthooran Rajamanoharan, Neel NandaLLM EvaluationLanguage Model Safety Evaluation

  18. PromptAudit: Auditing Prompt Sensitivity in LLM-Based Vulnerability Detection

    May 22, 2026Steffen J. Camarato, Yahya Hmaiti, Mandana Ghadamian +1Prompt SensitivityLLM Auditing

  19. TRACER: A Semantic-Aware Framework for Fine-Grained Contamination Detection in Code LLMs

    May 22, 2026Yifeng Di, Xuliang Huang, Tianyi ZhangLLM AuditingData Contamination in Language Models

  20. The Illusion of Reasoning: Exposing Evasive Data Contamination in LLMs via Zero-CoT Truncation

    May 21, 2026Yifan Lan, Yuanpu Cao, Hanyu Wang +2LLM EvaluationLLM Auditing

  21. How Far Will They Go? Red-Teaming Online Influence with Large Language Models

    May 20, 2026Daniel C. Ruiz, Anna Serbina, Ashwin Rao +2Language Model SteeringLLM Auditing

  22. What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema

    May 20, 2026Mahdi Naser Moghadasi, Faezeh GhaderiBenchmark AuditingLLM Auditing

  23. Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

    May 20, 2026Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat MasoodLanguage Model Safety EvaluationHealthcare

  24. The Evaluation Game: Beyond Static LLM Benchmarking

    May 19, 2026Paul Wang, Jade Garcia-Bourrée, Anne-Marie Kermarrec +1Adversarial TrainingLLM Auditing

  25. DECOR: Auditing LLM Deception via Information Manipulation Theory

    May 19, 2026Linyue Cai, Samuel Yeh, Jwala Dhamala +2Language Model Safety EvaluationLLM Auditing