LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning

    Jun 24, 2026Poojitha Thota, Shirin NilizadehLLM AuditingLLM Fine-Tuning

  2. Revealing Training Data Exposure in Vision Language Large Models via Parameter Gradients

    Jun 23, 2026Zhihao Zhu, Hongyi Tang, Yi Yang +1LLM Auditing

  3. To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias

    Jun 23, 2026Federico Marcuzzi, Xuefei Ning, Roy Schwartz +1Pairwise ComparisonLLM Auditing

  4. Natural Identifiers for Privacy and Data Audits in Large Language Models

    Jun 23, 2026Lorenzo Rossi, Bartłomiej Marek, Franziska Boenisch +1Privacy AuditingLLM Auditing

  5. Probing the Misaligned Thinking Process of Language Models

    Jun 23, 2026Kaiwen Zhou, Constantin Venhoff, Jonathan Michala +2LLM AlignmentLLM Auditing

  6. Quantifying the Agreement Between Data-Influence and Data-Similarity to Understand LLM Behavior

    Jun 22, 2026Christopher J. Anders, Henrique Da Silva Gameiro, Nico Daheim +1LLM AuditingLLM Interpretability

  7. ReasoningLens: Hierarchical Visualization and Diagnostic Auditing for Large Reasoning Models

    Jun 22, 2026Jun Zhang, Jiasheng Zheng, Boxi Cao +5LLM AuditingLLM Interpretability

  8. Who Owns the AI Recommendation? A Multi-Industry Empirical Map of Brand Category Ownership Across Large Language Models

    Jun 22, 2026Dmitrij ŻatuchinLLM EvaluationLLM Auditing

  9. Decodable but Not Faithful: Coupling Natural-Language Rationales to Programmatic Verifiers

    Jun 19, 2026Vatsal Ananthula, Adarsh KumarappanFaithfulness of Language Model ExplanationsLLM Auditing

  10. Reference-Based Distillation Detection in LLMs

    Jun 19, 2026Rajat Rawat, Sizhe Chen, Akshay Anand +3LLM AuditingTeacher-Student Learning

  11. EvidenceLens: A Claim-Evidence Matrix for Auditing Financial Question Answering

    Jun 19, 2026Fengchen Gu, Xiaotian Ren, Zhengyong Jiang +6Data VisualizationLLM Answer Verification

  12. A Multi-Agent Audit Framework for High-Stakes Reasoning: Evaluation and Interpretability in Clinical Mental Health Screening

    Jun 19, 2026Jingchen Ye, Yanpei Yu, Luyao ZhangLLM AuditingLLM Interpretability

  13. AURA: Adaptive Uncertainty-aware Refinement for LLM-as-a-Judge Auditing

    Jun 18, 2026Zilong Zhang, Yi-Ting Hung, Weiyi He +3LLM-as-a-JudgeLLM Auditing

  14. Quantifying and Auditing LLM Evaluation via Positive--Unlabeled Learning

    Jun 17, 2026Zilong Zhang, Yi-Ting Hung, Lei Ding +1Inverse Optimal TransportLLM-as-a-Judge

  15. PreUnlearn: Auditing Collateral Knowledge Damage Before Large Language Model Unlearning

    Jun 16, 2026Bo Su, Ankit Shah, Thai LeLLM AuditingMachine Unlearning

  16. Security and Privacy Prompts in the Wild: What Users Ask LLMs and How LLMs Respond

    Jun 16, 2026Hobin Kim, Xiaoyuan Wu, Omer Akgul +2LLM AuditingLLM Reliability

  17. Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing

    Jun 16, 2026Kexin Chen, Yi Liu, Haonan Zhang +3LLM AuditingLLM Interpretability

  18. CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models

    Jun 16, 2026Jeffrey G. Wang, Jason Wang, Marvin Li +1LLM EvaluationMembership Inference Attacks

  19. MIRAGE: Auditing Anti-Muslim Bias in Frontier LLMs Across Reasoning, Agentic, and Time-Coupled Conditions

    Jun 15, 2026Noor Islam S. Mohammad, Tamim SheikhLLM Safety BenchmarksLLM Auditing

  20. DoubtProbe: Black-Box Jailbreak Defense via Structural Verification and Semantic Auditing

    Jun 15, 2026Xuanyu Yin, Yilin Jiang, Jun Zhou +3LLM AuditingLLM Jailbreak Attacks

  21. Whose hotel does the AI recommend? An algorithm audit of reputation signals in LLM-assisted hotel selection

    Jun 15, 2026Mirza Samad Ahmed Baig, Syeda Anshrah Gillani, Asher AliLLM AuditingRecommender Systems

  22. AuAu: A Benchmark for Auditing Authoritarian Alignment in Large Language Models

    Jun 15, 2026Andreas Einwiller, Max Klabunde, Florian LemmerichLanguage Model Safety EvaluationLLM Auditing

  23. Frame-Conditioned Moral Computation in LLaMA 3.1-8B-Instruct: A Mechanistic Interpretability Audit of Ethical Reasoning

    Jun 13, 2026Ali Dasdan, Manan Shah, W. Russell Neuman +3LLM AlignmentMoral Reasoning in Language Models

  24. Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation

    Jun 12, 2026Arnesh Banerjee, Ayushi BhattacharjeeMathematical Reasoning BenchmarksLLM Auditing