LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science

    Jul 24, 2026Davide Scarso, Hugo Noronha de Almeida, Joaquim PinaLLM EvaluationLLM Auditing

  2. Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation

    Jul 24, 2026Yunting Song, Matthew Watson, Peter Grabowski +1LLM Safety BenchmarksLLM Auditing

  3. Every Model Cheats: Prompt-Level Mitigation of Cheating on Offensive Cyber Tasks

    Jul 23, 2026Michael Kouremetis, Ads Dawson, Raja Sekhar Rao Dheekonda +1LLM AuditingDeception in Language Models

  4. Code Monitor Red Teaming for Public-Test-Passing Code

    Jul 23, 2026Junchi Liao, Jiawen Deng, Fuji RenLLM AuditingCode Generation Evaluation

  5. Auditing Evidence Use in Medical LLM Diagnosis

    Jul 23, 2026Junchi Liao, Jiawen Deng, Fuji RenLLM AuditingMedical Diagnosis

  6. MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing

    Jul 22, 2026Yu Liu, Zhiwei Yang, Diandian Guo +7LLM AuditingMaterials Science

  7. Reference-Free Evaluation of Reasoning in Open-Ended Question Answering

    Jul 22, 2026Guneet Singh Kohli, Yuxiang Zhou, Michael Sejr Schlichtkrull +2LLM-as-a-JudgeReasoning Evaluation

  8. LLM Detection as an Intervention: Downstream Impact under Strategic User Behavior

    Jul 21, 2026Meena Jagadeesan, Tatsunori Hashimoto, Jon KleinbergAI-Generated Text DetectionLLM Auditing

  9. Semi-Automated Detection of Gaps in LLM Security Knowledge

    Jul 20, 2026Shufan Chai, Liangliang Sun, Jessica StaddonLLM AuditingLLMs for Cybersecurity

  10. PEARL: Auditable Repair for Scientific Reasoning Graph Extraction

    Jul 20, 2026Bohan Su, Pengze Li, Yuchen Lu +1LLM Reasoning with GraphsLLM Auditing

  11. Auditing Question-Order Effects in Large Language Models with the QQ Equality: Mechanism Characterization and a Saturation Caveat

    Jul 19, 2026Pilsung KangLLM Auditing

  12. Auditing Retrieval-Augmented LLM Hypotheses for Longitudinal Cell Painting Morphology

    Jul 17, 2026Gilchan Park, Guang Zhao, Byung-Jun Yoon +1Retrieval-Augmented GenerationLLM Auditing

  13. The Information Shadow: Measuring Structural Limits on What Language Models Can Learn

    Jul 17, 2026Priyansh Srivastava, Romit ChatterjeeLLM AuditingLLM Training

  14. Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

    Jul 15, 2026Joonyong Park, David M. Chan, Yuki Saito +1Audio-Language Model EvaluationLLM Auditing

  15. ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

    Jul 11, 2026Kefan Song, Yanjun QiAI Agent AuditingLLM Auditing

  16. One Token Is Enough: Fingerprinting and Verifying Large Language Models from Single-Token Output Distributions

    Jul 11, 2026Tomas BrucknerLLM Answer VerificationLLM Auditing

  17. Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness

    Jul 11, 2026Hong-In Won, Jinseok Jang, Hyoseop KimLLM EvaluationMoral Reasoning in Language Models

  18. Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents

    Jul 10, 2026Izumi Takahara, Teruyasu MizoguchiAI Agents for Scientific DiscoveryLLM Auditing

  19. When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability

    Jul 9, 2026Zongyou Yang, Yinghan Hou, Xiaokun YangLLM-as-a-JudgeLLM Auditing

  20. Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA

    Jul 9, 2026Samuel Tetteh, Udip Shrestha, Joshua R. Waite +1LLM AuditingLLM Safety