LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing

    Jul 22, 2026Yu Liu, Zhiwei Yang, Diandian Guo +7LLM AuditingMaterials Science

  2. Reference-Free Evaluation of Reasoning in Open-Ended Question Answering

    Jul 22, 2026Guneet Singh Kohli, Yuxiang Zhou, Michael Sejr Schlichtkrull +2LLM-as-a-JudgeReasoning Evaluation

  3. LLM Detection as an Intervention: Downstream Impact under Strategic User Behavior

    Jul 21, 2026Meena Jagadeesan, Tatsunori Hashimoto, Jon KleinbergAI-Generated Text DetectionLLM Auditing

  4. Semi-Automated Detection of Gaps in LLM Security Knowledge

    Jul 20, 2026Shufan Chai, Liangliang Sun, Jessica StaddonLLM AuditingLLMs for Cybersecurity

  5. PEARL: Auditable Repair for Scientific Reasoning Graph Extraction

    Jul 20, 2026Bohan Su, Pengze Li, Yuchen Lu +1LLM Reasoning with GraphsLLM Auditing

  6. Auditing Question-Order Effects in Large Language Models with the QQ Equality: Mechanism Characterization and a Saturation Caveat

    Jul 19, 2026Pilsung KangLLM Auditing

  7. Auditing Retrieval-Augmented LLM Hypotheses for Longitudinal Cell Painting Morphology

    Jul 17, 2026Gilchan Park, Guang Zhao, Byung-Jun Yoon +1Retrieval-Augmented GenerationLLM Auditing

  8. The Information Shadow: Measuring Structural Limits on What Language Models Can Learn

    Jul 17, 2026Priyansh Srivastava, Romit ChatterjeeLLM AuditingLLM Training

  9. Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

    Jul 15, 2026Joonyong Park, David M. Chan, Yuki Saito +1Audio-Language Model EvaluationLLM Auditing

  10. ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

    Jul 11, 2026Kefan Song, Yanjun QiAI Agent AuditingLLM Auditing

  11. One Token Is Enough: Fingerprinting and Verifying Large Language Models from Single-Token Output Distributions

    Jul 11, 2026Tomas BrucknerLLM Answer VerificationLLM Auditing

  12. Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness

    Jul 11, 2026Hong-In Won, Jinseok Jang, Hyoseop KimLLM EvaluationMoral Reasoning in Language Models

  13. Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents

    Jul 10, 2026Izumi Takahara, Teruyasu MizoguchiAI Agents for Scientific DiscoveryLLM Auditing

  14. When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability

    Jul 9, 2026Zongyou Yang, Yinghan Hou, Xiaokun YangLLM-as-a-JudgeLLM Auditing

  15. Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA

    Jul 9, 2026Samuel Tetteh, Udip Shrestha, Joshua R. Waite +1LLM AuditingLLM Safety

  16. Alignment Plausibility: A New Standard for Assuring AI in Healthcare

    Jul 8, 2026Gwydion Williams, Sara Zannone, Bilal A MateenLLM AlignmentHealthcare

  17. Online Data Selection Is Implicit Alignment

    Jul 8, 2026Aoxiong Zeng, Yuxin Yang, Xiangquan YangSupervised Fine-TuningLLM Alignment

  18. Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation

    Jul 7, 2026Niels Potters, Theo HofmanLLM EvaluationLLM Auditing