LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. Thinking Through Signs: PEEL as a Semiotic Scaffolding for Epistemically Accountable AI-Enabled Research

    Jun 2, 2026Clarisse de Souza, Gabriel Barbosa, Simone Diniz Junqueira Barbosa +3LLM EvaluationAI Accountability

  2. Covert Influence Between Language Models

    Jun 2, 2026Avidan Shah, Jay Chooi, Jinghua Ou +1LLM Auditing

  3. FLIPS: Instance-Fingerprinting for LLMs via Pseudo-random Sequences

    Jun 2, 2026Gurvan Richardeau, Gohar Dashyan, Erwan Le Merrer +1LLM AuditingLanguage Model Fingerprinting

  4. The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection

    Jun 2, 2026Wojciech Zarzecki, Jan Dubiński, Sebastian CygertBenchmark AuditingLLM Auditing

  5. Decoupled Smart Contract Audits: Lightweight LLM Framework via Distillation and Aggregation

    Jun 2, 2026Bagus Rakadyanto Oktavianto Putra, Muhamad Risqi Utama Saputra, Widyawan +1LLM AuditingSoftware Vulnerability Detection

  6. A Practice Auditing Framework for Large Language Model Use: Collective Empiricism, Pseudo-Rational Cognition, and Governance of AI-Generated Content

    Jun 2, 2026Yang Zhao, Yingshuo Li, Zeyu ZhangLLM AuditingAI Governance

  7. The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing

    Jun 1, 2026Michał Brzozowski, Neo Christopher ChungLLM AuditingHallucination in Language Models

  8. From Outliers to Errors: Auditing Pali-to-English LLM Translations with Multi-Reference Adjudication

    May 31, 2026Máté Metzger, Nadnapang Phophichit, Hansa DhammahasoLLM AuditingMachine Translation

  9. LLM-FACETS: A Privacy-Preserving Framework for Evaluating LLM Transparency and Accountability

    May 29, 2026Tom Lucas, Alessio Buscemi, Alfredo Capozucca +2LLM EvaluationAI Accountability

  10. Anchoring LLM Gender Bias to Human Baselines: A Cross-Lingual Audit

    May 29, 2026Jiwoo Choi, Seonwoo Ahn, Tongxin Zhang +1Gender Bias in Language ModelsMultilingual Language Model Evaluation

  11. PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges

    May 29, 2026Swastik Roy, Rajkumar Pujari, Tharindu Kumarage +5LLM-as-a-JudgeLLM Auditing

  12. CacheProbe: Auditing Prompt Cache Isolation in Gateway APIs

    May 28, 2026Ryan FaheyKV CachingLLM Auditing

  13. Auditing LLM Benchmarks with Item Response Theory

    May 28, 2026Sander Land, Daniel M. BikelBenchmark AuditingLLM Auditing

  14. LLMSurgeon: Diagnosing Data Mixture of Large Language Models

    May 28, 2026Yaxin Luo, Jiacheng Cui, Xiaohan Zhao +5LLM Auditing

  15. Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage

    May 28, 2026Shahinul Hoque, Jinghuai Zhang, Jinyuan Sun +1LLM AuditingBlack-Box Model Auditing

  16. NumLeak: Public Numeric Benchmarks as Latent Labels in Foundation Models

    May 28, 2026Anany KotawalaData LeakageLLM Evaluation

  17. Understanding Safety-Sensitive Expert Behavior in Mixture-of-Experts LLMs

    May 28, 2026Zhibo Zhang, Yuxi Li, Zhen Ouyang +2Mixture-of-Experts Language ModelsLLM Auditing

  18. KBF: Knowledge Boundary as Fingerprint for Language Model and Black-Box API Auditing

    May 28, 2026Yijia Fang, Yiqing Feng, Bingyu Li +1LLM AuditingLanguage Model Fingerprinting

  19. Inform, Coach, Relate, Listen: Auditing LLM Caregiving Support Roles

    May 28, 2026Drishti Goel, Agam Goyal, Veda Duddu +8HealthcareLLM Auditing

  20. When Models Disagree: Rethinking LLM Evaluation for Public Comment Analysis

    May 27, 2026Aisha Najera, Alvin Moon, Vedant Srinivasan +1LLM EvaluationAnnotator Disagreement