LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. CAPRI: Contract-Aware Proof Repair for Isabelle

    Aug 13, 2026Jim Woodcock, Gabriel Leite, Augusto Sampaio +1LLM AuditingInteractive Theorem Proving

  2. Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

    Aug 13, 2026Junhao Luo, Ning Huang, Ziqi Sha +2LLM EvaluationLLM Auditing

  3. Follow the Norm: Accounting for Fine-Tuning and Prompt Effects on Model Rationales

    Aug 13, 2026Long Hoang Nguyen, Brice Valentin Kok-Shun, Guangyu Du +1Moral Reasoning in Language ModelsNormative Conformity in Language Models

  4. Measure, Don't Optimize: Forecasting Recovery in LLM Unlearning

    Aug 11, 2026Zirui Song, Huaxing Liu, Xiang Wang +8LLM AuditingMachine Unlearning

  5. Most biomedical publications show signs of LLM-assisted writing

    Aug 11, 2026Lena Holzwarth, Rita González-Márquez, Dmitry KobakAI-Generated Text DetectionLLM Auditing

  6. Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

    Aug 11, 2026Qingjie Zhang, Xingzhang Ren, Zixuan Chen +6Language Model PretrainingLLM Auditing

  7. Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics

    Aug 11, 2026Qingjie Zhang, Ziqi Tang, Jie Zhang +7LLM AuditingData Contamination

  8. Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders

    Aug 8, 2026Chan Aristella Lu, Arya Fayyazi, Junhao Zhang +6LLM AuditingLanguage Model Bias Evaluation

  9. TokenPrint: A Calibrated Token-Space Fingerprint for Language-Model Provenance

    Aug 8, 2026Yuqi Wu, Shengming Zhao, Jie ChenLLM AuditingLanguage Model Fingerprinting

  10. Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation

    Aug 7, 2026Sahil Pardasani, Madhusudan SinghLLM EvaluationLLM-as-a-Judge

  11. A2EA^2E : An End-to-End Agent Auditing Engine

    Aug 7, 2026Haoning Wang, Mingxun Zhang, Chenyue Yu +4Tool-Use EvaluationAI Agent Auditing

  12. OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents

    Aug 6, 2026Xinying Cai, Minghao Guo, Jiahe Liu +7LLM AuditingLLM Agent Evaluation

  13. Poli-Bias: Understanding and Measuring Large Language Model Biases in International Political Conflicts

    Aug 6, 2026Massi-Nissa Abboud, Aladin Djuhera, Elena Cabrio +1LLM SycophancyLLM Auditing

  14. HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards

    Aug 6, 2026Zhuowen Liu, Bohan Cui, YinShang Guo +2Reward HackingLLM Auditing

  15. Runtime Observability for Heterogeneous Attention Memory

    Aug 6, 2026Fanzhe Wei, Li Liu, Ziyang Wang +1KV CachingLLM Auditing

  16. Subliminal Learning is Non-Semantic Distillation

    Aug 6, 2026Ethan Hadley, Eren GultepeLLM AuditingSubliminal Learning

  17. Item Response Theory for AI Safety

    Aug 5, 2026Joshua Fonseca Rivera, Neil Shah, David Demitri Africa +1LLM Safety BenchmarksLanguage Model Safety Evaluation

  18. SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

    Aug 5, 2026Zhixiang Liang, Yifei Liu, Yidan Huang +5Agent Failure AnalysisAI Agent Reliability

  19. Looking in the Mirror: Introspecting Side-Effect Misalignments Induced by Fine-Tuning

    Aug 5, 2026Kotaro Yoshida, Laura Gomezjurado Gonzalez, Yukinori Yamamoto +3LLM AuditingLanguage Model Introspection

  20. LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards

    Aug 4, 2026Zhinan Liu, Jie Li, Mingyu Kang +1LLM AuditingLLM Guardrails

  21. Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains

    Aug 4, 2026Yanchao Li, Wanhao Liu, Jiaqing Xie +4LLM EvaluationLLM Auditing

  22. Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores

    Aug 4, 2026Zeyu Zhang, Bradly C. StadieLLM EvaluationLLM Auditing

  23. Evading Chain-of-Thought Monitoring Through Model Poisoning

    Aug 3, 2026Giorgio Severi, Shujaat Mirza, Blake Bullwinkel +1LLM Backdoor AttacksLLM Auditing