LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. Distillation for Incrimination and Distillation for Capabilities

    Oct 7, 2026Sebastian Prasanna, Jacqueline Tay, Alek WestoverLLM Safety AlignmentLanguage Model Distillation

  2. Reasoning-Token Spikes Under Prompted Untruthful Responding in Large Language Models

    Oct 7, 2026Maverick Morales, Tomáš Dominik, Vermut Gao +4Deception in Language ModelsLLM Auditing

  3. Robust Decentralized Fairness Auditing

    Oct 7, 2026Sayan Biswas, Jade Garcia Bourrée, Anne-Marie Kermarrec +2Algorithmic AuditingLLM Auditing

  4. Harmful SFT Leaves a Continuous Trace in LLM Checkpoint Updates

    Oct 5, 2026Ziqun Bao, Xinyu Zhang, Yuchen Shao +1LLM AuditingLLM Safety

  5. Weight Oracles: Reading Neural Network Weights with Language Models

    Oct 5, 2026Krishna Kabra, Constantin Venhoff, Christian Schroeder de WittLLM AuditingBackdoor Detection

  6. Correct Verdicts, Flawed Reasoning: Structured Auditing of LLM-based Vulnerability Reasoning

    Oct 5, 2026Boyue Caroline Hu, Kaivalya Ahir, Ronghao Ni +1LLM AuditingSoftware Vulnerability Detection

  7. Detecting Inconsistencies in Model Specifications with LLM-as-Verifier Reasoning

    Oct 1, 2026Zichen Xie, Mrigank Pawagi, Lize Shao +2LLM AlignmentLLM Auditing

  8. Do MLLM Judges Judge the Edit? Auditing Bias in Image Editing Evaluation with Verified Quality Preservation

    Oct 1, 2026Yuan Huang, Zirui Song, Xiuying ChenVLM RobustnessLLM-as-a-Judge

  9. Can LLMs Reliably Annotate Bioassay Metadata to Improve Data Readiness?

    Oct 1, 2026Laura van Weesep, Riccardo Tedoldi, Jens Sjölund +6LLM AuditingLLM-Assisted Annotation

  10. How the Audit Rule Shapes Faithful Factor Explanations in LLMs

    Oct 1, 2026Taolin Zhang, Hanyu Wang, Jiuheng Wan +2Counterfactual ExplanationsFaithfulness of Language Model Explanations

  11. OpenMTB-Audit: Exposing Over-Refusal and Clinical Expert Perspectives in LLM-Based Molecular Tumor Board Safety Evaluation

    Oct 1, 2026Negin Ashrafi, Jia Luo, Stacey M. Frumm +1LLM Safety BenchmarksLLM Auditing

  12. FAER: Auditable Utility-Aligned Trajectory Replay for Language Model Post-Training

    Sep 30, 2026Miaobo Hu, Shuhao Hu, Xiaobo Guo +5LLM AuditingLanguage Model Post-Training

  13. Evaluating Whether GPT-6 Astra Performs Unsanctioned Supply-Chain Attacks

    Sep 29, 2026Alexandra Souly, Kai Fronsdal, Abby D'Cruz +2LLM AuditingAI Agent Security

  14. Gender bias across LLMs is common and highly heterogeneous

    Sep 29, 2026Edoardo Bolzoni, Valerio CapraroGender Bias in Language ModelsLLM Auditing

  15. CompOrca: Corpus-Scale Compliance Labelling of Instruction-Tuning Data

    Sep 29, 2026Philipp E. Glass, Alina MironLLM AuditingInstruction Tuning

  16. Selecting The Most Informative Tokens in Natural Language Autoencoders

    Sep 29, 2026Federico Torrielli, Gianluca Barmina, Andrea Blasi Núñez +4LLM AuditingAutoencoders

  17. LLMs Learn to Evade Latent Monitors from Prior Feedback Alone

    Sep 29, 2026Hugo Lyons Keenan, Christopher Leckie, Sarah ErfaniLLM AuditingAdversarial Attacks on LLMs

  18. Training LLMs to Verbalize Evaluation Awareness

    Sep 28, 2026Usman Anwar, Sahar Abdelnabi, David KruegerLLM AuditingEvaluation Awareness in Language Models

  19. "Nothing to See Here'': Unintended Disclosure through Revision Traces of LLM Deliverables

    Sep 28, 2026Yage Zhang, Yukun Jiang, Yang ZhangPrivacy-Preserving Language ModelsLLM Auditing

  20. Narrowing the Horizon: Quantifying Topic Saliency Shifts in Generative Monoculture

    Sep 28, 2026Oriane Peter, Elena Simperl, Kate DevlinLLM Auditing

  21. Measuring Collapse and Correction in Homogeneous-Panel LLM Debate

    Sep 28, 2026Xin Li, Mengbing Liu, Chau YuenLLM EvaluationLLM Auditing

  22. Echoes of Deeds: Moral History Can Shape and Steer LLM Behavioral Choices

    Sep 28, 2026Lucio La Cava, Andrea TagarelliMoral Reasoning in Language ModelsLLM Auditing

  23. A Persistent State for Auditable Mixture-of-Experts Routing

    Sep 28, 2026Abdurrahman Javat, Allan KazakovLLM AuditingState Tracking