LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops

    Jun 12, 2026Muhammad Osama, Maheera Amjad, Zartasha Mustansar +2Multi-Agent LLM SystemsLLM Hallucination Mitigation

  2. MÖVE: A Holistic LLM Benchmark for the German Public Sector

    Jun 11, 2026Camilla Dalerci, Thilo Michael, Robin Schaefer +1Multilingual Language Model EvaluationLLM Evaluation

  3. Detecting Functional Memorization in Code Language Models

    Jun 11, 2026Matthieu Meeus, Anil Ramakrishna, Matthew Grange +2Memorization in Language ModelsLLM Auditing

  4. Prefill Awareness in Large Language Models

    Jun 10, 2026Andy Wang, Parv Mahajan, David Demitri Africa +3Language Model Safety EvaluationLLM Auditing

  5. PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections

    Jun 10, 2026Pengfei He, Lesly Miculicich, Vishesh Sharma +5AI Agent AuditingLLM Auditing

  6. Which Models Are Our Models Built On? Auditing Invisible Dependencies in Modern LLMs

    Jun 10, 2026Sanjay Adhikesaven, Haoxiang Sun, Sewon MinLLM Auditing

  7. CANONIC: Governance Is Compilation

    Jun 10, 2026Dexter HadleyData ProvenanceLLM Auditing

  8. The Shibboleth Effect: Auditing the Cross-Lingual Distributional Skew of Large Language Models

    Jun 9, 2026Hakan MehmetcikMultilingual Language Model EvaluationLLM Auditing

  9. Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models

    Jun 9, 2026Prajakta Kini, Avinash Reddy, Souradip Chakraborty +4LLM AlignmentLanguage Model Safety Evaluation

  10. The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment

    Jun 9, 2026Filippo Tonini, Federico Torrielli, Anton Danholt Lautrup +3AI Agent AuditingLLM Auditing

  11. When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

    Jun 9, 2026Sai Kartheek Reddy Kasu, Nils Lukas, Samuele PoppiCoT FaithfulnessLLM Alignment

  12. From Observation to Intervention: A Causal Audit of Expert Importance in Mixture-of-Experts Models

    Jun 9, 2026Leonard Engmann, Christian Medeiros Adriano, Holger GieseMixture-of-Experts PruningLLM Auditing

  13. Advancing the State-of-the-Art in Empirical Privacy Auditing

    Jun 9, 2026Nicole Mitchell, Galen Andrew, Arun Ganesh +2Data LeakagePrivacy Auditing

  14. Deterministic Integrity Gates for LLM-Assisted Clinical Manuscript Preparation: An Auditable Biomedical Informatics Architecture

    Jun 8, 2026Yoojin Nam, Jinhoon Jeong, Namkug KimLLM Answer VerificationLLM Auditing

  15. Benchmarking Empirical Privacy Protection for Adaptations of Large Language Models

    Jun 8, 2026Bartłomiej Marek, Lorenzo Rossi, Vincent Hanke +4Privacy-Preserving Language ModelsMembership Inference Attacks

  16. Auditable Graph-Guided Root Cause Analysis for Kubernetes Incidents

    Jun 7, 2026Anastasiia Kuvshinova, Seungmin JinLLM AuditingGraph Reasoning

  17. Testing the Black Box: Structural Barriers to Independent Evaluation of Consumer-Facing Health LLMs

    Jun 7, 2026Rahul Gorijavolu, Kaushik Madapati, Pritika Vig +7LLM EvaluationLLM Sycophancy

  18. Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard

    Jun 7, 2026Alireza Arbabi, Florian KerschbaumLLM AlignmentLLM Auditing

  19. AeroSpectra Sentinel: An Auditable LLM Prompt-Chaining Decision-Support Workflow for Acute Asthma Risk Assessment from Respiratory Sounds and Clinical Signals

    Jun 6, 2026Aueaphum AueawatthanaphisutLLM AuditingClinical Decision Support

  20. When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

    Jun 6, 2026Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang +1Language Model Safety EvaluationLLM Auditing

  21. MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models

    Jun 6, 2026Kaixin Lan, Mu You, Tao Fang +3Membership Inference AttacksLLM Auditing

  22. Auditing Training Data in Domain-adapted LLMs: LoRA-MINT

    Jun 5, 2026Gonzalo Mancera, Daniel DeAlcala, Aythami Morales +3Membership Inference AttacksLLM Auditing

  23. The Geography of Algorithmic Judgment: LLM Intermediaries, Place Identity, and Racial Steering in Housing Search

    Jun 4, 2026Hana Samad, Trung Lam, Christoph Mügge-Durum +1LLM AuditingSocial Bias in Language Models

  24. Revising Context, Shifting Simulated Stance: Auditing LLM-Based Stance Simulation in Online Discussions

    Jun 4, 2026Xinnong Zhang, Wanting Shan, Hanjia Lyu +2Counterfactual EvaluationLLM Auditing

  25. LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs

    Jun 4, 2026Gianluca Barmina, Peter Schneider-Kamp, Lukas Galke PoechData LeakageMemorization in Language Models

  26. CogManip: Benchmarking Manipulative Behavior in Multi-Turn Interactions with Large Language Model

    Jun 4, 2026Zeyang Yue, Chenfei Yan, Feifei Zhao +5Language Model Safety EvaluationLLM Auditing

  27. How Far Did They Go? The Persuasive Tactics of Covert LLM Agents in a Discontinued Field Experiment

    Jun 3, 2026Kokil Jaidka, Saifuddin AhmedLLM AuditingLLM Agent Evaluation