LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. LLMSniffer: Detecting LLM-Generated Code via GraphCodeBERT and Supervised Contrastive Learning

    Apr 17, 2026Mahir Labib Dihan, Abir MuhtasimLLM Auditing

  2. What Does a Sharing Question Add? Auditing LLM Survey Scores for Misinformation

    Apr 8, 2026Zonghuan Xu, Xiang Zheng, Yutao Wu +1LLM EvaluationLLM Auditing

  3. Auditable Agents

    Apr 7, 2026Yi Nian, Aojie Yuan, Haiyue Zhang +7AI AccountabilityAI Agent Auditing

  4. Fine-Tuning Integrity for Modern Neural Networks: Structured Drift Proofs via Norm, Rank, and Sparsity Certificates

    Apr 6, 2026Zhenhang Shang, Yingzhe Yu, Kani ChenNeural Network VerificationLLM Auditing

  5. The Anatomy of Uncertainty in LLMs

    Mar 26, 2026Aditya Taparia, Ransalu Senanayake, Kowshik Thopalli +1LLM AuditingLLM Reliability

  6. MemGuard-Alpha: Limits of Membership Inference for Detecting and Filtering Memorization-Contaminated Signals in LLM-Based Financial Forecasting

    Mar 26, 2026Anisha Roy, Dip RoyMembership Inference AttacksLLM Auditing

  7. PopResume: Causal Fairness Evaluation of LLM/VLM Resume Screeners with Population-Representative Dataset

    Mar 24, 2026Sumin Yu, Juhyeon Park, Taesup MoonAI-Assisted Decision MakingLLM Auditing

  8. Detecting Data Poisoning in Code Generation LLMs via Black-Box, Vulnerability-Oriented Scanning

    Mar 17, 2026Shenao Yan, Shan Jin, Shimaa Ahmed +4LLM AuditingBackdoor Detection

  9. Real Money, Fake Models: Deceptive Model Claims in Shadow APIs

    Mar 2, 2026Yage Zhang, Yukun Jiang, Zeyuan Chen +3LLM AuditingBlack-Box Model Auditing

  10. Auditing Multi-Agent LLM Reasoning Trees Outperforms Majority Vote and LLM-as-Judge

    Feb 10, 2026Wei Yang, Shixuan Li, Heng Ping +3LLM AuditingPreference Optimization

  11. Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models

    Feb 3, 2026Anish Sathyanarayanan, Aditya Nagarsekar, Aarush RathoreCoT FaithfulnessFaithfulness of Language Model Explanations

  12. Verifiable Manifest Signing and Transparency Enforcement for Secure MCP-Based LLM Pipelines

    Jan 30, 2026Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel +2LLM AuditingMCP Security

  13. Unknown Unknowns: Do Hidden Intentions in LLMs Evade Detection?

    Jan 26, 2026Devansh Srivastav, David Pape, Lea SchönherrLanguage Model Safety EvaluationLLM Auditing

  14. White-Box Sensitivity Auditing with Steering Vectors

    Jan 23, 2026Hannah Cyberey, Yangfeng Ji, David EvansAlgorithmic AuditingLLM Auditing

  15. A Scalable Entity-Based Framework for Auditing Bias in Large Language Models

    Jan 18, 2026Akram Elbouanani, Aboubacar Tuo, Adrian PopescuLLM AuditingPolitical Bias in Language Models

  16. Audit Me If You Can: Query-Efficient Active Fairness Auditing of Black-Box LLMs

    Jan 6, 2026David Hartmann, Lena Pohlmann, Lelia Hanslik +3LLM AuditingAlgorithmic Fairness

  17. Training-Free Policy Violation Detection via Activation-Space Whitening in LLMs

    Dec 3, 2025Oren Rachmil, Avishag Shapira, Roy Betser +5Language Model Safety EvaluationLLM Auditing

  18. MAS-Shield: A Defense Framework for Secure and Efficient LLM MAS

    Nov 28, 2025Kaixiang Wang, Zhaojiacheng Zhou, Bunyod Suvonov +8Multi-Agent LLM SystemsLLM Auditing

  19. Auditing Information Disclosure During Large-Scale Gradient-Based Training via Gradient Uniqueness

    Oct 13, 2025Sleem Abdelghafar, Maryam Aliakbarpour, Christopher JermaineData LeakagePrivacy Auditing

  20. The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

    Oct 7, 2025Matthieu Bou, Nyal Patel, Arjun Jagota +2Reinforcement LearningLLM Auditing

  21. Data Provenance Auditing of Fine-Tuned Large Language Models with a Text-Preserving Technique

    Oct 7, 2025Yanming Li, Cédric Eichler, Nicolas Anciaux +3Data ProvenanceDataset Watermarking

  22. What Is The Political Content in LLMs' Pre- and Post-Training Data?

    Sep 26, 2025Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach +1LLM AuditingPolitical Bias in Language Models

  23. Addressing Benchmarking Gaps in Large Language Models for Health and Medicine with Dynamic Red-Teaming

    Jul 30, 2025Jiazhen Pan, Bailiang Jian, Paul Hager +20LLM Safety BenchmarksLanguage Model Safety Evaluation

  24. PRISON: Unmasking the Criminal Potential of Large Language Models

    Jun 19, 2025Xinyi Wu, Geng Hong, Pei Chen +3Language Model Safety EvaluationLLM Auditing

  25. The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies

    Date pendingJiaxu Zhou, Jen-tse Huang, Xuhui Zhou +5LLM EvaluationLLM Auditing

  26. ReasoningFlow: Discourse Structures for Understanding LLM Reasoning Traces

    Date pendingJinu Lee, Shivam Agarwal, Amruta Parulekar +3LLM Reasoning with GraphsLLM Auditing