LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. Formal Methods Meet LLMs: Auditing, Monitoring, and Intervention for Compliance of Advanced AI Systems

    May 15, 2026Parand A. Alamdari, Toryn Q. Klassen, Sheila A. McIlraithLLM AuditingFormal Verification

  2. A Unified Perturbation Framework for Analyzing Leaderboard Stability and Manipulation

    May 15, 2026Hosna Oyarhoseini, Jimmy Lin, Amir-Hossein KarimiLLM EvaluationLearning to Rank

  3. Asking Back: Interaction-Layer Antidistillation Watermarks

    May 15, 2026Guang Yang, Amir Ghasemian, Fengchen Liu +3LLM AuditingLLM Watermarking

  4. Representation Without Reward: A JEPA Audit for LLM Fine-Tuning

    May 14, 2026Biswa SenguptaLLM AuditingLLM Fine-Tuning

  5. Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks

    May 14, 2026Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray +1LLM Safety BenchmarksBenchmark Auditing

  6. AI Knows When It's Being Watched: Functional Strategic Action and Contextual Register Modulation in Large Language Models

    May 14, 2026Vinicius Covas, Jorge Alberto Hidalgo ToledoLLM AuditingAI Agent Monitoring

  7. Mechanical Enforcement for LLM Governance:Evidence of Governance-Task Decoupling in Financial Decision Systems

    May 14, 2026José Manuel de la Chica Rodríguez, Carlos Martí-GonzálezLLM AuditingLLM Safety

  8. NodeSynth: Socially Aligned Synthetic Data for AI Evaluation

    May 14, 2026Qazi Mamunur Rashid, Xuan Yang, Zhengzhe Yang +5Language Model Generation EvaluationLanguage Model Safety Evaluation

  9. Auditing Agent Harness Safety

    May 14, 2026Chengzhi Liu, Yichen Guo, Yepeng Liu +8AI Agent AuditingLLM Auditing

  10. Identifying AI Web Scrapers Using Canary Tokens

    May 13, 2026Steven Seiden, Triss Ren, Caroline Zhang +3LLM Auditing

  11. Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces

    May 12, 2026Shixing Yu, Promit Ghosal, Kyra GanFeature AttributionLLM Auditing

  12. Just Ask for a Table: A Thirty-Token User Prompt Defeats Sponsored Recommendations in Twelve LLMs

    May 12, 2026Andreas Maier, Jeta Sopa, Gozde Gul Sahin +2LLM AuditingLLM Prompting

  13. CoT-Guard: Small Models for Strong Monitoring

    May 12, 2026Nirav Diwan, Han Wang, Berkcan Kapusuzoglu +6LLM AuditingAdversarial Attacks on LLMs

  14. The Algorithmic Caricature: Auditing LLM-Generated Political Discourse Across Crisis Events

    May 12, 2026Gunjan, Sidahmed Benabderrahmane, Talal RahwanSocial Media AnalysisLLM Auditing

  15. Behavioral Integrity Verification for AI Agent Skills

    May 12, 2026Yuhao Wu, Tung-Ling Li, Hongliang LiuAgent ReliabilityAI Agent Auditing

  16. When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel

    May 12, 2026Wenkai Li, Fan Yang, Ananya Hazarika +2CoT FaithfulnessLLM Auditing

  17. OptArgus: A Multi-Agent System to Detect Hallucinations in LLM-based Optimization Modeling

    May 12, 2026Zhong Li, Zihan Guo, Xiaohan Lu +5LLM AuditingHallucination in Language Models

  18. PRISM: A Geometric Risk Bound for Decomposing Drift into Scale, Shape, and Head

    May 12, 2026Chieh-Yen Lin, Shao-Hua SunLLM QuantizationLLM Evaluation

  19. The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested

    May 12, 2026Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka +1LLM AuditingAI Safety Evaluation

  20. CPEMH: An Agentic Framework for Prompt-Driven Behavior Evaluation and Assurance in Foundation-Model Systems for Mental Health Screening

    May 11, 2026Giuliano Lorenzoni, Ivens Portugal, Paulo Alencar +1LLM AuditingPrompt Optimization

  21. Quantifying the Reconstructability of Astrophysical Methods with Large Language Models and Information Theory: A Case Study in Spectral Reconstruction

    May 11, 2026Hsing Wen Lin, Zong-Fu SieLLM AuditingScientific Reproducibility

  22. Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

    May 11, 2026Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada +7LLM AuditingMultimodal Large Language Models

  23. Acceptance Cards:A Four-Diagnostic Standard for Safe Fine-Tuning Defense Claims

    May 11, 2026Phongsakon Mark Konrad, Toygar Tanyel, Serkan AyvazFine-TuningLanguage Model Safety Evaluation

  24. Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions

    May 11, 2026Sushrita Rakshit, Hanwen Zhang, Hua ShenLLM AlignmentLLM Auditing

  25. CHAINTRIX: A multi-pipeline LLM-augmented framework for automated smart-contract security auditing

    May 10, 2026Gabriela Dobrita, Simona-Vasilica Oprea, Adela BaraLLM AuditingSoftware Vulnerability Detection

  26. BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence

    May 9, 2026Jialing Gan, Junhao Dong, Songze LiPrompt SensitivityLLM Auditing