LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. Position: Generative Engine Optimization Creates Underexamined Risks, Governance Must Target Concentration, Disclosure, and Academic Blind Spots

    May 18, 2026Yizhu Wen, Nan Zhang, Haohan Yuan +3Generative Engine OptimizationLLM Auditing

  2. Auditing Reasoning-Trace Memorization Claims after Unlearning with Head-Conditioned Canaries

    May 17, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangMemorization in Language ModelsLLM Auditing

  3. GPF-LiveNews: A Streaming Evaluation Protocol for Group-Conditioned Framing in Large Language Models

    May 16, 2026Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta +1LLM EvaluationLLM Auditing

  4. AI-Mediated Communication Can Steer Collective Opinion

    May 15, 2026Stratis Tsirtsis, Kai Rawal, Chris Russell +2Opinion DynamicsLLM Auditing

  5. Fully Open Meditron: An Auditable Pipeline for Clinical LLMs

    May 15, 2026Xavier Theimer-Lienhard, Mushtaha El-Amin, Fay Elhassan +5HealthcareLLM Auditing

  6. Formal Methods Meet LLMs: Auditing, Monitoring, and Intervention for Compliance of Advanced AI Systems

    May 15, 2026Parand A. Alamdari, Toryn Q. Klassen, Sheila A. McIlraithLLM AuditingFormal Verification

  7. A Unified Perturbation Framework for Analyzing Leaderboard Stability and Manipulation

    May 15, 2026Hosna Oyarhoseini, Jimmy Lin, Amir-Hossein KarimiLLM EvaluationLearning to Rank

  8. Asking Back: Interaction-Layer Antidistillation Watermarks

    May 15, 2026Guang Yang, Amir Ghasemian, Fengchen Liu +3LLM AuditingLLM Watermarking

  9. Representation Without Reward: A JEPA Audit for LLM Fine-Tuning

    May 14, 2026Biswa SenguptaLLM AuditingLLM Fine-Tuning

  10. Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks

    May 14, 2026Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray +1LLM Safety BenchmarksBenchmark Auditing

  11. AI Knows When It's Being Watched: Functional Strategic Action and Contextual Register Modulation in Large Language Models

    May 14, 2026Vinicius Covas, Jorge Alberto Hidalgo ToledoLLM AuditingAI Agent Monitoring

  12. Mechanical Enforcement for LLM Governance:Evidence of Governance-Task Decoupling in Financial Decision Systems

    May 14, 2026José Manuel de la Chica Rodríguez, Carlos Martí-GonzálezLLM AuditingLLM Safety

  13. NodeSynth: Socially Aligned Synthetic Data for AI Evaluation

    May 14, 2026Qazi Mamunur Rashid, Xuan Yang, Zhengzhe Yang +5Language Model Generation EvaluationLanguage Model Safety Evaluation

  14. Auditing Agent Harness Safety

    May 14, 2026Chengzhi Liu, Yichen Guo, Yepeng Liu +8AI Agent AuditingLLM Auditing

  15. Identifying AI Web Scrapers Using Canary Tokens

    May 13, 2026Steven Seiden, Triss Ren, Caroline Zhang +3LLM Auditing

  16. Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces

    May 12, 2026Shixing Yu, Promit Ghosal, Kyra GanFeature AttributionLLM Auditing

  17. Just Ask for a Table: A Thirty-Token User Prompt Defeats Sponsored Recommendations in Twelve LLMs

    May 12, 2026Andreas Maier, Jeta Sopa, Gozde Gul Sahin +2LLM AuditingLLM Prompting

  18. CoT-Guard: Small Models for Strong Monitoring

    May 12, 2026Nirav Diwan, Han Wang, Berkcan Kapusuzoglu +6LLM AuditingAdversarial Attacks on LLMs

  19. The Algorithmic Caricature: Auditing LLM-Generated Political Discourse Across Crisis Events

    May 12, 2026Gunjan, Sidahmed Benabderrahmane, Talal RahwanSocial Media AnalysisLLM Auditing

  20. Behavioral Integrity Verification for AI Agent Skills

    May 12, 2026Yuhao Wu, Tung-Ling Li, Hongliang LiuAgent ReliabilityAI Agent Auditing

  21. When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel

    May 12, 2026Wenkai Li, Fan Yang, Ananya Hazarika +2CoT FaithfulnessLLM Auditing

  22. OptArgus: A Multi-Agent System to Detect Hallucinations in LLM-based Optimization Modeling

    May 12, 2026Zhong Li, Zihan Guo, Xiaohan Lu +5LLM AuditingHallucination in Language Models

  23. PRISM: A Geometric Risk Bound for Decomposing Drift into Scale, Shape, and Head

    May 12, 2026Chieh-Yen Lin, Shao-Hua SunLLM QuantizationLLM Evaluation

  24. The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested

    May 12, 2026Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka +1LLM AuditingAI Safety Evaluation

  25. CPEMH: An Agentic Framework for Prompt-Driven Behavior Evaluation and Assurance in Foundation-Model Systems for Mental Health Screening

    May 11, 2026Giuliano Lorenzoni, Ivens Portugal, Paulo Alencar +1LLM AuditingPrompt Optimization