Model Auditing

Momentum

105 papers in the last four weeks, up 133% on the four weeks before. 1.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 538

All topics
CardsList
  1. Ambient Persuasion in a Deployed AI Agent: Unauthorized Escalation Following Routine Non-Adversarial Content Exposure

    Apr 29, 2026Diego F. Cuadros, Abdoul-Aziz MaigaAgentic DeploymentsEscalation

  2. TRUST: A Framework for Decentralized AI Service v.0.1

    Apr 29, 2026Yu-Chao Huang, Zhen Tan, Mohan Zhang +3Trustworthy Artificial IntelligenceAI Trustworthiness

  3. Auditing Marketing Budget Allocation with Hindsight Regret

    Apr 28, 2026Nilavra Pathak, Olivier Jeunen, Eric LambertToken Budget AllocationModel Auditing

  4. Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

    Apr 28, 2026Kemal BicakciModel Auditing

  5. Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills

    Apr 28, 2026Lijia Lv, Xuehai Tang, Jie Wen +2Model Auditing

  6. Optimally Auditing Adversarial Agents

    Apr 28, 2026Sanmay Das, Fang-Yi Yu, Yuang ZhangModel AuditingBounded Adversary

  7. BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

    Apr 27, 2026Xinming Tu, Tianze Wang, Yingzhou +4Agentic BenchmarksModel Auditing

  8. A Multi-Dimensional Audit of Politically Aligned Large Language Models

    Apr 27, 2026Lisa Korver, Mohamed Mostagir, Sherief RedaLarge Language Model BiasLarge Language Model Alignment

  9. Agentic Witnessing: Pragmatic and Scalable TEE-Enabled Privacy-Preserving Auditing

    Apr 27, 2026Antony RowstronZero-Knowledge ProofsModel Auditing

  10. FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification

    Apr 26, 2026Dongxin Guo, Jikun Wu, Siu Ming YiuFinancial Question AnsweringCategory-Aware Atomic Claims

  11. Make Mechanistic Interpretability Auditable: A Call to Develop Guidelines via Continuous Collaborative Reviewing

    Apr 24, 2026Michael Lan, Narmeen Fatimah Oozeer, Chaithanya Bandi +4Artificial Intelligence SafetyModel Auditing

  12. Spontaneous Persuasion: An Audit of Model Persuasiveness in Everyday Conversations

    Apr 23, 2026Nalin Poungpeth, Nicholas Clark, Tanu MitraPersuasionHuman-Written Text

  13. Who Audits the Auditor? Tamper-Proof Fraud Detection with Blockchain-Anchored Explainable ML

    Apr 23, 2026Zhaohui WangFraud DetectionModel Auditing

  14. Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores

    Apr 23, 2026Shevya Panda, Shinjini Bose, Ananya JoshiMental HealthClinician Trust

  15. AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA

    Apr 23, 2026Tasnim Kabir, Dmytro Kurdydyk, Aadi Palnitkar +3Audio UnderstandingText-To-Audio

  16. OptiVerse: A Comprehensive Benchmark towards Optimization Problem Solving

    Apr 23, 2026Xinyu Zhang, Boxuan Zhang, Yuchen Wan +5Optimization ModelingModel Auditing

  17. Participatory provenance as representational auditing for AI-mediated public consultation

    Apr 22, 2026Sachit MahajanGeneration ProvenanceModel Auditing

  18. Evian: Towards Explainable Visual Instruction-tuning Data Auditing

    Apr 22, 2026Zimu Jia, Mingjie Xu, Andrew Estornell +1Recent Vision-Language ModelsData Quality

  19. MedSkillAudit: A Domain-Specific Audit Framework for Medical Research Agent Skills

    Apr 22, 2026Yingyong Hou, Xinyuan Lao, Huimei Wang +10Inter-Annotator AgreementClinician Trust

  20. Auditing and Controlling AI Agent Actions in Spreadsheets

    Apr 22, 2026Sadra Sabouri, Zeinabsadat Saghi, Run Huang +4SpreadsheetsModel Auditing

  21. Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment

    Apr 21, 2026Bobo Li, Rui Wu, Zibo Ji +5Large Language Model AgentsAsymmetry

  22. Co-Refine: AI-Powered Tool Supporting Qualitative Analysis

    Apr 21, 2026Athikash Jeyaganthan, Kai Xu, Franziska Becker +1Qualitative ResearchModel Auditing

  23. Semantic Needles in Document Haystacks: Sensitivity Testing of LLM-as-a-Judge Similarity Scoring

    Apr 20, 2026Sinan G. Aksoy, Alexandra A. Sabrio, Erik VonKaenel +1Large Language Model BiasLlm-As-A-Judge

  24. Tight Auditing of Differential Privacy in MST and AIM

    Apr 20, 2026Georgi Ganev, Meenatchi Sundaram Muthu Selva Annamalai, Bogdan KulynychStandard Differential-PrivacyPrivacy

  25. Auditing Support Strategies in LLMs through Grounded Multi-Turn Social Simulation

    Apr 18, 2026Michelle Star, Andrew Aquilina, Yu-Ru LinScaling Improve Social SimulationEmotional Support Conversation Task

  26. Beyond Black-Box Labels: Interpretable Criteria for Diagnosing Subjective NLP Tasks

    Apr 18, 2026Nisrine Rair, Alban Goupil, Valeriu Vrabie +1Human AnnotatorsDisagreement

  27. Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

    Apr 18, 2026Zixiao Zhao, Amirreza Esmaeili, Fatemeh FardLlm-As-A-JudgeSoftware Engineering

  28. Rater State Bias in RLHF Preference Data: An Audit Framework

    Apr 14, 2026Elena Kopteva, Vitaliy Hlynianyi-ZhukReinforcement Learning From Human FeedbackRater

  29. Auditable Agents

    Apr 7, 2026Yi Nian, Aojie Yuan, Haiyue Zhang +7AccountabilityModel Auditing

  30. Knowdit: Agentic Smart Contract Vulnerability Detection with Auditing Knowledge Summarization

    Mar 27, 2026Ziqiao Kong, Wanxu Xia, Chong Wang +6Smart ContractsDecentralized Finance

  31. Learning When to Trust in Contextual Social Bandits

    Mar 9, 2026Majid Ghasemi, Mark CrowleyContextual Bandit FrameworkAI Trustworthiness

  32. MASRubric: Auditing Information Flow in Multi-Agent Systems with Failure-Distilled Pitfall Rubrics

    Feb 26, 2026Yutong Wang, Siyuan Xiong, Xuebo Liu +4Model-Based Multi-Agent SystemsModel Auditing

  33. AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

    Feb 26, 2026Abhay Sheshadri, Aidan Ewart, Elias Kempf +8Model AuditingArtificial Intelligence Alignment

  34. Beyond Pixels: A Vector-to-Graph Framework for Reliable Schematic Auditing

    Feb 12, 2026Chengwei Ma, Zhen Tian, Zhou Zhou +5Structure-AwareGraph Representations

  35. Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models

    Feb 3, 2026Anish Sathyanarayanan, Aditya Nagarsekar, Aarush RathoreChain-of-Thought ReasoningReasoning Skills

  36. Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking

    Feb 2, 2026Mohammad Beigi, Ming Jin, Junshan Zhang +2Reinforcement Learning From Human FeedbackModel-Agnostic Defense

  37. Unknown Unknowns: Do Hidden Intentions in LLMs Evade Detection?

    Jan 26, 2026Devansh Srivastav, David Pape, Lea SchönherrArtificial Intelligence DetectionArtificial Intelligence Governance

  38. White-Box Sensitivity Auditing with Steering Vectors

    Jan 23, 2026Hannah Cyberey, Yangfeng Ji, David EvansModel AuditingLarge Language Model Evaluation

  39. Audit Me If You Can: Query-Efficient Active Fairness Auditing of Black-Box LLMs

    Jan 6, 2026David Hartmann, Lena Pohlmann, Lelia Hanslik +3Fairness AuditsLarge Language Model Bias

  40. A framework for auditing grounding claims

    Dec 5, 2025Daniel Quigley, Eric MaynardContextual GroundingModel Auditing

  41. Auditing Information Disclosure During Large-Scale Gradient-Based Training via Gradient Uniqueness

    Oct 13, 2025Sleem Abdelghafar, Maryam Aliakbarpour, Christopher JermaineGradient-Based AttacksMembership Inference Attacks

  42. Data Provenance Auditing of Fine-Tuned Large Language Models with a Text-Preserving Technique

    Oct 7, 2025Yanming Li, Cédric Eichler, Nicolas Anciaux +3Large Language Model WatermarksMachine-Generated Text Detection

  43. Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

    Sep 22, 2025Geewook Kim, Minjoon SeoAudio-Visual ReasoningSpeech Encoder

  44. Optimizing Canaries for Privacy Auditing with Metagradient Descent

    Jul 21, 2025Matteo Boglioni, Terrance Liu, Andrew Ilyas +1Stochastic Gradient DescentMembership Inference Attacks

  45. DelistBench: Evaluating Search-Enabled LLMs for Auditable Corporate-Event Database Completion

    Date pendingXuan Yao, Shuping Li, Yang Dai +2Model AuditingSecurity Evaluation

  46. FaultLens: Learning Compact Behavioral Test Suites for Generated Operational Programs

    Date pendingZeming Liu, Hang Lyu, Jingtao ZhangModel AuditingLens