Model Auditing

Momentum

105 papers in the last four weeks, up 133% on the four weeks before. 1.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 538

All topics
CardsList
  1. PairAudit: Guiding Human Review with Graph Tokens under Distribution Shift

    Oct 7, 2026Jiran Tao, Binyan JiangModel Auditing

  2. Comprehension Audits to Mitigate Risks from Automated AI Research

    Oct 7, 2026Ronald J. Bodkin, Bahrad A. Sokhansanj, Gillian K. HadfieldCode QualityModel Auditing

  3. Shared and structured inputs undermine collective random choice by reasoning AI agents

    Oct 7, 2026Takahiro Ezaki, Naoto Imura, Katsuhiro NishinariRandomModel Auditing

  4. Learning to Report Unsafe Tasks in a Multi-Agent Game

    Oct 6, 2026Avyay M. Casheekar, Hariganesh TangiralaModel Auditing

  5. CHARTER: Auditing Reference Substitution in Hierarchical Compact-Evidence Evaluation for Computational Pathology

    Oct 6, 2026Hyun Do Jung, Jungwon Choi, Soojung Choi +2Model AuditingComparison

  6. Harmful SFT Leaves a Continuous Trace in LLM Checkpoint Updates

    Oct 5, 2026Ziqun Bao, Xinyu Zhang, Yuchen Shao +1Large Language Model SafetySupervised Finetuning

  7. Auditable Claims about AI Agents

    Oct 5, 2026Yue Zhao, Jiate Li, Li Li +4Model Auditing

  8. Correct Verdicts, Flawed Reasoning: Structured Auditing of LLM-based Vulnerability Reasoning

    Oct 5, 2026Boyue Caroline Hu, Kaivalya Ahir, Ronghao Ni +1Model Auditing

  9. Measurement-First Auditing of Agentic Leaderboards: Contamination Susceptibility, Matched-Control Re-evaluation, and Scorer Validation

    Oct 5, 2026Dishu Yang, Qi Su, Hongbo Qin +1LeaderboardModel Auditing

  10. SALUS: Automated Auditing of NL-to-SQL Benchmarks through Weak Supervision of Multi-Agent Output

    Oct 4, 2026Shiyuan Zhou, Ashwin Gerard Colaco, Sainyam Galhotra +1Legal Natural Language Processing BenchmarksModel Auditing

  11. A Comparative Explainability Framework for DeBERTa-v3 in Zero-Shot Medical Abstract Classification

    Oct 1, 2026Javier Diaz Esteban-Herreros, David Muñoz-Valero, Raquel Martínez-España +2ExplainabilityBert-Based Models

  12. Counterfactual Auditing of Bias in Open-Source Large Language Models for Clinical Triage

    Oct 1, 2026Manar Aljohani, Brandon Ho, Kenneth McKinley +2Large Language Model BiasTriage

  13. How the Audit Rule Shapes Faithful Factor Explanations in LLMs

    Oct 1, 2026Taolin Zhang, Hanyu Wang, Jiuheng Wan +2Model AuditingLarge Language Model Reliability

  14. OpenMTB-Audit: Exposing Over-Refusal and Clinical Expert Perspectives in LLM-Based Molecular Tumor Board Safety Evaluation

    Oct 1, 2026Negin Ashrafi, Jia Luo, Stacey M. Frumm +1Multidisciplinary Tumor BoardsClinical

  15. Auditing Routing Entropy as an Uncertainty Signal in Attention-Residual Transformers

    Oct 1, 2026Wenhao Liang, Lin Yue, Wei Emma Zhang +3Transformer Residual StreamsModel Auditing

  16. Auditing Action Settlement in LLM Agent Environments: Order, Progress, and Replay

    Oct 1, 2026Haotian Chen, Bowen Ye, Yuning Zhang +1Large Language Model AgentsContracts

  17. Beyond Final Accuracy: Auditing Communication in LLM Multi-Agent Systems

    Oct 1, 2026Shixuan Li, Wei Yang, Peiyu Zhang +3Multi-Agent CommunicationModel Auditing

  18. Tolerance-Based Fairness Auditing: Violation Certification and Sensitivity Screening

    Oct 1, 2026Jie Tang, Chuanlong Xie, Lixing ZhuFairness AuditsAlgorithmic Fairness

  19. A Matched-Budget Audit Framework for Recaptioned Image-Text Supervision Distributions

    Oct 1, 2026Giyeong Oh, Junghun Park, Yuhan Bae +1Video CaptioningText-To-Image

  20. WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents

    Sep 30, 2026Ziyan Jiang, Jingbo Yang, Jiabao Ji +53D WorldMultimodal Agents

  21. Cheap to Draw, Expensive to Trust: Certifying Test-Time Scaling Curves

    Sep 30, 2026Sohail, Sarkar, Shakuntala BaichooModel AuditingTest-Time Scaling

  22. Efficient Active Auditing of Multi-Group Fairness with Bias Probes

    Sep 30, 2026Ayoub Ajarra, Debabrota BasuFairness AuditsAlgorithmic Fairness

  23. Fyan: A Human--AI Harness with Semantic Auditing for Document-Level Formalization

    Sep 30, 2026Wei Zhao, Yangshuo Zou, Chengxiang Ding +5FormalizationProof

  24. From Verification Failures to Reusable Guidance for Coding Agents

    Sep 30, 2026Yuqing Zhai, Xiaohong Chen, Lingming Zhang +2Coding AgentsAgentic Evaluations

  25. Whose Voice Survives the Summary? A Voice-Retention Audit of LLM Employee Listening

    Sep 30, 2026Thilo Tamme, Anton Hantel, Bijan Khosrawi-RadSummarizationModel Auditing

  26. Where the Evidence Lives: Auditing AI Companions' Self-Descriptions

    Sep 30, 2026Seiya Ikeda, Shin-nosuke IshikawaModel AuditingStylistic Fidelity

  27. Where Scientific Search Agents Fail: Decision-Checkpoint Auditing of Exposure and Inspection Attempts

    Sep 29, 2026Hongmin Li, Wanli ZhaoScientific AgentsSearch Algorithms

  28. E2E-SWE: Benchmarking LLMs on Building Working Codebases from Scratch

    Sep 29, 2026Hantian Ding, Chloe Bi, Jiacheng Zhu +5CodebasesModel Auditing

  29. Retrieve, Reproduce, Reveal: Dissecting Retrieval-Augmented Software Vulnerability Detection

    Sep 29, 2026Sabrina Kaniewski, Tim Krämer, Julius Bächle +3Model VulnerabilitiesSoftware

  30. Do Agent Benchmarks Do What They Say? An Executable-Contract Audit of Tool-Using Agent Environments

    Sep 29, 2026Rohith Reddy Bellibatlu, Zichong Wang, Wenbin ZhangAgentic BenchmarksModel Auditing

  31. Selecting The Most Informative Tokens in Natural Language Autoencoders

    Sep 29, 2026Federico Torrielli, Gianluca Barmina, Andrea Blasi Núñez +4Explainable AI MethodsModel Activations

  32. REALHOP: Rethinking Multi-Hop Reasoning Evaluation via Behavioral Auditing

    Sep 29, 2026Jiawen Tao, Xiaokun Yuan, Yaoming Li +4Multi-Hop ReasoningReasoning Benchmark

  33. VStress: Correlation-Aware Auditing and Adaptive Budget Allocation for Repeated Verifiers

    Sep 29, 2026Miaobo Hu, Shuhao Hu, Xiaobo Guo +5Verification FrameworkStress Testing

  34. Verifier Errors in RLVR: Reward Hacking, Limits of Feedback, and Selective Control

    Sep 28, 2026Christian Moya, Elliott Thornley, Guang LinReinforcement Learning With Verifiable RewardVerifiable Rewards

  35. PhysioTRACE: Provenance-Aware Stress Tests for Physiological Foundation Models

    Sep 28, 2026Ayana Mussabayeva, Anuar Aimoldin, Olivier Oullier +2Physiological DataElectroencephalography Foundation Models

  36. ReplayLens: Auditing Agents' Use of Outcomes

    Sep 28, 2026Dong Xu, Zhangfan Yang, Jiantao Wu +5ReplayInteraction History

  37. Auditing Agent Actions through Query-Conditioned Attribution

    Sep 27, 2026Yifan Liu, Praveen Venkateswaran, Abdulhamid Adebayo +1Model AuditingMean Average Precision

  38. Audit-First VAPO: Risk-Certified Selective Updates under Imperfect Verification

    Sep 27, 2026Miaobo Hu, Shuhao Hu, Xiaobo Guo +5Finite-Sample CertificatesModel Auditing

  39. The Selection Rule Decides the Winner: A Pre-Registered Audit of Open-Set Graph Anomaly Detection

    Sep 27, 2026Farhan Shahriyar Hossain, Taufikur Rahman Fuad, Md Abrar Jahin +1Generalist Graph Anomaly DetectionLogical Anomalies

  40. When Temporal Perturbations Act Like Sensor Biases: Label-Free Auditing of Wearable Activity Recognizers

    Sep 24, 2026Qingyu Wu, Yuan Wei, Renju Liu +1Human Activity RecognitionModel Auditing

  41. Claim-Gated Source-Risk Auditing for Generative Search

    Sep 24, 2026Kainan Zhou, Chuhong Xu, Gangzhen Qian +1CitationsModel Auditing

  42. Thinking Leakage: A Causal Audit of NoThink Post-Training in Hybrid Reasoning Models

    Sep 23, 2026Zehao Liu, Vasant G. HonavarLarge Reasoning ModelsPost-Training

  43. Can LLMs Catch a Rigged Backtest? A Clean-Control Calibration Benchmark

    Sep 23, 2026Makar Ulesov, Vladislav Smirnov, Omar Ibrahim +1Model AuditingCode Quality

  44. Beyond Mean Foils: Auditing Worst-Foil Specificity in Frozen CLIP Region Explanations

    Sep 23, 2026Kaixin Liu, Zhipeng Ye, Feng Jiang +2Semantic RegionFrozen Contrastive Language-Image Pre-Training Visual Encoder

  45. Discover, Falsify, Revise: Auditing Input-Use Claims from Source Code to Predictive Contribution in Agent-Discovered Cell Models

    Sep 23, 2026Mengran Li, Bo Li, Chengyang Zhang +3Virtual CellModel Auditing