Black-Box Model Auditing

Momentum

12 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 65

All topics
CardsList
  1. What Does an Observability Foundation Model Know?

    Oct 4, 2026Dhyey Dharmendrakumar Mavani, Rian Atri, Tairan JiTime Series ForecastingRepresentation Probing

  2. Efficient Active Auditing of Multi-Group Fairness with Bias Probes

    Sep 30, 2026Ayoub Ajarra, Debabrota BasuAlgorithmic FairnessGroup Fairness

  3. VStress: Correlation-Aware Auditing and Adaptive Budget Allocation for Repeated Verifiers

    Sep 29, 2026Miaobo Hu, Shuhao Hu, Xiaobo Guo +5Algorithmic AuditingBlack-Box Model Auditing

  4. PhysioTRACE: Provenance-Aware Stress Tests for Physiological Foundation Models

    Sep 28, 2026Ayana Mussabayeva, Anuar Aimoldin, Olivier Oullier +2Data ProvenanceElectrocardiogram Foundation Models

  5. Auditing Agent Actions through Query-Conditioned Attribution

    Sep 27, 2026Yifan Liu, Praveen Venkateswaran, Abdulhamid Adebayo +1Gradient-Based AttributionAI Agent Benchmarks

  6. When Temporal Perturbations Act Like Sensor Biases: Label-Free Auditing of Wearable Activity Recognizers

    Sep 24, 2026Qingyu Wu, Yuan Wei, Renju Liu +1Human Activity RecognitionAdversarial Attacks

  7. Trust, but Validate the Instrument: Auditing AI-Generated RTL Verification Plans on Authored Security-Regression Proxies

    Sep 17, 2026Hang Xiao, Chuhong Xu, Kainan Zhou +2Formal Hardware VerificationLLM Auditing

  8. Membership Inference via Pairwise Likelihood Ratios

    Sep 14, 2026Shengjie Niu, Zebin Yun, Yeheng Ge +1Membership Inference AttacksBlack-Box Model Auditing

  9. Interpolation Is Not Invariance: Pair Count Is Not Coverage in Transformation Audits

    Sep 14, 2026Mohammed Ahnouch, Lotfi ElaachakAlgorithmic AuditingBlack-Box Model Auditing

  10. The Audit Decides the Verdict: Instrument Effects Rival Demographic Bias in LLM Decision Audits

    Sep 8, 2026Siddharth Vohra, Manikandan RavikiranLanguage Model Bias EvaluationDemographic Bias in Language Models

  11. Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints

    Sep 3, 2026Haoyaun Zhu, Jie ZhangLLM EvaluationLLM-as-a-Judge

  12. Rent-a-RAG: Embedding-Space Watermarks for Auditing Third-Party RAG

    Sep 3, 2026Alexandr Goultiaev Tolstokorov, Kyriakos Mouratidis, Javad Dogani +1Dataset WatermarkingRAG Security

  13. Not to Break, but to Attest: Adversarial Probes for Privacy-Preserving LLM Verification

    Aug 28, 2026Cameron Wilding, Mina Shaker, Fatemeh GanjiLLM AuditingPrivacy-Preserving ML

  14. When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers

    Aug 12, 2026Yang Liu, Ran ZouLLM Backdoor AttacksBackdoor Detection

  15. Manipulation-Proof Oblivious Audits against Deceptive Model Providers

    Aug 5, 2026Augustin Godinot, Sofiane Azogagh, Julien Ferry +1Algorithmic FairnessBlack-Box Model Auditing

  16. Auditing Data Provenance in LLM Fine-tuning via Intrinsic Distributional Fingerprints

    Aug 3, 2026Zirui Huang, Yunlong Mao, Wei Tong +3Language Model FingerprintingTraining Data Attribution

  17. Latent-Regime Bias Auditing for Volatility Forecasting

    Aug 3, 2026Arthur Chagas, Pedro Bento, Yan Aquino +3Time Series ForecastingFinancial Time Series

  18. When May a Model Replace the Experiment? Audits, Licenses, and the Price of Trust in Surrogate-Driven Design

    Aug 2, 2026Shuangxiu, Ma, Wenhe +1Surrogate ModelingSurrogate-Assisted Optimization

  19. Two Regimes of Chain-of-Thought Unfaithfulness: Behavioral Detection Fails Where Models Are Wrong

    Jul 26, 2026Suramya R. Angdembay, Dikshant Aryal, Nick RahimiCoT FaithfulnessCoT Evaluation

  20. Certified in Theory, Broken in Practice: Assumption Gaps in Cryptographic Model Certification

    Jul 23, 2026Carter Luck, Olive Franzese-McLaughlin, Elisaweta Masserova +3Privacy-Preserving MLBlack-Box Model Auditing

  21. Bet on Features: Anytime-Valid and Feature-Aware Auditing of Conditional Quantile Forecasters

    Jul 13, 2026Ivane Antonov, Sohom Mukherjee, Richard Pibernik +1Quantile RegressionSequential Hypothesis Testing

  22. Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets

    Jul 9, 2026Jack Hopkins, Dipika Khullar, Fabien RogerOverthinking in Language ModelsPrivacy Leakage in Language Models

  23. Agent Step Value: Auditing Evaluator-Channel Reversals in Black-Box Agent Traces

    Jul 5, 2026Andrew Zhang, Chengzhan LiLLM Agent EvaluationAI Agent Evaluation

  24. Aionoscope: Debugging Latent-State Accessibility in Time-Series Representations

    Jul 1, 2026Alexander Chemeris, Ming Jin, Randall BalestrieroSynthetic Benchmark GenerationTime Series Representation Learning

  25. Using AI Agents to Automate Black-Box Audits of Personalization Algorithms at Scale

    Jun 29, 2026Alessandro Morosini, Sarah H. Cen, Andrew Ilyas +3Algorithmic AuditingAlgorithmic Bias

  26. Sequential Fairness Auditing with Limited Output Access

    Jun 29, 2026Ioannis Pitsiorlas, Martha V. Sourla, Marios KountourisAlgorithmic FairnessGroup Fairness

  27. RECAST: Model Reconstruction via Counterfactual-Aware Wasserstein Geometry under Limited Data

    Jun 26, 2026Xuan Zhao, Lena Krieger, Zhuo Cao +3Surrogate ModelingModel Extraction Attacks

  28. Where Black-box Drug-Target Interaction Prediction Models Look: Cross-Method Explainability

    Jun 12, 2026Ali Vefghi, Zahed Rahmati, Mohammad AkbariFeature AttributionExplainability Evaluation

  29. A prior-free blind detection of information leakage from model predictions

    Jun 9, 2026Laurence A. JacobsData LeakageBlack-Box Model Auditing

  30. Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard

    Jun 7, 2026Alireza Arbabi, Florian KerschbaumLLM AlignmentLLM Auditing

  31. MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models

    Jun 6, 2026Kaixin Lan, Mu You, Tao Fang +3Membership Inference AttacksLLM Auditing

  32. Is My Vision-Language Data in Your AI? Membership Inference Test (MINT) Demo 2

    Jun 5, 2026Daniel DeAlcala, Gonzalo Mancera, Julian Fierrez +3Membership Inference AttacksPrivacy Leakage in Language Models

  33. Auditing Near-Optimal Policies Can Be Exponentially Hard: Conditional Query Lower Bounds via Occupancy Rashomon Capacity

    May 29, 2026Ibne Farabi Shihab, Sanjeda Akter, Anuj SharmaInformation-Theoretic Lower BoundsBlack-Box Model Auditing

  34. Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage

    May 28, 2026Shahinul Hoque, Jinghuai Zhang, Jinyuan Sun +1LLM AuditingBlack-Box Model Auditing

  35. Auditing Training Data in Generative Music Models via Black-Box Membership Inference

    May 28, 2026Yi Chen Liu, Jiawei Yu, Kexin Cao +3Text-to-Music GenerationMembership Inference Attacks

  36. Symmetry Defeats Auditing

    May 27, 2026Nick Merrill, Zeke MedleyAlgorithmic AuditingAdversarial Attacks

  37. Auditing and Fixing Economic Validity in Tabular Foundation Models for Discrete Choice

    May 26, 2026Yingshuo Wang, Xian Sun, Yanhang Li +2Tabular Foundation ModelsDiscrete Choice Modeling

  38. Unlocking Apple's Private Cloud Compute: An Analysis of Privacy-Preserving Artificial Intelligence

    May 22, 2026Yannik Dittmar, Marvin Jerome Stephan, Thomas Völkl +2Privacy AuditingPrivacy-Preserving Language Models

  39. Optimal Guarantees for Auditing Rényi Differentially Private Machine Learning

    May 21, 2026Benjamin D. Kim, Lav R. Varshney, Daniel AlabiPrivacy AuditingBlack-Box Model Auditing

  40. I-SAFE: Wasserstein Coherence Metrics for Structural Auditing of Scientific AI Models

    May 20, 2026Barbara Tarantino, Gennaro Auricchio, Paolo GiudiciAlgorithmic AuditingBlack-Box Model Auditing

  41. How Do Document Parsers Break? Auditing Structural Vulnerability in Document Intelligence

    May 19, 2026Yue Chen, Yihao Wang, Ziyi Tang +2Document ParsingDocument Layout Analysis

  42. Architecture-Aware Explanation Auditing for Industrial Visual Inspection

    May 14, 2026Sibo Jia, Zihang Zhao, Kunrong LiIndustrial InspectionExplainability Evaluation

  43. Beyond the Wrapper: Identifying Artifact Reliance in Static Malware Classifiers using TRUSTEE

    May 7, 2026Riyazuddin Mohammed, Lan ZhangMalware ClassificationMalware Analysis

  44. ISAAC: Auditing Causal Reasoning in Deep Models for Drug-Target Interaction

    May 3, 2026Barbara Tarantino, Sun Kim, Yijingxiu Lu +1Reasoning EvaluationCausal Interpretability

  45. Bounding the Black Box: A Statistical Certification Framework for AI Risk Regulation

    Apr 23, 2026Natan Levy, Gadi PerlAI AssuranceAI Risk Management

  46. Behavioral Consistency and Transparency Analysis on Large Language Model API Gateways

    Apr 22, 2026Guanjie Lin, Yinxin Wan, Shichao Pei +3LLM AuditingBlack-Box Model Auditing

  47. Identifying Ethical Biases in Action Recognition Models

    Apr 20, 2026Ana Baltaretu, Pascal Benschop, Jan van GemertHuman Activity RecognitionAlgorithmic Fairness