Black-Box Model Auditing

Momentum

12 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 66

All topics
CardsList
  1. What Does an Observability Foundation Model Know?

    Oct 4, 2026Dhyey Dharmendrakumar Mavani, Rian Atri, Tairan JiTime Series ForecastingRepresentation Probing

  2. Efficient Active Auditing of Multi-Group Fairness with Bias Probes

    Sep 30, 2026Ayoub Ajarra, Debabrota BasuAlgorithmic FairnessGroup Fairness

  3. VStress: Correlation-Aware Auditing and Adaptive Budget Allocation for Repeated Verifiers

    Sep 29, 2026Miaobo Hu, Shuhao Hu, Xiaobo Guo +5Algorithmic AuditingBlack-Box Model Auditing

  4. PhysioTRACE: Provenance-Aware Stress Tests for Physiological Foundation Models

    Sep 28, 2026Ayana Mussabayeva, Anuar Aimoldin, Olivier Oullier +2Data ProvenanceElectrocardiogram Foundation Models

  5. Auditing Agent Actions through Query-Conditioned Attribution

    Sep 27, 2026Yifan Liu, Praveen Venkateswaran, Abdulhamid Adebayo +1Gradient-Based AttributionAI Agent Benchmarks

  6. When Temporal Perturbations Act Like Sensor Biases: Label-Free Auditing of Wearable Activity Recognizers

    Sep 24, 2026Qingyu Wu, Yuan Wei, Renju Liu +1Human Activity RecognitionAdversarial Attacks

  7. Trust, but Validate the Instrument: Auditing AI-Generated RTL Verification Plans on Authored Security-Regression Proxies

    Sep 17, 2026Hang Xiao, Chuhong Xu, Kainan Zhou +2Formal Hardware VerificationLLM Auditing

  8. Membership Inference via Pairwise Likelihood Ratios

    Sep 14, 2026Shengjie Niu, Zebin Yun, Yeheng Ge +1Membership Inference AttacksBlack-Box Model Auditing

  9. Interpolation Is Not Invariance: Pair Count Is Not Coverage in Transformation Audits

    Sep 14, 2026Mohammed Ahnouch, Lotfi ElaachakAlgorithmic AuditingBlack-Box Model Auditing

  10. The Audit Decides the Verdict: Instrument Effects Rival Demographic Bias in LLM Decision Audits

    Sep 8, 2026Siddharth Vohra, Manikandan RavikiranLanguage Model Bias EvaluationDemographic Bias in Language Models

  11. Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints

    Sep 3, 2026Haoyaun Zhu, Jie ZhangLLM EvaluationLLM-as-a-Judge

  12. Rent-a-RAG: Embedding-Space Watermarks for Auditing Third-Party RAG

    Sep 3, 2026Alexandr Goultiaev Tolstokorov, Kyriakos Mouratidis, Javad Dogani +1Dataset WatermarkingRAG Security

  13. Not to Break, but to Attest: Adversarial Probes for Privacy-Preserving LLM Verification

    Aug 28, 2026Cameron Wilding, Mina Shaker, Fatemeh GanjiLLM AuditingPrivacy-Preserving ML

  14. When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers

    Aug 12, 2026Yang Liu, Ran ZouLLM Backdoor AttacksBackdoor Detection

  15. Manipulation-Proof Oblivious Audits against Deceptive Model Providers

    Aug 5, 2026Augustin Godinot, Sofiane Azogagh, Julien Ferry +1Algorithmic FairnessBlack-Box Model Auditing

  16. Auditing Data Provenance in LLM Fine-tuning via Intrinsic Distributional Fingerprints

    Aug 3, 2026Zirui Huang, Yunlong Mao, Wei Tong +3Language Model FingerprintingTraining Data Attribution

  17. Latent-Regime Bias Auditing for Volatility Forecasting

    Aug 3, 2026Arthur Chagas, Pedro Bento, Yan Aquino +3Time Series ForecastingFinancial Time Series

  18. When May a Model Replace the Experiment? Audits, Licenses, and the Price of Trust in Surrogate-Driven Design

    Aug 2, 2026Shuangxiu, Ma, Wenhe +1Surrogate ModelingSurrogate-Assisted Optimization

  19. Two Regimes of Chain-of-Thought Unfaithfulness: Behavioral Detection Fails Where Models Are Wrong

    Jul 26, 2026Suramya R. Angdembay, Dikshant Aryal, Nick RahimiCoT FaithfulnessCoT Evaluation

  20. Certified in Theory, Broken in Practice: Assumption Gaps in Cryptographic Model Certification

    Jul 23, 2026Carter Luck, Olive Franzese-McLaughlin, Elisaweta Masserova +3Privacy-Preserving MLBlack-Box Model Auditing

  21. Bet on Features: Anytime-Valid and Feature-Aware Auditing of Conditional Quantile Forecasters

    Jul 13, 2026Ivane Antonov, Sohom Mukherjee, Richard Pibernik +1Quantile RegressionSequential Hypothesis Testing

  22. Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets

    Jul 9, 2026Jack Hopkins, Dipika Khullar, Fabien RogerOverthinking in Language ModelsPrivacy Leakage in Language Models