Benchmark Validity

Momentum

15 papers in the last four weeks, up 114% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 117

All topics
CardsList
  1. On Hyperparameter Tuning on the Test Set

    Oct 5, 2026Matteo Fregonara, Tom Viering, Jan van GemertModel SelectionBenchmark Validity

  2. What Does a Harness Repair? A Preregistered Study of Visibility, Baseline Adequacy and Evaluation Defects

    Oct 4, 2026Bowen Xu, Boyu ChenLLM EvaluationBenchmark Validity

  3. Frozen Scenes, Shifting Winners: Configuration Fragility in Text-to-3D Evaluation

    Sep 30, 2026Anson Y. Lam, Shuqing Li, Michael R. LyuVLM EvaluationBenchmark Validity

  4. TopU-LBVS: A Realistic Multi Target Benchmark for Ligand Based Virtual Screening

    Sep 24, 2026Surbhi Kumar, Yuhe Zhou, Varun Shiralkar +2Benchmark DesignVirtual Screening

  5. Certified Against Which Oracle? Execution Labels Set the Reported Risk of Conformal Abstention for Text-to-SQL

    Sep 22, 2026Jiamiao Liu, Dewen Qiao, Yu Zhang +1Probability CalibrationBenchmark Auditing

  6. Auditing Proxy-Based Validation Across Text Spans

    Sep 22, 2026Daein Weon, Dong Ho KangBenchmark ValidityAutomated Evaluation

  7. Prevalence Determines Precision:Silent Contamination in Detector-Defined Datasets

    Sep 12, 2026Jia Huang, Yankai Wan, Yangjun OuBenchmark ValidityData Contamination

  8. What Fixed-Rollout pass@k Evaluations Can Identify

    Sep 10, 2026Pranav Singh, Prashant SinghConfidence Region EstimationPartial Identification

  9. SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents

    Sep 8, 2026Pujun Zheng, Zixin Shang, Shufan Jiang +5Reward HackingSoftware Engineering Agents

  10. Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

    Aug 13, 2026Junhao Luo, Ning Huang, Ziqi Sha +2LLM EvaluationLLM Auditing

  11. Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation

    Aug 13, 2026Rana Muhammad Ahmed, Sabahat AbbasMCP SecurityLLM Agent Security

  12. FormStruct-Bench:A Hierarchical and Diagnostic Benchmark for Table-Form Document Structure Recognition

    Aug 11, 2026Lujie Ban, Jiangtao Zhu, Yuanheng Yu +2Document UnderstandingTable Structure Recognition

  13. CADEngBench: It Looks Like CAD, but Does It Work? Evaluating Parametric Design, Assembly Reasoning, and Physics Simulation

    Aug 10, 2026Harmanjot Singh, Abhra Dubey, Jorge Alejandro Amador HerreraBenchmark ConstructionParametric CAD Modeling

  14. Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints

    Aug 6, 2026Omid Bazgir, Md Nasir, Jacob Hoffman +6Synthetic Benchmark GenerationBenchmark Validity

  15. SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models

    Aug 5, 2026Sihan Hu, Lyuhan Huang, Youjin Deng +1LLM EvaluationScientific Code Generation

  16. Reassessing the Feasibility of PPG-Based Non-Invasive Blood Glucose Level Estimation

    Aug 3, 2026Supraja Ramesh, Markus Neufeld, Michael Küttner +2Data LeakageOOD Generalization

  17. How Benchmarks Mis-Score Computer-Use Agents

    Jul 30, 2026Zihan Dong, Zhiyuan Ma, Zekun Wang +5Agent Failure AnalysisComputer-Use Agent Benchmarks

  18. Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks

    Jul 29, 2026Jeff Mohl, Nelson Gardner-Challis, Magda Dubois +6Benchmark AuditingAI Agent Benchmarks

  19. Success Is Not Self-Explanatory: Auditing Success Provenance in Agent Evaluation

    Jul 27, 2026Jingkun Luo, Da-Tian PengData ProvenanceBenchmark Auditing

  20. Charging Phase Health Indicators for Battery State-of-Health Estimation: A Systematic Comparison of CC, CV, and Combined Approaches under Cross-Battery Validation

    Jul 26, 2026Huy Hoang Le, Kim-Anh NguyenBenchmark ValidityLithium-Ion Batteries

  21. When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability

    Jul 9, 2026Zongyou Yang, Yinghan Hou, Xiaokun YangLLM-as-a-JudgeLLM Auditing

  22. Towards Standardized Light Field Quality Assessment: Hybrid Subjective Benchmarking and Objective Metric Evaluation

    Jul 3, 2026Saeed Mahmoudpour, Mylene C. Q. Farias, Gi-Mun Um +6Pairwise ComparisonBenchmark Validity

  23. Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits

    Jul 1, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangAI AssuranceBenchmark Auditing

  24. Validating Causal Abstraction Metrics on Simulated Complex Systems

    Jun 30, 2026Maxime Méloux, Tiago Pimentel, François Portet +1Causal AbstractionBenchmark Validity

  25. Exploring Differences Between Tabular Enterprise Data and Public Benchmarks

    Jun 29, 2026Myung Jun Kim, Maximilian Schambach, Frank Essenberger +2Benchmark DesignTabular ML

  26. EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures

    Jun 29, 2026Buğra Alperen Uluırmak, Rifat KurbanAI AlignmentLLM Safety Alignment

  27. Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving

    Jun 28, 2026Pawan Sasanka Ammanamanchi, Siddharth Bhat, Stella BidermanBenchmark DesignBenchmark Validity

  28. Pooled Leaderboards Hide System-Specific Winners: A Reporting-Protocol Audit of Offline Root-Cause Analysis Benchmarks

    Jun 28, 2026Lining Hu, Ting Liu, Yuzhuo FuPairwise ComparisonAlgorithmic Auditing

  29. Life After Benchmark Saturation: A Case Study of CORE-Bench

    Jun 23, 2026Nitya Nadgir, Sayash Kapoor, Kangheng Liu +11OOD GeneralizationAI Agent Evaluation

  30. MassSpecGym in the Wild: Uncovering and Correcting Evaluation Pitfalls in AI-Driven Molecule Discovery

    Jun 17, 2026Hongxuan Liu, Roman Bushuiev, Ivy Lightheart +12Benchmark DesignBenchmark Contamination

  31. Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias

    Jun 17, 2026Justin D. Norman, Michael U. Rivera, D. Alex HughesInter-Rater ReliabilityLLM Evaluation

  32. LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation

    Jun 14, 2026Hiroyasu Usami, Keisuke Hara, Ayato Tsuboi +1LLM EvaluationLLM-as-a-Judge

  33. Crossing the Validation Crisis: Cross-Validation Reduces Benchmarking Variance Surprisingly Well

    Jun 10, 2026Célestin Eve, Gaël Varoquaux, Thomas MoreauBenchmark ValidityVariance Reduction

  34. ERBench: A Benchmark and Testsuite for Equation Discovery Algorithms

    Jun 8, 2026Paul Kahlmeyer, Henrik Voigt, Michael Habeck +1Benchmark DesignScientific Discovery

  35. SC3: The Multi-Solvent Solubility Challenge and Benchmark

    Jun 3, 2026Vansh Ramani, Har Ashish Arora, Dhairya Kuchhal +4Benchmark ConstructionBenchmark Validity

  36. What Are We Actually Benchmarking in Robot Manipulation?

    Jun 2, 2026Tianchong Jiang, Xiangshan Tan, Samuel Wheeler +3Benchmark DesignBenchmark Contamination