Benchmark Validity

Momentum

15 papers in the last four weeks, up 114% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 117

All topics
CardsList
  1. Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks

    Jul 29, 2026Jeff Mohl, Nelson Gardner-Challis, Magda Dubois +6Benchmark AuditingAI Agent Benchmarks

  2. Success Is Not Self-Explanatory: Auditing Success Provenance in Agent Evaluation

    Jul 27, 2026Jingkun Luo, Da-Tian PengData ProvenanceBenchmark Auditing

  3. Charging Phase Health Indicators for Battery State-of-Health Estimation: A Systematic Comparison of CC, CV, and Combined Approaches under Cross-Battery Validation

    Jul 26, 2026Huy Hoang Le, Kim-Anh NguyenBenchmark ValidityLithium-Ion Batteries

  4. When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability

    Jul 9, 2026Zongyou Yang, Yinghan Hou, Xiaokun YangLLM-as-a-JudgeLLM Auditing

  5. Towards Standardized Light Field Quality Assessment: Hybrid Subjective Benchmarking and Objective Metric Evaluation

    Jul 3, 2026Saeed Mahmoudpour, Mylene C. Q. Farias, Gi-Mun Um +6Pairwise ComparisonBenchmark Validity

  6. Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits

    Jul 1, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangAI AssuranceBenchmark Auditing

  7. Validating Causal Abstraction Metrics on Simulated Complex Systems

    Jun 30, 2026Maxime Méloux, Tiago Pimentel, François Portet +1Causal AbstractionBenchmark Validity

  8. Exploring Differences Between Tabular Enterprise Data and Public Benchmarks

    Jun 29, 2026Myung Jun Kim, Maximilian Schambach, Frank Essenberger +2Benchmark DesignTabular ML

  9. EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures

    Jun 29, 2026Buğra Alperen Uluırmak, Rifat KurbanAI AlignmentLLM Safety Alignment

  10. Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving

    Jun 28, 2026Pawan Sasanka Ammanamanchi, Siddharth Bhat, Stella BidermanBenchmark DesignBenchmark Validity

  11. Pooled Leaderboards Hide System-Specific Winners: A Reporting-Protocol Audit of Offline Root-Cause Analysis Benchmarks

    Jun 28, 2026Lining Hu, Ting Liu, Yuzhuo FuPairwise ComparisonAlgorithmic Auditing

  12. Life After Benchmark Saturation: A Case Study of CORE-Bench

    Jun 23, 2026Nitya Nadgir, Sayash Kapoor, Kangheng Liu +11OOD GeneralizationAI Agent Evaluation

  13. MassSpecGym in the Wild: Uncovering and Correcting Evaluation Pitfalls in AI-Driven Molecule Discovery

    Jun 17, 2026Hongxuan Liu, Roman Bushuiev, Ivy Lightheart +12Benchmark DesignBenchmark Contamination

  14. Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias

    Jun 17, 2026Justin D. Norman, Michael U. Rivera, D. Alex HughesInter-Rater ReliabilityLLM Evaluation

  15. LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation

    Jun 14, 2026Hiroyasu Usami, Keisuke Hara, Ayato Tsuboi +1LLM EvaluationLLM-as-a-Judge

  16. Crossing the Validation Crisis: Cross-Validation Reduces Benchmarking Variance Surprisingly Well

    Jun 10, 2026Célestin Eve, Gaël Varoquaux, Thomas MoreauBenchmark ValidityVariance Reduction

  17. ERBench: A Benchmark and Testsuite for Equation Discovery Algorithms

    Jun 8, 2026Paul Kahlmeyer, Henrik Voigt, Michael Habeck +1Benchmark DesignScientific Discovery

  18. SC3: The Multi-Solvent Solubility Challenge and Benchmark

    Jun 3, 2026Vansh Ramani, Har Ashish Arora, Dhairya Kuchhal +4Benchmark ConstructionBenchmark Validity

  19. What Are We Actually Benchmarking in Robot Manipulation?

    Jun 2, 2026Tianchong Jiang, Xiangshan Tan, Samuel Wheeler +3Benchmark DesignBenchmark Contamination