Benchmark Design

Latest papers 285

All topics
CardsList
  1. Results and Retrospective Analysis of the CODS 2025 AssetOpsBench Challenge

    May 8, 2026Dhaval Patel, Chathurangi Shyalika, Suryanarayana Reddy Yarrabothula +4Competitive AnalysisMulti-Agent Orchestration

  2. NeuralBench: A Unifying Framework to Benchmark NeuroAI Models

    May 8, 2026Hubert Banville, Stéphane d'Ascoli, Simon Dahan +12Benchmark DesignEEG Decoding

  3. Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare

    May 8, 2026Prasanna Desikan, Harshit Rajgarhia, Shivali Dalmia +1HealthcareBenchmark Design

  4. PolySQL: Scaling Text-to-SQL Evaluation Across SQL Dialects via Automated Backend Isomorphism

    May 8, 2026Yotam Perlitz, Elad Venezian, Corentin Royer +2Benchmark DesignText-to-SQL

  5. Have Graph -- Will Lift? The Case for Higher-Order Benchmarks

    May 8, 2026Bastian RieckBenchmark Design

  6. Benchmarking Fairness in Spiking Neural Networks: Data Bias, Spurious Features, and Hardware Effects

    May 8, 2026Hudi He, Fukun Wang, Zhe Wang +7Benchmark DesignAlgorithmic Fairness

  7. DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models

    May 7, 2026Juntong Wang, Jiarui Wang, Huiyu Duan +3Learning to RankBenchmark Design

  8. iPhoneBlur: A Difficulty-Stratified Benchmark for Consumer Device Motion Deblurring

    May 7, 2026Abdullah Al Shafi, Kazi Saeed AlamImage DeblurringBenchmark Design

  9. Towards Reliable LLM Evaluation: Correcting the Winner's Curse in Adaptive Benchmarking

    May 7, 2026Yang Xu, Jiefu Zhang, Haixiang Sun +3LLM EvaluationSelective Inference

  10. AirQualityBench: A Realistic Evaluation Benchmark for Global Air Quality Forecasting

    May 7, 2026Xing Xu, Xu Wang, Yudong Zhang +3Benchmark DesignTime Series Forecasting

  11. The First Controllable Bokeh Rendering Challenge at NTIRE 2026

    May 6, 2026Tim Seizinger, Florin-Alexandru Vasluianu, Jeffrey Chen +23Benchmark DesignNeural Rendering

  12. Regime-Conditioned Evaluation in Multi-Context Bayesian Optimization

    May 6, 2026Noel ThomasCausal Effect EstimationConditional Average Treatment Effect Estimation

  13. BenCSSmark: Making the Social Sciences Count in LLM Research

    May 6, 2026Arnault Chatelain, Étienne Ollion, Qianwen Guan +7LLM EvaluationBenchmark Design

  14. Raising the Ceiling: Better Empirical Fixation Densities for Saliency Benchmarking

    May 5, 2026Susmit Agrawal, Jannis Hollman, Matthias KümmererBenchmark DesignEye Tracking

  15. ProtDBench: A Unified Benchmark of Protein Binder Design and Evaluation

    May 5, 2026Cong Liu, Milong Ren, Jiaqi Guan +4Protein Structure PredictionBenchmark Construction

  16. LUMINA: A Grid Foundation Model for Benchmarking AC Optimal Power Flow Surrogate Learning

    May 4, 2026Hongwei Jin, Keunju Song, Zeeshan Memon +5Neural Surrogate ModelingBenchmark Design

  17. RenCon 2025: Revival of the Expressive Performance Rendering Competition

    May 3, 2026Huan Zhang, Taegyun Kwon, Anders Friberg +7Benchmark Design

  18. RamanBench: A Large-Scale Benchmark for Machine Learning on Raman Spectroscopy

    May 3, 2026Mario Koddenbrock, Christoph Lange, Robin Legner +6Benchmark DesignScientific ML

  19. PHBench: A Benchmark for Predicting Startup Series A Funding from Product Hunt Launch Signals

    May 3, 2026Yagiz Ihlamur, Ben Griffin, Rick ChenBenchmark DesignFinance

  20. PepSpecBench: A Unified Evaluation Benchmark for Peptide Tandem Mass Spectrometry Prediction

    May 3, 2026Zhiwen Yang, Pan Liu, Yifan Li +2Benchmark DesignBenchmark Contamination

  21. StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models

    May 3, 2026Yongrui Chen, Yangyang Ma, Xiaoying Huang +4LLM EvaluationBenchmark Design

  22. VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning

    May 3, 2026Zi-Yi Jia, Zi-Jian Cheng, Xin-Yue Zhang +4Benchmark DesignMultimodal Model Evaluation

  23. Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs

    May 1, 2026Jasper Dekoninck, Nikola Jovanović, Tim Gehrunger +4Mathematical Reasoning BenchmarksLLM Evaluation

  24. RESTestBench: A Benchmark for Evaluating the Effectiveness of LLM-Generated REST API Test Cases from NL Requirements

    Apr 28, 2026Leon Kogler, Stefan Hangler, Maximilian Ehrhart +3Automated Software TestingBenchmark Design