Benchmark Design

Latest papers 285

All topics
CardsList
  1. REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation

    Jun 17, 2026Tengjie Lin, Yutao Sun, Jingwei Ni +7VLM EvaluationVisual Question Answering

  2. MetaboNet-Bench: A Multi-modal Benchmark for Glucose Forecasting in Type 1 Diabetes

    Jun 17, 2026Nathaniel Jeffries, Miriam Wolff, Sam Royston +5Multivariate Time Series ForecastingType 1 Diabetes

  3. SP-TransientBench: A Real-Captured Single Photon Perception Benchmark

    Jun 16, 2026Hongzhou Dong, Zili Zhang, Ziting Wen +12Benchmark DesignDepth Estimation

  4. Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

    Jun 16, 2026Maria I. Gorinova, Macey Baker, Amy Heineike +3AI Coding AgentsBenchmark Design

  5. RecourseBench: A Modular Framework for Reproducible Algorithmic Recourse Evaluation

    Jun 15, 2026Zahra Khotanlou, Hashir Ahmed, Chenghao Tan +2Benchmark DesignAutomated Evaluation

  6. FinBalance: A Multi-Document Accounting Reconciliation Benchmark

    Jun 14, 2026Sasank Tumpati, Devansh Agarwal, Ayush Kedia +6Financial ServicesLLM Evaluation

  7. EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments

    Jun 11, 2026Jundong Xu, Qingchuan Li, Jiaying Wu +11Benchmark DesignLong-Horizon Agent Evaluation

  8. How Fine-Grained Should a RAG Benchmark Be? A Hierarchical Framework for Synthetic Question Generation

    Jun 11, 2026Chase M. Fensore, Kaustubh Dhole, Jason Fan +2Benchmark DesignSynthetic Data Generation

  9. Intelligent Automation for Embodied Benchmark Construction: Pipelines, Embodiments, Simulators, and Trends

    Jun 10, 2026Jinshan Lai, Jianwei Hu, Baoyang Jiang +7Benchmark ConstructionBenchmark Design

  10. ComBench: A Benchmark for Rigorous Proof Reasoning and Constructive Realization in Olympiad-Level Combinatorics

    Jun 9, 2026Shunkai Zhang, Haoran Zhang, Yun Luo +15Mathematical Reasoning BenchmarksBenchmark Design

  11. TheoremBench: Evaluating LLMs on Theorem Proving in Formal Mathematics

    Jun 8, 2026QuocViet Pham, Elvir Karimov, Andrey Galichin +1Mathematical Reasoning BenchmarksLLM Evaluation

  12. ERBench: A Benchmark and Testsuite for Equation Discovery Algorithms

    Jun 8, 2026Paul Kahlmeyer, Henrik Voigt, Michael Habeck +1Benchmark DesignScientific Discovery

  13. RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models

    Jun 8, 2026Jing Wang, Shang Liu, Wenji Fang +3LLM EvaluationBenchmark Design

  14. PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems

    Jun 7, 2026Suraj Ranganath, Anish RaghavendraBenchmark DesignText-to-Cypher

  15. Bradley-Terry Rankings for Recommender Systems Across Dataset Taxonomies

    Jun 5, 2026Ekaterina Grishina, Stepan Kuznetsov, Askar Tsyganov +8Algorithm SelectionPairwise Comparison

  16. Decision-Aware Evaluation of Physics-Informed Surrogates

    Jun 5, 2026Daniel Cieślak, Andrzej CzyżewskiSurrogate ModelingBenchmark Design

  17. Benchmark Everything Everywhere All at Once

    Jun 4, 2026Shiyun Xiong, Dongming Wu, Peiwen Sun +5LLM EvaluationBenchmark Design

  18. TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework

    Jun 4, 2026Bobby Yan, Fredrik KjolstadAI Coding AgentsBenchmark Design

  19. GENEB: Why Genomic Models Are Hard to Compare

    Jun 3, 2026Daria Ledneva, Mikhail Nuridinov, Denis KuznetsovBenchmark DesignGenomics

  20. Measuring What Matters: Synthetic Benchmarks for Concept Bottleneck Models

    Jun 3, 2026Julian Skirzynski, Harry Cheon, Shreyas Kadekodi +2Concept Bottleneck ModelsBenchmark Design

  21. What Are We Actually Benchmarking in Robot Manipulation?

    Jun 2, 2026Tianchong Jiang, Xiangshan Tan, Samuel Wheeler +3Benchmark DesignBenchmark Contamination

  22. HighTide: An Agent-Curated Open-Source VLSI Benchmark Suite

    Jun 2, 2026Benjamin Goldblatt, Paolo Pedroso, Farhad Modaresi +2Benchmark DesignElectronic Design Automation

  23. BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents

    Jun 2, 2026Alex Wang, Georg Meinhardt, Jacob Katz +4Benchmark DesignFinancial QA

  24. CityTrajBench: A Unified Benchmark for City-Scale Vehicle Trajectory Generation

    Jun 1, 2026Shibo Zhu, Xiaodan Shi, Dayin Chen +4Trajectory GenerationBenchmark Design

  25. Graph Instance Landscapes: When Structural Similarity Does (Not) Reflect Shortest-Path Performance

    Jun 1, 2026Maryam Gholami Shiri, Ivana Krminac, Marko Djukanović +3Benchmark Design

  26. OmniEEG-Bench: A Standardized Evaluation Benchmark for EEG Foundation Models

    May 30, 2026Ziling Lu, Zongsheng Li, Xinke Shen +11Brain-Computer InterfacesBenchmark Design