Benchmark Design

Latest papers 285

All topics
CardsList
  1. HamQASBench: A Hamiltonian-Informed Diagnostic Benchmark for Evaluating Quantum Architecture Search

    Jul 6, 2026Jiayang Niu, Akib Karim, Yan Wang +5Benchmark ConstructionBenchmark Design

  2. TabQueryBench: A Query-Centric Benchmark for Synthetic Tabular Data

    Jul 4, 2026Jialin Zhang, Fenghao Dong, Yajie Zhou +2Benchmark DesignSynthetic Tabular Data Generation

  3. Scientific Code Search at Scale: A Multi-Domain Dataset and Benchmark

    Jul 3, 2026Nishan Pantha, Pranath Reddy Kumbam, Sajil Awale +8Benchmark DesignInformation Retrieval

  4. Towards Diverse and Comprehensive Benchmarks for Mutual Information Estimation

    Jul 3, 2026Alberto Foresti, Ivan Butakov, Alexander Tolmachev +3Copula ModelsBenchmark Design

  5. TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution

    Jul 2, 2026Jiale Amber Wang, Kaiyuan Wang, Pengyu NieAutomated Software TestingBenchmark Design

  6. PACE: A Proxy for Agentic Capability Evaluation

    Jul 2, 2026Yueqi Song, Lintang Sutawika, Jiarui Liu +8Benchmark DesignLLM Agent Evaluation

  7. MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

    Jul 2, 2026Yuanzhi Liu, Shousheng Zhao, Bo Zhou +2VLM EvaluationBenchmark Construction

  8. Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

    Jul 1, 2026Zhi Chen, Zhensu Sun, Yuling Shi +2Benchmark AuditingBenchmark Design

  9. Exploring Differences Between Tabular Enterprise Data and Public Benchmarks

    Jun 29, 2026Myung Jun Kim, Maximilian Schambach, Frank Essenberger +2Benchmark DesignTabular ML

  10. CAN We Trust Your Results? A Cross-Dataset Study of Automotive IDS Evaluation

    Jun 29, 2026Beatrix Koltai, Gergely Acs, Andras GazdagBenchmark DesignNetwork Intrusion Detection

  11. MaDI-Bench: An End-to-End Data Integration Benchmark

    Jun 29, 2026Aaron Steiner, Ralph Peeters, Christian BizerBenchmark Design

  12. Beyond Drug Discovery: The Nanotechnology Molecular Optimization (NMO) Benchmark

    Jun 29, 2026Matthias Blaschke, Daniel Kienzle, Zsuzsanna Koczor-Benda +3Molecular OptimizationBenchmark Design

  13. SpreadsheetBench 2: Evaluating Agents on End-to-End Business Spreadsheet Workflows

    Jun 29, 2026Jian Zhu, Yuzheng Zhang, Zeyao Ma +11Benchmark DesignSpreadsheet Automation

  14. SFBench: The SciFy Scientific Feasibility Benchmark

    Jun 28, 2026Cash Costello, James Mayfield, Elsbeth Turcan +7LLM EvaluationBenchmark Design

  15. Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving

    Jun 28, 2026Pawan Sasanka Ammanamanchi, Siddharth Bhat, Stella BidermanBenchmark DesignBenchmark Validity

  16. Benchmarking on Tasks That Matter: Dataset Selection for Preserving Model Rankings

    Jun 26, 2026Rostislav Gusev, Alexey ZaytsevBenchmark Design

  17. Mosaic: A Benchmark Suite for Differentiable Physics Solvers

    Jun 26, 2026Andrin Rehmann, Heiko Zimmermann, Dion HäfnerAutomatic DifferentiationPDE Solving

  18. Evaluating LLMs on Real-World Software Performance Optimization

    Jun 24, 2026Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim +1Software EngineeringLLM Evaluation

  19. BCoughBench: Benchmarking Respiratory Acoustic Foundation Models Under Body-Coupled Wearable Sensor Conditions

    Jun 23, 2026Mayur Sanap, Prasanna Desikan, Edgar LobatonBenchmark DesignWearable Sensing

  20. PROTECT-90: A Fault Dataset for Power System Protection

    Jun 23, 2026Julian Oelhaf, Georg Kordowich, Christian Bergler +3Benchmark DesignSynthetic Benchmark Generation

  21. BehaviorBench: Benchmarking Foundation Models for Behavioral Science Tasks

    Jun 23, 2026Jin Huang, Yutong Xie, Wanli Song +4Benchmark DesignHuman Behavior Simulation

  22. EEG Benchmarking Needs a Task Specification Layer: NeuroDoc for Rulebook-Guided, Executable Benchmark Construction

    Jun 22, 2026Chengxuan Qin, Zhige Chen, Shu Peng +9ElectroencephalographyBenchmark Construction

  23. LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation

    Jun 19, 2026Xingyu Chen, Rui Wang, Zhaopeng Tu +1LLM EvaluationBenchmark Design

  24. JAMER: Project-Level Code Framework Dataset and Benchmark on Professional Game Engines

    Jun 18, 2026Jianwen Sun, Chuanhao Li, Zizhen Li +5Benchmark DesignCode Generation

  25. MassSpecGym in the Wild: Uncovering and Correcting Evaluation Pitfalls in AI-Driven Molecule Discovery

    Jun 17, 2026Hongxuan Liu, Roman Bushuiev, Ivy Lightheart +12Benchmark DesignBenchmark Contamination