Benchmark Design

Latest papers 285

All topics
CardsList
  1. A reproducible and extensible framework for benchmarking competing risks survival models

    Jul 31, 2026Begoña B. Sierra, Colin McLean, Peter S. Hall +2Benchmark DesignSurvival Analysis

  2. ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models

    Jul 31, 2026Penglin Zhu, Jungang XuLLM EvaluationPairwise Comparison

  3. InferQ: A Database-Oriented Benchmark for Quantum Circuits Simulation

    Jul 31, 2026Andrei Ilinescu, Aadi Patwardhan, Rihan HaiBenchmark DesignSynthetic Benchmark Generation

  4. LayoutBench: Performance Benchmarking of Cloud Storage Layouts for Multimedia Data

    Jul 30, 2026Debopam Sanyal, Hongjie Chen, Alexey Tumanov +1Benchmark DesignCloud Computing

  5. Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents

    Jul 29, 2026Jiwon Jang, Kisu Yang, Heuiseok Lim +1AI Agent ReliabilityBenchmark Design

  6. NeoRacer: An Open, Standardized 1:12 Scale Autonomous Race Car for Benchmarking and Education

    Jul 29, 2026Koneshka Bandyopadhyay, Ansh Mehta, Bassel El Mabsout +1Benchmark DesignAutonomous Racing

  7. PlatformBid: An Auto-Bidding Benchmark from a Unified Advertising Platform's Perspective

    Jul 29, 2026Shengtian Yang, Yewen Li, Peng Jiang +5Benchmark DesignAutomated Bidding

  8. AMPBench-MT: A Homology-Controlled Benchmark for Antimicrobial Peptide Potency, Spectrum, and Safety Prediction

    Jul 28, 2026Ziheng Zhou, Huiyu Luo, Xiaohu Zhu +4Benchmark DesignToxicity Detection

  9. GraphRareBench: An Auditable Graph-Evidence Benchmark for Phenotype-Driven Rare-Disease Diagnosis

    Jul 27, 2026Guiling Guo, Jia Yang, Jiahao Xu +3Rare Disease DiagnosisBenchmark Design

  10. DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents

    Jul 24, 2026Junming Chen, Junyang Jiang, Xu Chen +2Benchmark DesignAI Agent Benchmarks

  11. CEL: Comprehensive Counterfactual Explanations Library and Benchmark

    Jul 24, 2026Oleksii Furman, Łukasz Lenkiewicz, Marcel Musiałek +1Counterfactual EvaluationExplainable Artificial Intelligence

  12. WaveformQA: Benchmarking LLM Temporal Reasoning on Digital Waveforms

    Jul 22, 2026Yichuan Liu, Daniel Cummings, Nick VadlamudiLLM EvaluationTime Series QA

  13. KernelGenBench: Can LLMs and Agents Write Efficient Kernels Across Operator Sources and Hardware Platforms?

    Jul 22, 2026Peiyu Zang, Jian Tao, Jialing Zhang +4GPU Kernel OptimizationBenchmark Design

  14. CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents

    Jul 18, 2026Peilong Zhou, Zhirong Chen, Cangyuan Li +4Benchmark DesignElectronic Design Automation

  15. Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning

    Jul 17, 2026Ajay Patel, Kartik Hosanagar, Ramayya Krishnan +2LLM EvaluationBenchmark Design

  16. CFM-Bench: A Unified Multi-Domain, Multi-Task Benchmark for Channel Foundation Models

    Jul 16, 2026Yuan Gao, Wenjun Yu, Jun Jiang +3Wireless Foundation ModelsBenchmark Design

  17. The 2nd International StepUP Competition for Biometric Footstep Recognition: From Steps to Strides

    Jul 15, 2026Robyn Larracy, Anant Gupta, Gourav Gupta +8Biometric IdentificationBenchmark Design

  18. AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

    Jul 13, 2026Lingkai Kong, Zijian Wu, Yuzhe Gu +11Mathematical Reasoning BenchmarksAutomated Theorem Proving

  19. AutoMatBench: An Automatic Optimization Toolkit for the Acceleration of Material Properties Prediction Benchmarking

    Jul 13, 2026Hongxiao Li, Wanling GaoBenchmark DesignOOD Generalization

  20. An Empirical Study for Android-to-OpenHarmony GUI Test Migration

    Jul 13, 2026Yakun Zhang, Xinjia Chen, Yiyun Chen +6Mobile GUI AutomationAutomated Software Testing

  21. BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

    Jul 6, 2026Tianwen Zhu, Hao Wang, Yonggang WenRUL EstimationBenchmark Design