Benchmark Design

Latest papers 285

All topics
CardsList
  1. Healthcare LLM Benchmarks Are Only as Good as Their Explicit Assumptions

    May 21, 2026Naveen Raman, Santiago Cortes-Gomez, Mateo Dulce Rubio +2HealthcareBenchmark Design

  2. ShapeBench: A Scalable Benchmark and Diagnostic Suite for Standardized Evaluation in Aerodynamic Shape Optimization

    May 20, 2026Shaghayegh Fazliani, Krissh Chawla, Jack Guo +3Benchmark Design

  3. Text2CAD-Bench: A Benchmark for LLM-based Text-to-Parametric CAD Generation

    May 18, 2026Liang Wang, Heng Meng, Zekai Xiang +4Benchmark DesignParametric CAD Modeling

  4. BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

    May 18, 2026Zhensheng Wang, Wenmian Yang, Qingtai Wu +3Quantitative FinanceBenchmark Design

  5. MagBridge-Battery: A Synthetic Bridge Dataset for Li-ion Magnetometry and State-of-Health Diagnostics

    May 17, 2026Sakthi Prabhu Gunasekar, Prasanna Kumar RangarajanBenchmark DesignSynthetic Data Generation

  6. BoLT: A Benchmark to Democratize Black-box Optimization Research for Expensive LLM Tasks

    May 16, 2026Ruth Wan Theng Chew, Zhiliang Chen, Apivich Hemachandra +1Bayesian OptimizationBenchmark Design

  7. UniER: A Unified Benchmark for Item-level and Path-level Exercise Recommendation

    May 16, 2026Xinghe Cheng, Guiyong Zhuang, Yusheng Xie +5Benchmark DesignRecommender Systems

  8. ShopGym: An Integrated Framework for Realistic Simulation and Scalable Benchmarking of E-Commerce Web Agents

    May 15, 2026Chinmay Savadikar, Mingyu Zhao, Yuanzheng Zhu +5Benchmark DesignWeb Agent Benchmarks

  9. Breakeven complexity: A new perspective on neural partial differential equation solvers

    May 14, 2026Yijing Zhang, Nicholas Roberts, Tanya Marwah +1Neural PDE SolversBenchmark Design

  10. TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

    May 14, 2026Pei Yang, Wanyi Chen, Tongyun Yang +15Benchmark DesignLLM Agent Evaluation

  11. Unsteady Metrics and Benchmarking Cultures of AI Model Builders

    May 13, 2026Stefan Baack, Christo Buschek, Maty BohacekLLM EvaluationBenchmark Design

  12. A Benchmark for Early-stage Parkinson's Disease Detection from Speech

    May 13, 2026Terry Yi Zhong, Cristian Tejedor-Garcia, Khiet P. Truong +3Benchmark DesignSpeech Processing

  13. Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics

    May 13, 2026Moritz Firsching, Paul Lezeau, Salvatore Mercuri +8Mathematical Reasoning BenchmarksAutomated Theorem Proving

  14. Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models

    May 12, 2026Mohammed Saidul Islam, Negin Baghbanzadeh, Farnaz Kohankhaki +5LLM EvaluationBenchmark Design

  15. MLCommons Chakra: Advancing Performance Benchmarking and Co-design using Standardized Execution Traces

    May 11, 2026Srinivas Sridharan, Theodor-Adrian Badea, Andy Balogh +26Benchmark DesignHardware-Software Co-Design

  16. V4FinBench: Benchmarking Tabular Foundation Models, LLMs, and Standard Methods on Corporate Bankruptcy Prediction

    May 11, 2026Marcin Kostrzewa, Sebastian Tomczak, Roman Furman +5Class-Imbalanced LearningTabular Foundation Models

  17. BEACON: A Multimodal Dataset for Learning Behavioral Fingerprints from Gameplay Data

    May 11, 2026Ishpuneet Singh, Gursmeep Kaur, Uday Pratap Singh Atwal +3Biometric IdentificationBenchmark Design

  18. PlantMarkerBench: A Multi-Species Benchmark for Evidence-Grounded Plant Marker Reasoning

    May 11, 2026Sajib Acharjee Dip, Song Li, Liqing ZhangLLM EvaluationEvidence-Grounded Reasoning

  19. An Executable Benchmarking Suite for Tool-Using Agents

    May 10, 2026Zhiqing Zhong, Zhijing Ye, Jiamin Wang +1Computer-Use Agent BenchmarksTool-Use Evaluation

  20. PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

    May 10, 2026Zhen Hang, Yushan Yashengjiang, Junhui Li +21PDE SolvingBenchmark Design

  21. TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

    May 10, 2026Yize Li, Junzhi Li, Jason Song +3LLM EvaluationTool-Use Evaluation