Synthetic Benchmark Generation

Latest papers 213

All topics
CardsList
  1. CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

    Jul 9, 2026Andrej Leban, Yuekai SunStructural Causal ModelsAI Agent Benchmarks

  2. MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning

    Jul 8, 2026Charbel Al Bateh, Samer SaabMathematical Reasoning BenchmarksSynthetic Benchmark Generation

  3. Measuring Intelligence Beyond Human Scale

    Jul 8, 2026Jerry Han, Rafael Moschopoulos, Ella Colby +6LLM EvaluationAI Agent Evaluation

  4. PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation

    Jul 7, 2026Yuhang Wu, Shuxiang Zhang, Wee Hian Ching +2Image GenerationSynthetic Benchmark Generation

  5. Towards Diverse and Comprehensive Benchmarks for Mutual Information Estimation

    Jul 3, 2026Alberto Foresti, Ivan Butakov, Alexander Tolmachev +3Copula ModelsBenchmark Design

  6. AgenticDataBench: A Comprehensive Benchmark for Data Agents

    Jul 2, 2026Zhaoyan Sun, Shan Zhong, Daizhou Wen +10LLM Agent EvaluationAI Agent Benchmarks

  7. Aionoscope: Debugging Latent-State Accessibility in Time-Series Representations

    Jul 1, 2026Alexander Chemeris, Ming Jin, Randall BalestrieroSynthetic Benchmark GenerationTime Series Representation Learning

  8. Timesynth: A Temporal Fidelity Framework for Health Signal Digital Twins

    Jul 1, 2026Md Rakibul Haque, Shireen Elhabian, Warren Woodrich PettineTime Series ForecastingForecasting Benchmarks

  9. AlgoBench: Benchmarking Algorithmic Adaptation in Code Generation

    Jun 30, 2026Xinyuan Song, Zekun Cai, Liang ZhaoSynthetic Benchmark GenerationCode Generation Evaluation

  10. SFBench: The SciFy Scientific Feasibility Benchmark

    Jun 28, 2026Cash Costello, James Mayfield, Elsbeth Turcan +7LLM EvaluationBenchmark Design

  11. Diff-Based Code Corruption using LLMs for Large-Scale Bugfix Benchmarking

    Jun 27, 2026Balázs Szalontai, Ábel Szauter, Balázs Márton +3Software EngineeringAutomated Program Repair

  12. NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models

    Jun 25, 2026Henry Shaowu Yuchi, Michal Kucer, Benjamin H. Sims +2LLM EvaluationScientific QA

  13. NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

    Jun 23, 2026Yuru Wang, Lejun Cheng, Yuxin Zuo +14AI for ScienceCoding Agents

  14. Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners

    Jun 23, 2026Anirban Das, Joanne Boisson, Irtaza Khalid +2Relational ReasoningSynthetic Benchmark Generation

  15. PROTECT-90: A Fault Dataset for Power System Protection

    Jun 23, 2026Julian Oelhaf, Georg Kordowich, Christian Bergler +3Benchmark DesignSynthetic Benchmark Generation

  16. A Synthetic Reliability-Aware PINN Benchmark for Offshore Wind Turbine Support-Structure Monitoring with Bayesian Inverse Identification

    Jun 23, 2026Puneet Kant, Monika TanwarNeural Surrogate ModelingBayesian Inverse Problems

  17. ELADO: Elliptic PDE Assessment Datasets for Operator Learning

    Jun 18, 2026Frank Ehebrecht, Toni Scharle, Martin AtzmuellerSynthetic Benchmark GenerationPDE Operator Learning

  18. QMFOL: Benchmarking Large Language Model Reasoning via Quantifiable Monadic First-Order Logic Test Case Generation

    Jun 18, 2026Xinyi Zheng, Ling Shi, Tianlong Yu +3Logical ReasoningLLM Evaluation

  19. Source-Grounded Data Generation for Text-to-JSON Learning

    Jun 18, 2026Sunghee Ahn, Guijin Son, Youngjae YuGrounded Text GenerationSynthetic Data Generation

  20. ForecastBench-Sim: A Simulated-World Forecasting Benchmark

    Jun 17, 2026Jaeho Lee, Nick Merrill, Ezra KargerForecasting BenchmarksProbabilistic Forecasting

  21. DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models

    Jun 17, 2026Patrick Cooper, Alvaro VelasquezLLM EvaluationAbductive Reasoning