Synthetic Benchmark Generation

Latest papers 213

All topics
CardsList
  1. CogScale: Scalable Benchmark for Sequence Processing

    May 19, 2026Yannis Bendi-Ouis, Romain de Coudenhove, Xavier HinautRecurrent Neural NetworksSynthetic Benchmark Generation

  2. The MixCount Dataset: Bridging the Data Gap for Open-Vocabulary Object Counting

    May 18, 2026Corentin Dumery, Niki Amini-Naieni, Shervin Naini +1Synthetic Data AugmentationObject Counting

  3. TextClusterLab: An Integrated Framework for Reliable Text Clustering Studies

    May 17, 2026Daoming Wan, Yizheng Huang, Jimmy X. HuangClusteringSynthetic Data Generation

  4. A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation

    May 17, 2026Qingchuan Ma, Yuexiao Ma, Yongkang Xie +3LLM EvaluationSynthetic Benchmark Generation

  5. Stress-Testing Neural Network Verifiers with Provably Robust Instances

    May 16, 2026David Troxell, Yulia Alexandr, Sofia Hunt +2Neural Network VerificationNeural Network Robustness

  6. ShopGym: An Integrated Framework for Realistic Simulation and Scalable Benchmarking of E-Commerce Web Agents

    May 15, 2026Chinmay Savadikar, Mingyu Zhao, Yuanzheng Zhu +5Benchmark DesignWeb Agent Benchmarks

  7. General-Purpose Co-Evolutionary Construction of Parallel Algorithm Portfolios for Multi-Objective Binary Optimization

    May 15, 2026Zhiyuan Wang, Shengcai Liu, Shaofeng Zhang +1Multi-Objective Evolutionary OptimizationSynthetic Benchmark Generation

  8. Orthologic for SAT Solving

    May 14, 2026Vladislas de Haldat, Simon Guilloud, Viktor KunčakLogical ReasoningAutomated Theorem Proving

  9. FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale

    May 14, 2026Runyuan He, Qiuyang Mang, Shang Zhou +14Synthetic Benchmark GenerationSynthetic Data Generation for Language Models

  10. NodeSynth: Socially Aligned Synthetic Data for AI Evaluation

    May 14, 2026Qazi Mamunur Rashid, Xuan Yang, Zhengzhe Yang +5Language Model Generation EvaluationLanguage Model Safety Evaluation

  11. Synthesizing the Expert: A Validated Multimodal Dataset for Trustworthy AI-Assisted Swimming Coaching

    May 12, 2026Ahmad Al-Kabbany, Esraa KassemMultimodal RAGSynthetic Benchmark Generation

  12. ISOMORPH: A Supply Chain Digital Twin for Simulation, Dataset Generation, and Forecasting Benchmarks

    May 12, 2026Zhizhen Zhang, Hyemin Gu, Benjamin J. Zhang +6Zero-Shot Time Series ForecastingForecasting Benchmarks

  13. Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models

    May 12, 2026Mohammed Saidul Islam, Negin Baghbanzadeh, Farnaz Kohankhaki +5LLM EvaluationBenchmark Design

  14. MM-OptBench: A Solver-Grounded Benchmark for Multimodal Optimization Modeling

    May 12, 2026Zhong Li, Qi Huang, Yuxuan Zhu +6Multimodal OptimizationSynthetic Benchmark Generation

  15. MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

    May 12, 2026Yihao Wang, Haoran Xu, Renjie Gu +10Agent MemoryHealthcare

  16. ChaosNetBench: Benchmarking Spatio-Temporal Graph Neural Networks on Chaotic Lattice Dynamics

    May 10, 2026Henok Tenaw Moges, Charalampos Skokos, Deshendran MoodleyForecasting BenchmarksSynthetic Benchmark Generation

  17. Generating Leakage-Free Benchmarks for Robust RAG Evaluation

    May 9, 2026Jiayi Liu, Jiaxing Zhang, Bowen Jin +1Benchmark ContaminationSynthetic Benchmark Generation

  18. MathConstraint: Automated Generation of Verified Combinatorial Reasoning Instances for LLMs

    May 8, 2026Viresh Pati, Zhengyu Li, Piyush Jha +3Mathematical Reasoning BenchmarksSynthetic Benchmark Generation

  19. SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios

    May 8, 2026Jackson Clark, Yiming Su, Saad Mohammad Rafid Pial +5Software EngineeringAI Agent Benchmarks

  20. CarCrashNet: A Large-Scale Dataset and Hierarchical Neural Solver for Data-Driven Structural Crash Simulation

    May 8, 2026Mohamed Elrefaie, Dule Shu, Matthew Klenk +1Neural Surrogate ModelingStructural Mechanics

  21. MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

    May 7, 2026Ashwani Anand, Ivi Chatzi, Ritam Raha +1Computer-Use Agent BenchmarksAI Agent Reliability

  22. iTRIALSPACE: Programmable Virtual Lesion Trials for Controlled Evaluation of Lung CT Models

    May 7, 2026Fakrul Islam Tushar, Umme Hafsa Momy, Joseph Y. Lo +1VLM EvaluationRadiology VLMs

  23. Orchestrating Spatial Semantics via a Zone-Graph Paradigm for Intricate Indoor Scene Generation

    May 4, 2026Meisheng Zhang, Shizhao Sun, Yang Zhao +33D SGGSynthetic Benchmark Generation

  24. LabBuilder: Protocol-Grounded 3D Layout Generation for Interactable and Safe Laboratory

    May 4, 2026Jianbao Cao, Zhangrui Zhao, Bohan Feng +15Synthetic Benchmark Generation3D Scene Generation

  25. StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models

    May 3, 2026Yongrui Chen, Yangyang Ma, Xiaoying Huang +4LLM EvaluationBenchmark Design

  26. D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery

    Apr 30, 2026Hanane Nour Moussa, Yifei Li, Zhuoyang Li +7AI Agents for Scientific DiscoveryAI Agent Benchmarks

  27. RuC: HDL-Agnostic Rule Completion Benchmark Generation

    Apr 30, 2026Arnau Ayguadé Domingo, Miquel Alberti-Binimelis, Cristian Gutierrez-Gomez +5LLM EvaluationLLM Prompting

  28. Beyond the Training Distribution: Mapping Generalization Boundaries in Neural Program Synthesis

    Apr 30, 2026Henrik Voigt, Michael Habeck, Joachim GiesenOOD GeneralizationLLM-Based Program Synthesis