Synthetic Benchmark Generation

Latest papers 213

All topics
CardsList
  1. Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training

    Aug 26, 2026Qiankai Xu, Qiguang Chen, Zixin Su +4Long-Form Document GenerationSynthetic Benchmark Generation

  2. ππ-SUB: A Physics-Informed Synthetic Underwater Benchmark Dataset for Underwater Image Enhancement

    Aug 11, 2026Namritha Lasyapriya Maddali, Rajini Makam, Suresh Sundaram +1Underwater Image EnhancementUnderwater Imaging

  3. Beyond Tables: Doc2DB-Bench for Relationally Faithful Document-to-Database Construction

    Aug 9, 2026Zhuowen Liang, Zhengxuan Zhang, Jiayang Wang +2Document Information ExtractionSynthetic Benchmark Generation

  4. SABRE: Scalable and Automated Benchmarking of VLMs under Stress

    Aug 7, 2026Zixuan Lan, Luzhe Sun, Matthew R. Walter +1VLM EvaluationVLM Robustness

  5. Ask-E: An Environment for Calibrated Question Generation

    Aug 7, 2026Sarah Pratt, Jae Sung Park, Scott Geng +1Mathematical Reasoning BenchmarksSynthetic Benchmark Generation

  6. Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints

    Aug 6, 2026Omid Bazgir, Md Nasir, Jacob Hoffman +6Synthetic Benchmark GenerationBenchmark Validity

  7. Recursive Synthesis for Long-Horizon Terminal Tasks

    Aug 5, 2026Zhongzhi Li, Yucheng Shi, Zongxia Li +8Terminal AgentsSynthetic Benchmark Generation

  8. LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs

    Aug 5, 2026Jiahao Zhang, Yongzhi Tong, Zelin Fu +4LLM EvaluationLLM Personalization

  9. From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution

    Aug 3, 2026Can Wang, Haoran Chen, Haowen Gao +3LLM EvaluationBenchmark Design

  10. Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models

    Aug 2, 2026Fali Wang, Ali Al-Lawati, Iliyas Bektas +5LLM EvaluationLLM Reasoning with Graphs

  11. AdvPlan-Bench: Adversarial Evaluation of Structured Plan-Generation Agents

    Aug 1, 2026Alina Kapanova, Arun Kanhai, Natan Vidra +1AI Agent BenchmarksSynthetic Benchmark Generation

  12. InferQ: A Database-Oriented Benchmark for Quantum Circuits Simulation

    Jul 31, 2026Andrei Ilinescu, Aadi Patwardhan, Rihan HaiBenchmark DesignSynthetic Benchmark Generation

  13. Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement of Symbolic Discovery

    Jul 30, 2026Zhan'ao Yao, Liang Yin, Zhihao Gao +9Synthetic Benchmark GenerationData Contamination in Language Models

  14. DoTime: A Synthetic Benchmark Generator for Interventional and Counterfactual Time Series

    Jul 29, 2026Dennis Thumm, Billy Tim Anthony, Ying ChenCounterfactual EvaluationStructural Causal Models

  15. E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

    Jul 26, 2026Weihuang Zheng, Tianyuan Zou, Eileen Ye +5Computer-Use Agent BenchmarksTool-Use Evaluation

  16. Benchmarking Text-to-SQL under Role-Based Access Control

    Jul 24, 2026Yang Fei, Yangfan Jiang, Yin Yang +1Text-to-SQLSynthetic Benchmark Generation

  17. SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data

    Jul 22, 2026Zenghui Zhou, Xiaoyang Li, Xiaoxuan Qiao +2Synthetic Data GenerationAgent Evaluation

  18. SAGA: Synthetic Agentic Graph Architecture for Temporal Benchmark Generation

    Jul 19, 2026Jiacheng Ding, Xiaofei ZhangSynthetic Data GenerationSynthetic Benchmark Generation

  19. ReqGenX: An Empirical Study of Atomic Decomposition, Artifact Regeneration, and Reconstruction for Legacy SRS Documents

    Jul 18, 2026Ragib Shahariar Ayon, Rayed Fahmi, Sumon Biswas +1Requirements EngineeringSynthetic Data Generation

  20. MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection

    Jul 16, 2026Goktug OzkanSynthetic Benchmark GenerationAI Safety Evaluation

  21. ChronoQG: Towards a Temporally Expressive and Hop-Bounded Benchmark for Temporal Knowledge Graph Question Generation

    Jul 16, 2026Xuemeng Liu, Zhengpin Li, Wanpeng Tang +2Synthetic Benchmark GenerationTemporal KGs

  22. The Test Oracle Problem in Synthetic LLM-as-Judge Corpora: Disappearance, Distortion and a Validation Protocol

    Jul 15, 2026Serkan BallıMultilingual Language Model EvaluationLLM-as-a-Judge

  23. SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

    Jul 11, 2026Abhigya Verma, Khyati Mahajan, Amit Kumar Saha +4VLM EvaluationVision-Language Models

  24. SYNRARE: Synthetic Rare Disease EHR Generation for ML Benchmarking

    Jul 10, 2026Nicolai Dinh Khang Truong, Richard RöttgerRare Disease DiagnosisSynthetic Data Generation