Synthetic Data Evaluation

Latest papers 151

All topics
CardsList
  1. A Filtered Mixture-of-Generators for Fully Synthetic Survival Training

    Jun 30, 2026Niccolò Maria Rizzi, Eugenio Lomurno, Alberto Archetti +1Survival AnalysisSynthetic Data Generation

  2. Towards Inclusive Mobility Modeling: Characterizing and Evaluating Elderly Trajectory Patterns in Urban Systems

    Jun 30, 2026Zhengxuan Wang, Haohan He, Mengying ZhouSynthetic Data Evaluation

  3. Towards Evaluating Data Priors for Tabular Foundation Models

    Jun 28, 2026Zeynep Türkmen, Kürşat Kaya, Alexander Pfefferle +1Tabular Foundation ModelsSynthetic Data Evaluation

  4. A Task-Driven and Quality-Assured Agent Framework for SAR Data Generation

    Jun 27, 2026Xuanting Wu, Fan Zhanga, Fei Ma +3Synthetic Data AugmentationData Augmentation

  5. Benchmarking the Alignment of Data-Quality Metrics, Human Judgment and Land-Cover Segmentation Performance for Earth Observation

    Jun 23, 2026Ümit Mert Çağlar, Alptekin TemizelSynthetic Data AugmentationRemote Sensing Image Segmentation

  6. Generating Public Health Responses using Survey-Augmented Large Language Models

    Jun 20, 2026Leonardo Marciaga, Thuyen Pham, Julia Rezvani +4Synthetic Data AugmentationSynthetic Data Generation

  7. Phantoms and Disclosures: a Causal Framework for Auditing Synthetic Data

    Jun 15, 2026Kareem Amin, Rudrajit Das, Alessandro Epasto +4Privacy AuditingMembership Inference Attacks

  8. Not all Jensen-Shannon Divergence Estimators are Equal

    Jun 15, 2026Alba Garrido, Alejandro Almodóvar, Mar Elizo +3Synthetic Data Evaluation

  9. Causal-Privacy Audit Workflow for Synthetic and Distilled Data in Dropout Support

    Jun 14, 2026Hanghang Zheng, Xiwei Zhuang, Zhong Wang +4Privacy AuditingCausal Effect Estimation

  10. Valid Inference with Synthetic Data via Task Exchangeability

    Jun 11, 2026Lezhi Tan, Tijana ZrnicSynthetic Data Evaluation

  11. Provenance-Grounded Gating and Adaptive Recovery in Synthetic Post-Training Data Curation

    Jun 9, 2026Soham Bhattacharjee, Karun Sharma, Vinay Kumar Sankarapu +1Adaptive SamplingLLM Post-Training

  12. RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning

    Jun 8, 2026Yiteng Mao, Kenan Xu, Yijia Lyu +3Mathematical Reasoning BenchmarksLLM Evaluation

  13. Synthetic but Not Realistic: The Evaluation Challenge in Generative Modelling for Structured Electronic Medical Records

    Jun 8, 2026Nicholas I-Hsien Kuo, Blanca Gallego, Louisa JormSynthetic Tabular Data GenerationElectronic Health Records

  14. Mix, Don't Pick: Why Synthetic Corpus Composition Matters for Time Series Foundation Model Pretraining

    Jun 6, 2026Aaryan Nagpal, Debdeep Sanyal, Murari Mandal +2Synthetic Data PretrainingTime Series Forecasting

  15. The CIFAR Synthetic Evidence Corpus for Detecting AI-Generated Evidence

    Jun 6, 2026Kelly McConvey, Jalehsadat Mahdavimoghaddam, Nima Jamali +8Digital ForensicsSynthetic Benchmark Generation

  16. Beyond Individual Personas: Aligning Synthetic Dialogue to Population-Level Behavior Distributions

    Jun 5, 2026Xinyi Liu, Rinat Khaziev, Hooshang Nayyeri +3Synthetic Data GenerationPersona-Conditioned Generation

  17. A Framework for Evaluating and Benchmarking Concept Drift Detection Methods

    Jun 5, 2026Vitor Cerqueira, Heitor Murilo Gomes, Marco Heyden +2Concept DriftSynthetic Benchmark Generation

  18. Impact of Synthetic Lesional MR Images in Automated Focal Cortical Dysplasia Detection in Low-Data Scenarios

    Jun 5, 2026Prabhjot Kaur, Hakim Ouaalam, Sedat Kandemirli +2Synthetic Data AugmentationMedical Image Anomaly Detection

  19. Accelerating Reproducible Research in Synthetic EHR Generation

    Jun 5, 2026Jalen Jiang, Chufan Gao, Ethan Rasmussen +2Synthetic Data GenerationML Reproducibility

  20. From Vision to Text: A Compact Multimodal Approach for Robust, Cross-Domain Presentation Attack Detection on ID Cards

    Jun 5, 2026Qingwen Zeng, Juan E. Tapia, Sneha Das +1Multimodal RobustnessDomain Generalization

  21. An Expanded Synthetic Conversation Dataset for Multi-Turn Smishing Detection

    Jun 5, 2026Carl Lochstampfor, Ayan RoyTransformerSynthetic Data Generation

  22. Synthics: Synthetic Physics-like Datasets for Machine Learning

    Jun 4, 2026Jari VepsäläinenSynthetic Data GenerationScientific ML

  23. Re-Centering Humans in LLM Personalization

    Jun 4, 2026Lechen Zhang, Jiarui Liu, Tal AugustHuman Preference EvaluationLLM Evaluation

  24. Diffusion-Based Heart Sound Generation: Evaluation with Physiological Signal Metrics, Classifiers, and Expert Listening

    Jun 1, 2026Xinqi Bao, Jia Bi, Xin Chen +2Audio Diffusion ModelsConditional Diffusion Models

  25. No Free Lunch for Synthetic Images under Data Scarcity Conditions

    Jun 1, 2026Borja Arroyo Galende, Alejandro Almodóvar, Patricia A. Apellániz +3Synthetic Data GenerationGenerative Modeling

  26. Train, Test, Re-evaluate: Schedule-Sensitive Evaluation of Generative Data for Hand Detection

    Jun 1, 2026Atmika Bhardwaj, Silvia Vock, Nico SteckhanSynthetic-to-Real Domain AdaptationSynthetic Data Augmentation

  27. ContinuousBench: Can Differentially Private Synthetic Text Improve Capabilities?

    Jun 1, 2026Peihan Liu, Lucas Rosenblatt, Weiwei Kong +7Privacy-Preserving Language ModelsSynthetic Benchmark Generation

  28. LLM-as-a-Discriminator: When Synthetic Tables Still Look Real

    Jun 1, 2026Manel Slokom, Malek Slokom, Thierno KantePrivacy AuditingTabular Data Synthesis

  29. A Controlled Synthetic Benchmark for Educational Aspect-Based Sentiment Analysis

    May 25, 2026Yehudit Aperstein, Alexander ApartsinEducational TechnologySynthetic Benchmark Generation

  30. When Does Synthetic Patent Data Help? Volume-Fidelity Trade-offs in Low-Resource Multi-Label Classification

    May 22, 2026Amirhossein Yousefiramandi, Ciaran CooneySynthetic Data AugmentationMulti-Label Classification

  31. AvalancheBench: Evaluating Enterprise Data Agents Through Latent World Recovery

    May 22, 2026Darek Kleczek, Fuheng Zhao, Alexander W. Lee +4AI Agent EvaluationAI Agent Benchmarks

  32. SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations

    May 21, 2026Shuaiqi Wang, Aadyaa Maddi, Zinan Lin +1Tool-Use EvaluationLLM Agent Evaluation

  33. SADGE: Structure and Appearance Domain Gap Estimation of Synthetic and Real Data

    May 21, 2026Patryk Bartkowiak, Bartosz Kotrys, Dominik Michels +2Domain AdaptationSim-to-Real Transfer

  34. Making the Discrete Continuous: Synthetic RAW Augmentations for Fine-Grained Evaluation of Person Detection Performance in Low Light

    May 21, 2026Valeria Pais, Malena Mendilaharzu, Daniele Faccio +3Synthetic Data AugmentationAutonomous Driving Perception

  35. Physics-informed simulation framework for realistic sonar image generation and statistical validation

    May 19, 2026Kamal Basha S, Athira NambiarUnderwater ImagingSynthetic Data Generation

  36. What Makes Synthetic Data Effective in Image Segmentation

    May 19, 2026Jinjin Zhang, Xiefan Guo, Yizhou Jin +2Synthetic Data AugmentationImage Segmentation

  37. Systematic Evaluation of the Quality of Synthetic Clinical Notes Rephrased by LLMs at Million-Note Scale

    May 18, 2026Jinghui Liu, Sarvesh Soni, Anthony NguyenSynthetic Data AugmentationAutomated Medical Coding

  38. Memisis: Orchestrating and Evaluating Synthetic Data for Tabular Health Datasets

    May 18, 2026Nitish Nagesh, Pengbao Zhou, Atchuth Naveen Chilaparasetti +8HealthcareSynthetic Tabular Data Generation

  39. TextClusterLab: An Integrated Framework for Reliable Text Clustering Studies

    May 17, 2026Daoming Wan, Yizheng Huang, Jimmy X. HuangClusteringSynthetic Data Generation

  40. CasualSynth: Generating Structurally Sound Synthetic Data

    May 17, 2026Zehua Cheng, Wei Dai, Jiahao Sun +1Structural Causal ModelsSynthetic Data Generation

  41. On Applicability of Synthetic Datasets for Facial Expression Recognition

    May 17, 2026Ali Azmoudeh, Erdi Sarıtaş, Ömer Yıldırım +1Class-Imbalanced LearningSynthetic Data Generation

  42. How to Evaluate and Refine your CAM

    May 14, 2026Luca Domeniconi, Alessandra Stramiglio, Michele Lombardi +1Feature AttributionExplainability Evaluation

  43. NodeSynth: Socially Aligned Synthetic Data for AI Evaluation

    May 14, 2026Qazi Mamunur Rashid, Xuan Yang, Zhengzhe Yang +5Language Model Generation EvaluationLanguage Model Safety Evaluation

  44. Real vs. Semi-Simulated: Rethinking Evaluation for Treatment Effect Estimation

    May 11, 2026George PanagopoulosCounterfactual EvaluationCausal Effect Estimation

  45. Generating synthetic electronic health record data using agent-based models to evaluate machine learning robustness under mass casualty incidents

    May 11, 2026Roben Delos Reyes, Daniel Capurro, Nicholas GeardDistribution Shift RobustnessSynthetic Data Generation

  46. Discriminative Span as a Predictor of Synthetic Data Utility via Classifier Reconstruction

    May 10, 2026Radhika Amar Desai, Modigari NarendraSynthetic Data AugmentationBinary Classification

  47. On Privacy Leakage in Tabular Diffusion Models: Influential Factors, Attacker Knowledge, and Metrics

    May 7, 2026Masoumeh Shafieinejad, D. B. Emerson, Behnoosh Zamanlooy +5Data LeakageMembership Inference Attacks

  48. Mind the Gap? A Distributional Comparison of Real and Synthetic Priors for Tabular Foundation Models

    May 7, 2026Alex O. Davies, Telmo de Menezes e Silva Filho, Nirav AjmeriSynthetic Data PretrainingSynthetic-to-Real Domain Adaptation

  49. Does Synthetic Data Help? Empirical Evidence from Deep Learning Time Series Forecasters

    May 7, 2026Hugo Cazaux, Eyjólfur Ingi Ásgeirsson, Hlynur StefánssonSynthetic Data AugmentationSynthetic Data Generation