Synthetic Data Generation for Language Models

Latest papers 160

All topics
CardsList
  1. Simulating Students' Java Programming Errors with Large Language Models

    Jun 12, 2026Ali Keramati, Jie Cao, Iman Mohammadi +2LLM EvaluationProgramming Education

  2. Automated IEP Generation from Traditional Chinese Parent-Teacher Interviews via Corpus-Grounded Feature Diffusion

    Jun 8, 2026Kuanlin Chen, Cheng-En OuAI in EducationGenerative AI in Education

  3. Efficient ASR Training with Conversations that Never Happened

    Jun 2, 2026Máté Gedeon, Péter MihajlikSynthetic Data AugmentationAutomatic Speech Recognition

  4. Synthetic Hallucinations, Real Gains: Hard Negatives from Frontier Models for FIM Hallucination Mitigation

    Jun 2, 2026Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg +4LLM Hallucination MitigationHard Negative Mining

  5. WRIT: Write-Read Intensive Trajectory Synthesis for Multi-Turn User-Facing Agents

    Jun 1, 2026Hengrui Gu, Xiaotian Han, Kaixiong ZhouTool-Augmented Language Model AgentsTool-Using Agents

  6. Scaling Agentic Capabilities via Grounded Interaction Synthesis

    Jun 1, 2026Wenhang Shi, Jinhao Dong, Yiren Chen +4Synthetic Data GenerationLLM Agent Training

  7. ContinuousBench: Can Differentially Private Synthetic Text Improve Capabilities?

    Jun 1, 2026Peihan Liu, Lucas Rosenblatt, Weiwei Kong +7Privacy-Preserving Language ModelsSynthetic Benchmark Generation

  8. ANDES: Agent Native Data Evolving Synthesis Tool for Autonomous Instruction Alignment

    May 31, 2026Zhengyang Zhao, Shengjie Ye, Lu Ma +3LLM AlignmentLLM Agent Skill Learning

  9. Scaling Multi-Hop Training Data via Graph-Constrained Path Selection

    May 29, 2026Pengyu Chen, Yonggang Zhang, Mingming Chen +3Multi-Hop QASynthetic Data Generation for Language Models

  10. Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination

    May 29, 2026Jiasheng Zheng, Boxi Cao, Boxi Yu +6RL for Code GenerationReinforcement Learning with Verifiable Rewards

  11. Differentially Private Preference Data Synthesis for Large Language Model Alignment

    May 29, 2026Fengyu Gao, Jing YangPairwise Preference LearningLLM Alignment

  12. Exploring Autonomous Agentic Data Engineering for Model Specialization

    May 28, 2026Yujie Luo, Xiangyuan Ru, Jingsheng Zheng +10Large Language Model-Guided OptimizationSynthetic Data Generation for Language Models

  13. Domain-Specific Data Synthesis for LLMs via Minimal Sufficient Representation Learning

    May 28, 2026Tong Ye, Hang Yu, Tengfei Ma +6Domain AdaptationSynthetic Data Generation

  14. Make LLM Learn to Synthesize from Streaming Experiences through Feedback

    May 28, 2026Zhenlin Hu, Yan Wang, Zhen Bi +7Continual Learning for LLMsSynthetic Data Generation

  15. LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents

    May 28, 2026Xiaoxuan Peng, Kaiqi Zhang, Xinyu Lu +5RL for Language ModelsTerminal Agents

  16. Context-Instrumental Data Distillation for Kubernetes Manifest Generation: Method and Experimental Evaluation

    May 25, 2026Andrey Kozachok, Anatoliy Bakaev, Aleksandr Kozachok +2LLM Fine-TuningCode Generation

  17. Re-defining Humor Data Objects for AI Humor Research

    May 24, 2026Anna Arnett, Bang Nguyen, Meng JiangLLM PromptingSynthetic Data Generation for Language Models

  18. STREAM: A Data-Centric Framework for Mining High-Value Task-Oriented Dialogues from Streaming Media

    May 24, 2026Liang Xue, Haoyu Liu, Cheng Wang +3Spoken Dialogue SystemsSynthetic Data Generation for Language Models

  19. Towards a Universal Causal Reasoner

    May 24, 2026Qirun Dai, Xiao Liu, Jiawei Zhang +3Causal Reasoning in Language ModelsCausal Reasoning

  20. When Does Synthetic Patent Data Help? Volume-Fidelity Trade-offs in Low-Resource Multi-Label Classification

    May 22, 2026Amirhossein Yousefiramandi, Ciaran CooneySynthetic Data AugmentationMulti-Label Classification

  21. QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks

    May 22, 2026Jian Xie, Tianhe Lin, Zilu Wang +16Deep Research AgentsLLM Agent Training

  22. ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

    May 22, 2026Xiaoyuan Li, Keqin Bao, Moxin Li +5RL for Language ModelsReinforcement Learning

  23. MindLoom: Composing Thought Modes for Frontier-Level Reasoning Data Synthesis

    May 20, 2026Haiyang Shen, Taian Guo, Xuanzhong Chen +11Synthetic Data GenerationStructured Reasoning