Language Model Post-Training

Momentum

23 papers in the last four weeks, up 283% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 132

All topics
CardsList
  1. FastMix: Fast Data Mixture Optimization via Gradient Descent

    Jun 12, 2026Haoru Tan, Sitong Wu, Yanfeng Chen +5Language Model PretrainingData Mixture Optimization

  2. AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

    Jun 12, 2026Hui Geng, Yi Su, Han Yin +7Audio ReasoningAudio-Language Models

  3. Achieving Precise Text-To-Cypher Via Grounded Knowledge Graph Data Generation

    Jun 12, 2026Francesco Cazzaro, Jessica Lennon, Ariadna QuattoniText-to-CypherSynthetic Data Generation for Language Models

  4. The Culture Funnel: You Can't Align What isn't in the Data

    Jun 11, 2026Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza +3Cultural AlignmentCultural Bias in Language Models

  5. PolyAlign: Conditional Human-Distribution Alignment

    Jun 11, 2026L. D. M. S. Sai Teja, Ufaq Khan, Sathira Silva +2Multilingual Language ModelsLLM Alignment

  6. It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO

    Jun 9, 2026Naihao Deng, Yilun Zhu, Naichen Shi +2LLM AlignmentSocial Bias in Language Models

  7. Self-supervised User Profile Generation for Personalization

    Jun 3, 2026Clark Mingxuan Ju, Yuwei Qiu, Tong Zhao +1LLM PersonalizationSelf-Supervised Learning

  8. Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)

    Jun 3, 2026Nizar Islah, Istabrak Abbes, Irina Rish +2Test-Time ScalingLLM Routing

  9. Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning

    Jun 3, 2026Chongyang He, Rui Zhang, Zixuan Wang +1Supervised Fine-TuningRL for Language Model Reasoning

  10. LinguIUTics at PsyDefDetect: Iterative Imbalance-Aware Fine-tuning of Qwen3-8B for Psychological Defense Mechanism Classification

    May 30, 2026Shefayat E Shams Adib, Ahmed Alfey Sani, Md Hasibur Rahman Alif +1Class-Imbalanced LearningQuantization-Aware LoRA

  11. Post-Training Recipe, More Than Model Family, Shapes Multi-Agent LLM Conversational Behavior

    May 30, 2026Luyang Zhang, Jialu Wang, Fei Xue +1Language Model Post-TrainingMulti-LLM Collaboration

  12. Consolidating Rewarded Perturbations for LLM Post-Training

    May 29, 2026Zheyu Zhang, Shuo Yang, Gjergji KasneciRL Post-TrainingLanguage Model Post-Training

  13. LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training

    May 29, 2026Argyrios Gerogiannis, Yekaterina Yegorova, Mark Hasegawa-Johnson +1RL for Language ModelsCredit Assignment in RL

  14. Measuring, Localizing, and Ablating Alignment Signatures in LLMs

    May 28, 2026Aniket Anand, Janvijay Singh, Zhewei Sun +2LLM AlignmentAI-Generated Text Detection

  15. Exploring Autonomous Agentic Data Engineering for Model Specialization

    May 28, 2026Yujie Luo, Xiangyuan Ru, Jingsheng Zheng +10Large Language Model-Guided OptimizationSynthetic Data Generation for Language Models

  16. Self-Improving Language Models with Bidirectional Evolutionary Search

    May 27, 2026Guowei Xu, Zhenting Qi, Huangyuan Su +4Evolutionary OptimizationLLM Planning

  17. Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring

    May 25, 2026Zhengyang Wang, Sanwoo Lee, Jiaxin Wang +3Automated Essay ScoringLanguage Model Post-Training

  18. OnePred: Next-Query Prediction via Recursive Intent Memory in Multi-Turn Conversations

    May 22, 2026Jiangwang Chen, Bowen Zhang, Zixin Song +4Long-Term Conversational MemoryEfficient Language Model Inference

  19. Reducing Political Manipulation with Consistency Training

    May 21, 2026Long Phan, Devin Kim, Alexander Pan +3Social Bias in Language ModelsPolitical Bias in Language Models

  20. EmbGen: Teaching with Reassembled Corpora

    May 19, 2026Arun K Lenin, Kai Rouse, Andrea Nicastro +1Domain Adaptation for LLMsSynthetic Data Generation for Language Models

  21. A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔΔ Integration into Upcycled MoE

    May 18, 2026Hao Zhou, Tianhao Li, Zhijun Wang +6Multilingual Language ModelsMixture-of-Experts Language Models