LLM Post-Training

LLM: Large Language Model

Momentum

29 papers in the last four weeks, up 81% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 175

All topics
CardsList
  1. Forty Shades of Blue: Quality-Diversity Alignment via Mode-Conditioned Reinforcement Learning

    Sep 14, 2026Jiayi Yuan, Hangoo Kang, James Jihao Liu +4RL for Language ModelsMulti-Objective Language Model Alignment

  2. EGGROLL, Unrolled: Understanding and Improving Low-Rank Evolution Strategies at Scale

    Sep 12, 2026Ege C. Kaya, Abolfazl HashemiEvolutionary OptimizationEvolution Strategies

  3. ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation

    Sep 8, 2026Yiling Ma, Yilun Zhao, Sihong Wu +3LLM Post-TrainingAutomated Peer Review

  4. CROCODIL: Cross-Model Code Editing with LLMs

    Sep 3, 2026Linghan Zhong, Aditya Thimmaiah, Jayanth Srinivasa +2Reinforcement LearningLLM Post-Training

  5. Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs

    Sep 1, 2026Jingtan Wang, Arun Verma, Xiaoqiang Lin +4Supervised Fine-TuningLanguage Model Scaling

  6. From Rollouts to Recipes: Self-Contained Post-Training for LLMs

    Sep 1, 2026Yifei Li, Lingling Zhang, Muye Huang +3Self-Training for Language ModelsRL for Language Model Reasoning

  7. CRAFT: Fine-Tuning Pre-hoc Explainability in AI-native 6G RAN

    Sep 1, 2026Pranshav Gajjar, Vijay K Shah6G NetworksLLM Interpretability

  8. LLM Post-Training as Brownfield Maintenance: An Industrial Perspective on Dataware Engineering

    Aug 31, 2026Gopi Krishnan Rajbahadur, Amir M. Ebrahimi, Boyuan Chen +1Training Data CurationLLM Post-Training

  9. COGTRL: Training LLMs for Scientific Discovery Assistance using Cognitive Traces via Reinforcement Learning

    Aug 31, 2026Shrinidhi Kumbhar Santosh Mashetty Divij Handa Kevin Coutinho, Siddharth Sambhaji Ghule, Chitta BaralRL for Language Model ReasoningLLM Post-Training

  10. What is Missing from AI Post-Training AI: An Empirical Analysis

    Aug 19, 2026Joy Jia Yin Lim, Xin Huang, Hao Peng +5AI Agent EvaluationLLM Agent Self-Improvement

  11. Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

    Aug 13, 2026Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer +4Evolution StrategiesLLM Post-Training

  12. Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling

    Aug 12, 2026Xinmu Ge, Zizhuo Zhang, Yu Huang +8On-Policy DistillationLLM Post-Training

  13. Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models

    Aug 11, 2026Alexandrine Fortier, Hazel Chen, Peter WestLanguage Model PretrainingLLM Alignment

  14. Can Bayesian Optimization Efficiently Find a Strong Single Expert in Neural Thickets?

    Aug 11, 2026Nigel Bastian Cendra, Abdelhamid Ezzerg, Fernando Julio Cendra +2Bayesian OptimizationLLM Post-Training

  15. Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes

    Aug 10, 2026Alec Harris, Kasey Corra, Archie Chaudhury +1RL for Language ModelsLLM Alignment

  16. CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity

    Aug 7, 2026Ananya Sahu, Mohit Bansal, Elias Stengel-EskinInstruction TuningDiverse Text Generation

  17. A Six-Dimensional Taxonomy of Post-Training Adaptation Techniques with Applications in AI Governance

    Aug 6, 2026Fardin Afdideh, Fernando Seoane, Farhad AbtahiLLM Post-Training

  18. SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay

    Aug 4, 2026Guilin Li, Jiaxing Zhang, Matthias Hwai Yong Tan +2Sequential RecommendationFinancial Fraud Detection

  19. Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training

    Aug 3, 2026Zhiyuan Wang, Shengcai Liu, Jiahao Wu +5Evolutionary OptimizationEvolution Strategies

  20. Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge

    Aug 3, 2026Xiaofeng Shi, Xiaosong Qiu, Wenxin Ma +6Supervised Fine-TuningKnowledge Augmentation for Language Models