LLM Post-Training

LLM: Large Language Model

Momentum

29 papers in the last four weeks, up 81% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 175

All topics
CardsList
  1. Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning

    May 27, 2026Mingze Wu, Abhinav Anand, Shweta Verma +1RL for Code GenerationOffline RL

  2. Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training

    May 27, 2026Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima +2Supervised Fine-TuningLLM Post-Training

  3. Soft Specialists: αα-Rényi Ensembles for Uncertainty-Aware LLM Post-Training

    May 26, 2026Paula Cordero-Encinar, Georgy Tyukin, Andrew B. DuncanLLM Uncertainty EstimationLanguage Model Ensembles

  4. Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

    May 26, 2026Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake +1Language Model CalibrationLLM Uncertainty Estimation

  5. Learning to Adapt SFT Data for Better Reasoning Generalization

    May 26, 2026Lisong Sun, Li Wang, Chen Zhang +4Supervised Fine-TuningLLM Post-Training

  6. When the Strongest Teacher Is Not the Best Teacher: Student-Centric Answer Selection

    May 26, 2026Zhengyu Hu, Zheyuan Xiao, Linxin Song +10Language Model DistillationLLM Post-Training

  7. Composition Collapse: Stable Factual Knowledge Does Not Imply Compositional Reasoning

    May 26, 2026Zhe Yu, Wenpeng Xing, Yunzhao Wei +4Compositional ReasoningReasoning Evaluation

  8. Causal methods for LLM development and evaluation

    May 25, 2026Dennis Frauen, Marie Brockschmidt, Konstantin Hess +10LLM EvaluationCausal Inference

  9. Step-TP: A Grounded, Step-Level Dataset with Chain-of-Thought Reasoning for LLM-Guided Tensor Program Optimization

    May 25, 2026Mengfan Liu, Da Zheng, Junwei Su +1GPU Kernel OptimizationLarge Language Model-Guided Optimization

  10. Unlocking Proactivity in Task-Oriented Dialogue

    May 21, 2026Azure Zhang, Ning Gao, Yuqin Dai +7LLM Post-TrainingConversational Agents

  11. torchtune: PyTorch native post-training library

    May 20, 2026Mark Obozov, Maxime Griot, Joseph Cummings +8LLM Fine-TuningEfficient Language Model Training

  12. Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?

    May 16, 2026Prateek Rajput, Yewei Song, Iyiola E. Olatunji +2Personality Modeling in Language ModelsLLM Post-Training

  13. Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation

    May 16, 2026Anhao Zhao, Haoran Xin, Yingqi Fan +3Reasoning DistillationOn-Policy Distillation

  14. Convex Dataset Valuation for Post-Training

    May 15, 2026Siqi Zeng, Christopher Jung, Rui Li +7LLM Post-TrainingData Valuation

  15. GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training

    May 13, 2026Junjie Li, Ziao Wang, NingXuan Ma +2Training Data SelectionLLM Post-Training

  16. Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators

    May 12, 2026Heejin Do, Shashank Sonkar, Mrinmaya SachanLLM EvaluationLLM Sycophancy

  17. Hybrid-LoRA: Bridging Full Fine-Tuning and Low-Rank Adaptation for Post-Training

    May 12, 2026Chengqian Zhang, Wei Zhu, Kyumin LeeLow-Rank AdaptationLLM Post-Training

  18. ConFit v3: Improving Resume-Job Matching with LLM-based Re-Ranking

    May 10, 2026Xiao Yu, Ruize Xu, Chengyuan Xue +6Reinforcement LearningLearning to Rank

  19. Geometry Conflict: Explaining and Controlling Forgetting in LLM Continual Post-Training

    May 10, 2026Yuanyi Wang, Yifan Yang, Su Lu +9Continual Learning for LLMsModel Merging

  20. LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models

    May 10, 2026Taekhyun Park, Yongjae Lee, Dohee Kim +1Recurrent TransformersLLM Post-Training

  21. On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective

    May 8, 2026Yuhao Li, Shengchao LiuSupervised Fine-TuningFree Energy Principle

  22. Star Elastic: Many-in-One Reasoning LLMs with Efficient Budget Control

    May 8, 2026Ali Taghibakhshi, Ruisi Cai, Saurav Muralidharan +17LLM CompressionLLM Post-Training

  23. Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

    May 8, 2026Pingbang Hu, Xueshen Liu, Z. Morley Mao +1Supervised Fine-TuningTraining Data Selection

  24. Navigating by Old Maps: The Pitfalls of Static Mechanistic Localization in LLM Post-Training

    May 7, 2026Hang Chen, Jiaying Zhu, Hongyang Chen +3Supervised Fine-TuningTransformer Interpretability

  25. Rethinking Local Learning: A Cheaper and Faster Recipe for LLM Post-Training

    May 6, 2026Hengyu Shi, Tianyang Han, Peizhe Wang +3Efficient Language Model TrainingLLM Post-Training

  26. Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting

    May 4, 2026Ishaan Watts, Catherine Li, Sachin Goyal +2Language Model PretrainingSharpness-Aware Minimization

  27. Iterative Finetuning is Mostly Idempotent

    May 1, 2026Zephaniah Roe, Jack Sanderson, Dang Nguyen +5Supervised Fine-TuningLLM Post-Training