LLM Post-Training

LLM: Large Language Model

Momentum

29 papers in the last four weeks, up 81% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 175

All topics
CardsList
  1. SAPD: Step-Aligned Privileged Distillation

    Oct 7, 2026Tianle Wang, Jiayu Liu, Ruizhi Zhao +1LLM Post-TrainingLanguage Model Distillation

  2. When Rank Rises as LLMs Degrade

    Oct 7, 2026Zhaohui Geoffrey WangLLM Post-TrainingRepresentation Geometry in Language Models

  3. CM-DPO: Constraint-Margin Direct Preference Optimization for LLM Planning

    Oct 6, 2026Rabimba Karanjai, Qun Gu, Hemanth Hegadehalli Madhavarao +8Direct Preference OptimizationLLM Planning

  4. Harmful SFT Leaves a Continuous Trace in LLM Checkpoint Updates

    Oct 5, 2026Ziqun Bao, Xinyu Zhang, Yuchen Shao +1LLM AuditingLLM Safety

  5. ImproveAnyTask: An Autonomous Post-Training Harness for Iterative Model Self-Improvement

    Oct 5, 2026Xingbo Yao, Xiaoman Wang, Zhengwu Lei +11LLM Fine-TuningLLM Post-Training

  6. Dynamic Minimax Regret Optimization for Robust LLM Post-Training

    Oct 5, 2026Chengbo Zang, Haoyu Dong, Mehmet Kerem Turkcan +3Dynamic Regret MinimizationDistributionally Robust Optimization

  7. The Functional Structure of Post-Compression Recovery in Low-Rank LLMs

    Oct 4, 2026Zishan Shao, Liang Tian, Georgiy Zemlevskiy +10LLM CompressionLow-Rank Compression

  8. The Missing Primitive: Diagnosing and Repairing Mathematical Reasoning in Large Language Models

    Oct 1, 2026Shuo Xing, Zilin Dai, Chengyuan Qian +7Mathematical Reasoning BenchmarksSelf-Distillation

  9. IrekoGPT: Turning Structured Pruning into Post-Hoc Slimmable LLMs

    Sep 30, 2026Pietro Moriello, Pietro Buzzega, Angelo Porrello +1LLM CompressionLLM Inference Acceleration

  10. Aligned Data Can Induce Misalignment via Context Confusion

    Sep 29, 2026Yavuz Bakman, Duygu Nur Yaldiz, Baris Askin +4LLM AlignmentLLM Post-Training

  11. Beyond Compression: Diagnosing How Post-Training Changes Mathematical Reasoning

    Sep 29, 2026Hongyang Li, Yiming Zhu, Xiao Li +3Language Model DistillationRL Post-Training

  12. WEFT: Scaling Tool-Use Post-Training for General-Purpose Agents

    Sep 29, 2026Bo Mao, Hang He, Linting Wang +17LLM Agent Self-ImprovementLLM Post-Training

  13. Frontier Learning: Training LLM Reasoners at the Edge of Capability

    Sep 28, 2026Robin Faro, Shyam Sundhar Ramesh, Ilija Bogunovic +1RL for Language Model ReasoningLLM Post-Training

  14. LLMs learn different forms of metacognition when trained to predict their own accuracy

    Sep 27, 2026Nicolas Yax, Stefano Palminteri, Pierre-Yves OudeyerConfidence Estimation in Language ModelsLanguage Model Calibration

  15. How code helps different tasks? A decompositional lens on LLM post-training

    Sep 27, 2026Zheng Yu, Yiwei Li, Yishen Chen +4LLM Fine-TuningInstruction-Tuning Data Selection

  16. A Cheap Verifier is Good Enough: LLM Post-training is Robust to Erroneous Rewards

    Sep 27, 2026Andreas Plesner, Curtis Northcutt, Francisco Guzmán +1Reward ModelingLLM Reliability

  17. Search-Aware Reinforcement Learning for Multi-Component Query Understanding in Roblox Game Search

    Sep 24, 2026Nayoung Choi, Shengjian Chen, Xiaokai Wei +6Reinforcement LearningRL for IR

  18. Rufus-Air: An Open LLM Post-Training Recipe

    Sep 24, 2026Chia-Yuan Chang, Renyuan Cheng, Rui Feng +19LLM Fine-TuningRL for Language Model Reasoning

  19. Thinking Leakage: A Causal Audit of NoThink Post-Training in Hybrid Reasoning Models

    Sep 23, 2026Zehao Liu, Vasant G. HonavarLLM Post-TrainingCausal Interventions in Language Models

  20. Toolcompass: Guiding Tool Trialing, Not Suppressing It

    Sep 22, 2026Junlin Fang, Chong Zhang, Do Nguyen-Thanh +3Representation LearningTool-Augmented Language Model Agents

  21. TelecomGPT-R1: Unified Post-Training for Reasoning Across Heterogeneous Telecom Tasks

    Sep 21, 2026Bohao Wang, Chenwei Wu, Hang Zou +7LLM GroundingRL for Language Model Reasoning

  22. SupportCal: Label-Free Calibration of Post-Trained LLMs via Reference Support and Corroboration

    Sep 21, 2026Linhan Luo, Lequan Lin, Dai Shi +3Post-Hoc CalibrationLanguage Model Calibration

  23. Inoculation Midtraining with Learned Neologisms

    Sep 14, 2026Kyle O'Brien, Edward James Young, Puria Radmard +4LLM AlignmentLLM Safety