LLM Post-Training

LLM: Large Language Model

Momentum

29 papers in the last four weeks, up 81% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 175

All topics
CardsList
  1. SDO: Structure-Aware Data Organization for Efficient LLM Post-Training

    Jul 29, 2026Jinliang Gao, Ning Yang, Hai Wang +2Training Data CurationEfficient Language Model Training

  2. RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement

    Jul 28, 2026Fanqing Meng, Lingxiao Du, Qiguang Chen +4LLM Agent EvaluationLLM Agent Self-Improvement

  3. Training Language Models to Cooperate with Inference-Time Controllers

    Jul 26, 2026Moumita Choudhury, Vanshaj Khattar, Jing Liu +4RL for Language Model ReasoningLLM Post-Training

  4. Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

    Jul 22, 2026Roger Sala Sisó, Tiago Silvério, Jakob Sand +1Robotic ManipulationVision-Language-Action Models

  5. Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents

    Jul 17, 2026Zhengyu Chen, Teng Xiao, Huaisheng Zhu +3Agent Harness OptimizationLLM Agent Workflow Optimization

  6. Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape Pre-, Intra-, and Post-CoT Calibration

    Jul 15, 2026Shuhao Li, Guodong Du, Anhao Zhao +3Confidence Estimation in Language ModelsLanguage Model Calibration

  7. Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals

    Jul 13, 2026Daocheng Fu, Rong Wu, Yu Yang +7Large Language Model-Guided OptimizationRL Post-Training

  8. CurateEvo: Data-Curation Evolving for Agentic Post-Training

    Jul 7, 2026Dingzirui Wang, Xuanliang Zhang, Keyan Xu +2Training Data CurationLLM Agent Training

  9. Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation

    Jul 2, 2026Zhuowei Chen, Xiang Lorraine LiOn-Policy Self-DistillationTraining Data Selection

  10. Enhancing Fitness Intelligence through Domain-Specific LLM Post-Training

    Jul 2, 2026Xingtao Zhao, Tian Yang, Han JiangDomain AdaptationLLM Fine-Tuning

  11. CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

    Jul 2, 2026Fangfei Li, Chenyang Zhao, Long Wang +3LLM Agent EvaluationLLM Post-Training

  12. Denser ≠\neq Better: Limits of On-Policy Self-Distillation for Continual Post-Training

    Jul 2, 2026Meng Wang, Haohan Zhao, Wenzhuo Liu +7Continual Learning for LLMsOn-Policy Self-Distillation

  13. Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training

    Jul 1, 2026Xiangchen Song, Zhenhao Chen, Lingjing Kong +4LLM EvaluationLLM Memory

  14. AutoTrainess: Teaching Language Models to Improve Language Models Autonomously

    Jun 30, 2026Zhaojian Yu, Penghao Yin, Shuzheng Gao +3Tool-Augmented Language Model AgentsLLM Tool Use

  15. When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon

    Jun 29, 2026Huaqing Zhang, Jingchu Gai, Juno Kim +2Imitation LearningInteractive Imitation Learning

  16. MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

    Jun 29, 2026Wenhan Ma, Jianyu Wei, Liang Zhao +10Multi-Teacher Knowledge DistillationOn-Policy Distillation

  17. From Search to Synthesis: Training LLMs as Zero-Shot Workflow Generators

    Jun 29, 2026Gan Luo, Zihan Qin, Bin Dong +1Zero-Shot LearningMeta-Learning

  18. TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment

    Jun 26, 2026Changyue Li, Jiaming He, Youliang Yuan +4Supervised Fine-TuningLLM Safety Alignment

  19. Paved with True Intents: Intent-Aware Training Improves LLM Safety Classification Across Training Regimes

    Jun 25, 2026Jeremias Ferrao, Niclas Müller-Hof, Iustin Sîrbu +2LLM Safety EvaluationLLM Post-Training

  20. NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research

    Jun 25, 2026Qiaobo Hao, Yangqian Wu, Shunyi Wang +5Supervised Fine-TuningRL for Language Models

  21. The Interplay of Harness Design and Post-Training in LLM Agents

    Jun 24, 2026Kyungmin Kim, Youngbin Choi, Seoyeon Lee +3Agent Harness OptimizationLLM Agents

  22. AsyncOPD: How Stale Can On-Policy Distillation Be?

    Jun 23, 2026Wonjun Kang, Kevin Galim, Seunghyuk Oh +9Language Model DistillationOn-Policy Distillation

  23. Understanding Knowledge Distillation in Post-Training: When It Helps and When It Fails

    Jun 22, 2026Xin Liu, Simin Ma, Shujian Liu +5Data-Free Knowledge DistillationLanguage Model Distillation

  24. Which Pairs to Compare for LLM Post-Training?

    Jun 17, 2026Jiangze Han, Vineet Goyal, Will MaPairwise Preference LearningPairwise Comparison