Post-Training

Momentum

73 papers in the last four weeks, up 306% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 297

All topics
CardsList
  1. Different Prompts, Different Ranks: Prompt-aware Dynamic Rank Selection for SVD-based LLM Compression

    May 9, 2026Hengyi Zhu, Zhendong Mi, Grace Li Zhang +1Large Language Model CompressionData Compression Methods

  2. On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective

    May 8, 2026Yuhao Li, Shengchao LiuPost-TrainingSupervised Finetuning

  3. Flow-OPD: On-Policy Distillation for Flow Matching Models

    May 8, 2026Zhen Fang, Wenxuan Huang, Yu Zeng +8Text-To-Image Diffusion ModelsImage-Text Alignment

  4. KL for a KL: On-Policy Distillation with Control Variate Baseline

    May 8, 2026Minjae Oh, Sangjun Song, Gyubin Choi +2Kullback-Leibler DivergencePost-Training

  5. Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning

    May 8, 2026Gengyang Li, Zheng-Fan Wu, Siqi Bao +1Token-Level EntropyPost-Training

  6. Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training

    May 8, 2026Chen Wang, Hexuan Deng, Yining Zhang +5ShortReasoning Traces

  7. Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

    May 7, 2026Zeyu Liu, Zanlin Ni, Yang Yue +5Multimodal GenerationMultimodal Model

  8. Rethinking Local Learning: A Cheaper and Faster Recipe for LLM Post-Training

    May 6, 2026Hengyu Shi, Tianyang Han, Peizhe Wang +3Post-TrainingLayer-Wise

  9. RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models

    May 5, 2026Hao Wu, Yuqi Li, Yuan Gao +10Video World ModelsLong-Horizon Inference

  10. Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe

    May 5, 2026Wenjin Hou, Shangpin Peng, Weinong Wang +13Uni-OpdPost-Training

  11. Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting

    May 4, 2026Ishaan Watts, Catherine Li, Sachin Goyal +2Catastrophic ForgettingPost-Training

  12. Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization

    Apr 30, 2026YiFeng Wang, Zhun Sun, Keisuke SakaguchiLarge Language Model QuantizationPost-Training

  13. Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training

    Apr 30, 2026Jasmine Brazilek, Juliana SeawellPost-TrainingPretraining

  14. Backtranslation Augmented Direct Preference Optimization for Neural Machine Translation

    Apr 28, 2026Mehrdad Ghassabi, Spehr Rajabi, Hamidreza Baradaran Kashani +3Neural Machine TranslationBacktranslation Augmented Direct Preference Optimization

  15. A Systematic Post-Train Framework for Video Generation

    Apr 28, 2026Zeyue Xue, Siming Fu, Jie Huang +9Video GenerationPost-Training

  16. Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models

    Apr 27, 2026Dan Shi, Zhuowen Han, Simon Ostermann +3Post-TrainingModel Fine-Tuning

  17. Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate

    Apr 27, 2026John Seon Keun Yi, Aaron Mueller, Dokyun LeeMulti-Agent DebateDebate

  18. Coverage-Based Calibration for Post-Training Quantization via Weighted Set Cover over Outlier Channels

    Apr 27, 2026Ibne Farabi Shihab, Sanjeda Akter, Anuj SharmaPost-Training QuantizationPost-Training

  19. Stabilizing Efficient Reasoning with Step-Level Advantage Selection

    Apr 27, 2026Han Wang, Xiaodong Yu, Jialian Wu +4LLM Reasoning StrategiesStep-Level Advantage Estimation

  20. When Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement Learning

    Apr 23, 2026Elias Hossain, Mohammad Jahid Ibna Basher, Ivan Garibay +2Off-Policy LearningOffline Reinforcement Learning

  21. Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training

    Apr 23, 2026Yaxuan Li, Zhongyi Zhou, Yefei Chen +5Efficient World-Action ModelScalable Robot Learning

  22. ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

    Apr 22, 2026Shelly Golan, Michael Finkelson, Ariel Bereslavsky +2Multi-Objective Reinforcement LearningDiffusion Models

  23. Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text

    Apr 21, 2026Chengyu Huang, Sheng-Yen Chou, Zhengxin Zhang +1Self-PlayPost-Training

  24. HP-Edit: A Human-Preference Post-Training Framework for Image Editing

    Apr 21, 2026Fan Li, Chonghuinan Wang, Lina Lei +9Diffusion-Based Image EditingImage Editing

  25. Self-Improving Tabular Language Models via Iterative Reward-Guided Post-Training

    Apr 21, 2026Yunbo Long, Tejumade Afonja, Guangya Hao +2Post-TrainingNext-Token Distribution

  26. Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts

    Apr 20, 2026Jacob Morrison, Sanjay Adhikesaven, Akshita Bhagia +3Mixture-Of-ExpertsPost-Training

  27. Post-training is (Massive) Supervised Learning

    Apr 20, 2026Michael Hassid, Yossi Adi, Roy SchwartzPost-TrainingPretraining

  28. Characterizing Model-Native Skills

    Apr 19, 2026Feiyang Kang, Mahavir Dabas, Myeongseob Ko +1SkillsModel Activations

  29. Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning

    Apr 18, 2026Benteng Chen, Weida Wang, Shufei Zhang +2Large Reasoning ModelsPost-Training

  30. AutoOR: Scalably Post-training LLMs to Autoformalize Operations Research Problems

    Apr 18, 2026Sumeet Ramesh Motwani, Chuan Du, Aleksander Petrov +4Operations ResearchAuto Research

  31. Where does output diversity collapse in post-training?

    Apr 17, 2026Constantinos Karouzos, Xingwei Tan, Nikolaos AletrasDiversity CollapseDiversity

  32. S-GRPO: Unified Post-Training for Large Vision-Language Models

    Apr 17, 2026Yuming Yan, Kai Tang, Sihong Chen +4Vision-Language Model AdaptationPost-Training

  33. Discovering Novel LLM Experts via Task-Capability Coevolution

    Apr 16, 2026Andrew Dai, Boris Meinardus, Ciaran Regan +2Co-EvolutionPost-Training

  34. PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards

    Feb 2, 2026Minh-Quan Le, Gaurav Mittal, Cheng Zhao +3Text-To-Video Generation ModelPost-Training

  35. Mechanism Shift During Post-training from Autoregressive to Masked Diffusion Language Models

    Jan 21, 2026Injin Kong, Hyoungjoon Lee, Yohan JoMasked Diffusion Language ModelsDiffusion Language Models

  36. Value Drifts: Tracing Value Alignment During LLM Post-Training

    Oct 30, 2025Mehar Bhatia, Shravan Nayak, Gaurav Kamath +4Large Language Model AlignmentPreference Datasets

  37. A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning

    Oct 21, 2025Mengqi Li, Lei Zhao, Anthony Man-Cho So +2LLM Reasoning StrategiesMathematical Reasoning Benchmarks

  38. Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging

    Oct 20, 2025Tiancheng Hu, Benjamin Minixhofer, Nigel CollierValue AlignmentPost-Training

  39. SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

    Oct 14, 2025Weiyang Jin, Yuwei Niu, Jiaqi Liao +4Multimodal GenerationPost-Training

  40. Representation-Based Exploration for Language Models: From Test-Time to Post-Training

    Oct 13, 2025Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy +1Post-TrainingExploration

  41. What Is The Political Content in LLMs' Pre- and Post-Training Data?

    Sep 26, 2025Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach +1Large Language Model BiasPolitical Discourse

  42. Reconstruction Alignment Improves Unified Multimodal Models

    Sep 8, 2025Ji Xie, Trevor Darrell, Luke Zettlemoyer +1Multimodal ModelPost-Training

  43. Post-training for Efficient Communication via Convention Formation

    Aug 8, 2025Yilun Hua, Evan Wang, Yoav ArtziPost-TrainingMulti-Turn Interactions

  44. Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training

    Jul 7, 2025Song Lai, Haohan Zhao, Rong Feng +9Post-TrainingReinforcement Fine-Tuning

  45. EFC++: Elastic Feature Consolidation with Prototype Re-balancing for Cold Start Exemplar-free Incremental Learning

    Mar 13, 2025Simone Magistri, Tomaso Trinci, Albin Soutif-Cormerais +2Class-Incremental LearningLearnable Prototypes

  46. Unified Text-Image Generation with Weakness-Targeted Post-Training

    Date pendingJiahui Chen, Philippe Hansen-Estruch, Xiaochuang Han +7Multimodal GenerationText-To-Image

  47. Benford's Law as a Distributional Prior for Post-Training Quantization of Large Language Models

    Date pendingArthur Negrão, Pedro Silva, Vander L. S. Freitas +2Transformer ArchitecturesPost-Training

  48. TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards

    Date pendingMingxuan Cui, Jingpu Yang, Fengxian Ji +7Image-Text AlignmentFew-Shot Font Generation