Post-Training

Momentum

73 papers in the last four weeks, up 306% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 297

All topics
CardsList
  1. Finetuning with Sampling: SFT Learns Better Than You Think

    Oct 1, 2026Aayush Karan, Sitan Chen, Yilun DuSupervised FinetuningPost-Training

  2. Learn the Directions, Normalize the Gains: Post-Training Normalization for LoRA

    Oct 1, 2026Zailong Tian, Yanzhe Chen, Zhuoheng Han +2Balanced LearningRapid Adaptation

  3. On Language Drift during RLVR Post-Training

    Oct 1, 2026Michael Sullivan, Alexander KollerLarge Language Model Reinforcement LearningLLM Reasoning Strategies

  4. Sharpening Tax in Post-Training

    Oct 1, 2026Changdae Oh, Qi Zeng, Qi Qi +7Reinforcement Learning Post-TrainingPost-Training

  5. MMVistaReason: Toward Open-Data and Post-Training Recipes for Multimodal Reasoning

    Oct 1, 2026Juekai Lin, Honglin Lin, Yuqian Yuan +7Multimodal ReasoningPost-Training

  6. Video Generation Models: A Survey of Post-Training and Alignment

    Sep 30, 2026Chaoyu Li, Xiaoyi Gu, Yogesh Kulkarni +10Generative Video ModelsVideo Generation

  7. Ready2Blend: From Natural-Language Instructions to Composable Alignment Prompts

    Sep 30, 2026Jeesu Jung, Hwan Chang, Juseon Do +5Value AlignmentLarge Language Model Adaptation

  8. Aligned Data Can Induce Misalignment via Context Confusion

    Sep 29, 2026Yavuz Bakman, Duygu Nur Yaldiz, Baris Askin +4Large Language Model AlignmentTraining-Inference Mismatch

  9. On the Off-Policy Teacher in On-Policy Distillation

    Sep 29, 2026Langlin Huang, Hao Liu, Mononito Goswami +5Efficient On-Policy DistillationTeacher

  10. EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making

    Sep 29, 2026Yuhan Guo, Jinming Liu, Liang Xu +8WorldPost-Training

  11. Selective Channel Restoration for Backdoored Vision-Language Models

    Sep 29, 2026Shuming Liu, Zhifang Zhang, Suqin Yuan +3Model-Agnostic DefensePost-Training

  12. Direct Experience World-Model Optimization: Learning the World Beyond Action Imitation

    Sep 29, 2026Xiangcheng Zhan, Zirui Chen, Yicheng Zhao +2Efficient World-Action ModelWorld Models

  13. Trajectory Soup: Pushing the Compute-Scaling Frontier of LLM Mid-training via Diverse Trajectories

    Sep 29, 2026Zhehao Huang, Changxin Tian, Qingyuan Yang +5Large Language Model TrainingPost-Training

  14. What Does Post-Training Change in Multilingual Reasoning?

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +2Multilingual Language ModelsLLM Reasoning Strategies

  15. Beyond Compression: Diagnosing How Post-Training Changes Mathematical Reasoning

    Sep 29, 2026Hongyang Li, Yiming Zhu, Xiao Li +3Mathematical ReasoningPost-Training

  16. Salt++: Context-Aligned Post-Training for Few-Step Streaming Multimodal Generation

    Sep 29, 2026Xingtong Ge, Yutong Wang, Lunjie Zhu +7Audio-Video GenerationFew-Step Generation

  17. Can Language Models Learn to Forecast Stock Prices

    Sep 29, 2026Jiacheng Guo, Suozhi Huang, Shuzhen Li +11Post-Training

  18. WEFT: Scaling Tool-Use Post-Training for General-Purpose Agents

    Sep 29, 2026Bo Mao, Hang He, Linting Wang +17Production Agentic SystemsSelf-Evolution

  19. Calibrate the Decisions That Change the Future: On-Policy Post-Training Quantization for Multimodal Large Language Models

    Sep 29, 2026Wenxiao Fan, Jingling Fu, Lichen Ma +6Post-Training QuantizationPost-Training

  20. Where Should Physics Enter a Molecular Crystal Generator?

    Sep 28, 2026Haocheng Tang, Junmei Wang, Wengong JinCrystal StructureCrystal Structure Prediction

  21. Early Learning Shapes Later Directions Of Representation Change In Continual Learning

    Sep 28, 2026Yuantao Deng, Jinnuo Liu, Kaizhen Tan +1Neural Network RepresentationsContinual Learning

  22. Frontier Learning: Training LLM Reasoners at the Edge of Capability

    Sep 28, 2026Robin Faro, Shyam Sundhar Ramesh, Ilija Bogunovic +1LLM Reasoning StrategiesPost-Training

  23. RefineDrive: Reliable Failure-Guided Learning for Vision-Language-Action Driving

    Sep 28, 2026Zhe Sun, Ziyi Luo, Yehao Lu +2Autonomous DrivingDrives

  24. Nereus: Adaptive Parallelism for LLM Post-Training

    Sep 28, 2026Songlin Jiang, Tuo Shi, Sitong Zhang +3Post-Training

  25. Marathoner: Ultra-Long-Horizon Autonomous Intelligence

    Sep 28, 2026Zhang Ruiyang, Ou Jinpeng, Xie Yifan +4Robot StatePost-Training

  26. Improving Large Language Models for Code through Runtime Program-State Reasoning

    Sep 28, 2026Hongwei Li, Spandan Garg, Yufan HuangSwe-Bench VerifiedRuntime

  27. SegBanana: Steering Unified Multimodal Models into Medical Segmenters

    Sep 28, 2026Xiaoye Liang, Ye Yan, Mingze Yin +5Semi-Supervised Medical Image SegmentationMultimodal Model

  28. How code helps different tasks? A decompositional lens on LLM post-training

    Sep 27, 2026Zheng Yu, Yiwei Li, Yishen Chen +4Instruction-Tuned ModelsPost-Training

  29. Do We Really Need KL Divergence for On-Policy Distillation of Large Language Models?

    Sep 27, 2026Wenze Lin, Jiyuan Long, Jiale Zhao +11Kullback-Leibler DivergenceResidual Distillation

  30. A Cheap Verifier is Good Enough: LLM Post-training is Robust to Erroneous Rewards

    Sep 27, 2026Andreas Plesner, Curtis Northcutt, Francisco Guzmán +1Verification FrameworkLarge Language Model Judges

  31. Rufus-Air: An Open LLM Post-Training Recipe

    Sep 24, 2026Chia-Yuan Chang, Renyuan Cheng, Rui Feng +19Post-TrainingOffline Reinforcement Learning

  32. Transcript-Supervised Post-Training of Generative Speech Enhancement on Real Recordings via Reinforce Adjoint Matching

    Sep 24, 2026Julius Richter, Christoph Boeddeker, Yoshiki Masuyama +4Speech EnhancementPost-Training

  33. Post-Training Leaves Behavioral Shadows on Unrelated Decisions

    Sep 24, 2026Ziyang Zhang, Yubin Jing, Yuanhao Zeng +3Post-TrainingAgent Behavior Modeling

  34. Small yet Assistive: Spatially-Aware Post-Training for Low Vision

    Sep 23, 2026Rishabh Choudhary, Shreyansh Raj, Umesh Goyal +6Recent Vision-Language ModelsAssistive Agents

  35. Temporal Taxation Compounds Under Post-Training Compression of Whisper Models

    Sep 23, 2026Srishti Ginjala, Eric Fosler-Lussier, Christopher W. Myers +1Whisper-Large-V3Character Error Rate

  36. Thinking Leakage: A Causal Audit of NoThink Post-Training in Hybrid Reasoning Models

    Sep 23, 2026Zehao Liu, Vasant G. HonavarLarge Reasoning ModelsPost-Training

  37. Pistis Technical Report

    Sep 23, 2026Heyun Chen, Xiaohan Lan, Jiaxi Li +17Multimodal AgentsMultimodal Large Language Models

  38. Toolcompass: Guiding Tool Trialing, Not Suppressing It

    Sep 22, 2026Junlin Fang, Chong Zhang, Do Nguyen-Thanh +3Political Compass TestCall

  39. Reasoning-Preserving Fine-Tuning of Post-RL LLMs with Null-Basis LoRA

    Sep 22, 2026Wenzhi Fang, Nicholas Tzou, Lazar Valkov +1Model Fine-TuningPost-Training

  40. TelecomGPT-R1: Unified Post-Training for Reasoning Across Heterogeneous Telecom Tasks

    Sep 21, 2026Bohao Wang, Chenwei Wu, Hang Zou +7Large Reasoning ModelsLarge Language Models(Llms

  41. Trains but Doesn't Learn: A Post-Training Delivery Benchmark for LLM Agents as Forward-Deployed Engineers

    Sep 21, 2026Weihang Ding, Junfei ZhanAgentic DeploymentsLarge Language Model Agents

  42. Corrective Forcing: Unified Post-Training for Diffusions and Flows in Generative Speech Enhancement

    Sep 21, 2026Qing Yao, Lijian Gao, Qirong MaoSpeech EnhancementTraining-Inference Mismatch

  43. SupportCal: Label-Free Calibration of Post-Trained LLMs via Reference Support and Corroboration

    Sep 21, 2026Linhan Luo, Lequan Lin, Dai Shi +3Post-TrainingConfidence Calibration

  44. OPTED: On-Policy Fine-Tuning for End-to-End Driving using a Render-Free Teacher

    Sep 17, 2026Damiano Da Col, Maximilian Igl, Peter Karkus +5Autonomous DrivingReinforcement Learning Post-Training

  45. HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

    Sep 17, 2026Zimu Han, Yiming Zeng, Jiyao Zhang +9Generalist Vision--Language--ActionHuman-In-The-Loop

  46. Stress-testing Alignment Midtraining

    Sep 17, 2026Sid Baines, Jonathan Bostock, Maria Angelica Martinez +3Post-TrainingFrontier Models

  47. Towards High-DoF Dexterous Manipulation through VLA Post-Training

    Sep 17, 2026Junlei Zhu, Shenzhe Yao, Chaogui Huang +6Contact-Rich Dexterous ManipulationVision-Language-Action Framework

  48. Channel-Wise and Token-Aware Post-Training Quantization for Visual State Space Duality

    Sep 15, 2026Jonghyeon Lim, Changhoon YimPost-Training QuantizationVision State Space Models

  49. ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training

    Sep 15, 2026Zhihao Zhang, Mingqi Wu, Qiaole Dong +15Post-TrainingProcess-Level Supervision

  50. Performance, Efficiency and Collapse -- Advantages and Challenges in Offline Post-training of Code LLMs

    Sep 14, 2026Abhinav Anand, Sanjana Reddy Pachika, Shweta Verma +1Reinforcement Learning Post-TrainingLarge Language Model Training