LLM Post-Training

LLM: Large Language Model

Momentum

29 papers in the last four weeks, up 81% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 175

All topics
CardsList
  1. REVES: REvision and VErification--Augmented Training for Test-Time Scaling

    Jun 17, 2026Yuanxin Liu, Ruida Zhou, Xinyan Zhao +6LLM Self-CorrectionLLM Answer Verification

  2. When the Next Step Is Not One Step: Distribution-Aware Execution Modeling for Concurrent Go Programs

    Jun 16, 2026Kaviru HapuarachchiLLM Post-Training

  3. OdysSim: Building Foundation Models for Human Behavior Simulation

    Jun 12, 2026Xuhui Zhou, Weiwei Sun, Weihua Du +6Human Behavior SimulationAI Agent Benchmarks

  4. Provenance-Grounded Gating and Adaptive Recovery in Synthetic Post-Training Data Curation

    Jun 9, 2026Soham Bhattacharjee, Karun Sharma, Vinay Kumar Sankarapu +1Adaptive SamplingLLM Post-Training

  5. Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and Activation

    Jun 9, 2026Yupu Hao, Zhuoran Jin, Huanxuan Liao +2Knowledge Augmentation for Language ModelsInference-Time Scaling

  6. Training LLMs to Enforce Multi-Level Instruction Hierarchies via Gravity-Weighted Direct Preference Optimization

    Jun 9, 2026Lena S. Bolliger, Lena A. JägerDirect Preference OptimizationLLM Safety Alignment

  7. Trajectory-Refined Distillation

    Jun 7, 2026Li Jiang, Haoran Xu, Yichuan Ding +1On-Policy DistillationLLM Post-Training

  8. EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading

    Jun 4, 2026Zhihao Wu, Linhai Zhang, Taiyi Wang +4LLM-as-a-JudgeRubric-Based Evaluation

  9. Sequential Data Poisoning in LLM Post-Training

    Jun 3, 2026Jack Sanderson, Yihan Wang, Xiaoqian Lu +2LLM SecurityLLM Post-Training

  10. POLARIS: Guiding Small Models to Write Long Stories

    Jun 2, 2026Rishanth Rajendhran, Jenna Russell, Mohit Iyyer +1Length GeneralizationLLM Post-Training

  11. Physics-Guided Policy Optimization with Self-Distillation

    Jun 2, 2026Ke Wang, Yuning Wu, Haoran Liu +3On-Policy Self-DistillationPolicy Optimization

  12. Rethinking the Role of Tensor Decompositions in Post-Training LLM Compression

    Jun 2, 2026Artur Zagitov, Alexander Miasnikov, Maxim Krutikov +5LLM CompressionTensor Decomposition

  13. A Primer in Post-Training Reasoning Data: What We Know About How It Works

    Jun 1, 2026Yaoming Li, Guangxiang Zhao, Qilong Shi +3RL Post-TrainingLLM Post-Training

  14. ANDES: Agent Native Data Evolving Synthesis Tool for Autonomous Instruction Alignment

    May 31, 2026Zhengyang Zhao, Shengjie Ye, Lu Ma +3LLM AlignmentLLM Agent Skill Learning

  15. Trust Region On-Policy Distillation

    May 31, 2026Xingrun Xing, Haoqing Wang, Boyan Gao +2Language Model DistillationTrust-Region Optimization

  16. Enhancing LLM Metacognition via Cognitive Pairwise Training

    May 30, 2026Weitao Li, Hao Zhou, Xuanyu Lei +11Pairwise Preference LearningRL for Language Model Reasoning

  17. Representation Collapse in Sequential Post-Training of Large Language Models

    May 28, 2026Yichen Liu, Mingyu Chen, Hao Wang +7Continual Learning for LLMsRepresentation Collapse

  18. LLUMI: Improving LLM Writing Assistance for Mental Health Support with Online Community Feedback

    May 28, 2026Jiwon Kim, Maya Ajit, Sherry Gong +4Emotional Support ConversationPrivacy-Preserving Language Models

  19. Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs

    May 28, 2026Vinay Samuel, Yapei Chang, Mohit IyyerLLM AlignmentDirect Preference Optimization

  20. Rethinking Post-Training Recipes for Multimodal Time-Series Forecasting

    May 28, 2026Haoxin Liu, Yichen Zhou, Rajat Sen +2Multivariate Time Series ForecastingLLM Post-Training

  21. Diagnosing Harmful Continuation in Answer-Correct Long-CoT Training Traces

    May 28, 2026Chen He, Yuhao Wu, Lei Wang +2Fine-TuningLLM Fine-Tuning

  22. RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains

    May 27, 2026Haoxiang Jiang, Zihan Dong, Tianci Liu +5Reward ModelingRL for Language Models