LLM Post-Training

LLM: Large Language Model

Momentum

29 papers in the last four weeks, up 81% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 175

All topics
CardsList
  1. Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines

    May 1, 2026Hugo Abonizio, Filipe Rocha Lopes, Roberto Lotufo +1Knowledge Augmentation for Language ModelsHealthcare

  2. Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors

    May 1, 2026Chaohao Yuan, Chenghao Xiao, Yu Rong +2Task ArithmeticLanguage Model Merging

  3. Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers

    Apr 28, 2026Jan Dubiński, Jan Betley, Anna Sztyber-Betley +2Language Model Safety EvaluationEmergent Misalignment in Language Models

  4. Compute Aligned Training: Optimizing for Test Time Inference

    Apr 27, 2026Adam Ousherovitch, Ambuj TewariTest-Time OptimizationInference-Time Scaling

  5. SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

    Apr 26, 2026Alexis Limozin, Eduard Durech, Torsten Hoefler +2RL for Language Model ReasoningPolicy Optimization

  6. Training a General Purpose Automated Red Teaming Model

    Apr 24, 2026Aishwarya Padmakumar, Leon Derczynski, Traian Rebedea +1Adversarial Attacks on LLMsLLM Red Teaming

  7. Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text

    Apr 21, 2026Chengyu Huang, Sheng-Yen Chou, Zhengxin Zhang +1Self-Play RLLLM Post-Training

  8. Easy Samples Are All You Need: Self-Evolving LLMs via Data-Efficient Reinforcement Learning

    Apr 19, 2026Zhiyin Yu, Bo Zhang, Qibin Hou +3Self-Training for Language ModelsRL for Language Model Reasoning

  9. AutoOR: Scalably Post-training LLMs to Autoformalize Operations Research Problems

    Apr 18, 2026Sumeet Ramesh Motwani, Chuan Du, Aleksander Petrov +4LLM Post-TrainingRL Fine-Tuning

  10. Evaluating the Progression of Large Language Model Capabilities for Small-Molecule Drug Design

    Apr 17, 2026Shriram Chennakesavalu, Kirill Shmilovich, Hayley Weir +5LLM EvaluationMolecular Property Prediction

  11. Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO

    Apr 17, 2026Arash Ahmadi, Parisa Masnadi, Sarah Sharif +3RL for Language ModelsHealthcare

  12. Maximizing Mutual Information Between Prompt and Response Improves LLM Performance With No Additional Data

    Mar 10, 2026Hyunji Nam, Haoran Li, Natasha JaquesLLM PersonalizationMutual Information Maximization

  13. SWE-Tester: Training Open-Source LLMs for Issue Reproduction in Real-World Repositories

    Jan 20, 2026Aditya Bharat Soni, Rajat Ghosh, Vaishnavi Bhargava +2LLM Post-TrainingAutomated Test Generation

  14. Aligning LLMs with Biomedical Knowledge using Balanced Fine-Tuning

    Nov 26, 2025Zhenchao Tang, Fang Wang, Haohuai He +13LLM AlignmentLLM Fine-Tuning

  15. Value Drifts: Tracing Value Alignment During LLM Post-Training

    Oct 30, 2025Mehar Bhatia, Shravan Nayak, Gaurav Kamath +4LLM AlignmentPreference Optimization

  16. A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning

    Oct 21, 2025Mengqi Li, Lei Zhao, Anthony Man-Cho So +2Self-Training for Language ModelsMathematical Reasoning

  17. Strengthening LLMs for Tabular Prediction with Structural Priors

    Oct 20, 2025Pengxiang Cai, Zihao Gao, Wanchen Lian +2Tabular Foundation ModelsRL for Language Models

  18. LLP: LLM-Based Product Pricing in E-commerce

    Oct 10, 2025Hairu Wang, Sheng You, Qiheng Zhang +5E-CommerceLLM Post-Training

  19. Post-training for Efficient Communication via Convention Formation

    Aug 8, 2025Yilun Hua, Evan Wang, Yoav ArtziLLM EvaluationLLM Post-Training

  20. Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training

    Jul 7, 2025Song Lai, Haohan Zhao, Rong Feng +9Continual Learning for LLMsLLM Post-Training

  21. Tuning without Peeking: Provable Generalization Bounds and Robust LLM Post-Training

    Jul 2, 2025Ismail Labiad, Mathurin Videau, Matthieu Kowalski +4Privacy-Preserving Language ModelsEvolutionary Optimization

  22. Dual-Difficulty Curriculum Learning for Direct Preference Optimization

    Apr 10, 2025Mengyang Li, Haozhan Geng, Zhong Zhang +1Pairwise Preference LearningLLM Alignment

  23. Unified Text-Image Generation with Weakness-Targeted Post-Training

    Date pendingJiahui Chen, Philippe Hansen-Estruch, Xiaochuang Han +7Unified Multimodal ModelsT2I Generation