Language Model Post-Training

Momentum

23 papers in the last four weeks, up 283% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 132

All topics
CardsList
  1. Extremely Sparse Supervision Incentivizes Reasoning Ability

    Sep 7, 2026Zhishuai Liu, Xingzi Xu, Mehmet Saygin Seyfioglu +2On-Policy DistillationLanguage Model Post-Training

  2. Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPO

    Sep 1, 2026Prakhar Gupta, Vaibhav GuptaRL for Language ModelsLLM Grounding

  3. Instella-MoE Technical Report

    Sep 1, 2026Jiang Liu, Sudhanshu Ranjan, Prakamya Mishra +10Mixture-of-Experts Language ModelsLanguage Model Post-Training

  4. SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards

    Aug 31, 2026Zixun Guo, Calvin Murdock, Sanjeel Parekh +4Audio-Language ModelsSpatial Audio

  5. TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

    Aug 30, 2026Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3Audio UnderstandingAudio-Language Models

  6. Automated Researchers Can Mitigate Well-characterized Alignment Failures

    Aug 28, 2026Chen Yueh-Han, Jiaxin Wen, Jan Hendrik KirchnerAI AlignmentLLM Safety Alignment

  7. Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training

    Aug 3, 2026Zhiyuan Wang, Shengcai Liu, Jiahao Wu +5Evolutionary OptimizationEvolution Strategies

  8. Rewriting or Reweighting? A Geometric Account in Language Models

    Aug 3, 2026Juntong Wang, Shengkun Yang, Xiyuan Wang +1Language Model Post-TrainingRepresentation Geometry in Language Models

  9. Training Language Models to Cooperate with Inference-Time Controllers

    Jul 26, 2026Moumita Choudhury, Vanshaj Khattar, Jing Liu +4RL for Language Model ReasoningLLM Post-Training

  10. The Two-Process Theory of Machine Self-Report

    Jul 22, 2026Hubert Plisiecki, Filip Chmielewski, Kacper Dudzic +3Personality Modeling in Language ModelsLanguage Model Self-Assessment

  11. Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift

    Jul 20, 2026Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu +1Grounded Text GenerationOOD Generalization

  12. After the Euclidean Highway: Hyperbolic Expert AI as the Next Innovation

    Jul 20, 2026Kwan Soo Shin, In Seok Kang, Munho LeeLanguage ModelingLanguage Model Post-Training

  13. TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter

    Jul 17, 2026Oliver Savolainen, Emanuele Bastianelli, Hosein AzarbonyadAutomatic Prompt OptimizationLanguage Model Post-Training

  14. Loop the Loopies!

    Jul 17, 2026Zitian Gao, Yilong Chen, Yihao Xiao +4Mixture-of-Experts Language ModelsRecurrent Transformers

  15. Exploring Post-Training Alignment of Small Language Models for Biomedical Data-to-Text Generation: A Case Study of Medication Leaflet

    Jul 15, 2026Xi Yang, Guodong Liu, Chuqin Li +10LLM AlignmentSmall Language Models

  16. Index SLM Technical Report

    Jul 10, 2026Lusheng Zhang, Shien He, Tianxing Yan +5Language Model PretrainingSmall Language Models

  17. DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

    Jul 8, 2026Jordan Painter, Dipankar Srirag, Adarsh Kappiyath +3Language Model PretrainingLLM Alignment

  18. Aligning Language Models with Selective Prediction

    Jul 3, 2026Gaoxiang Luo, Yifan Wu, Sinian Zhang +2RL for Language ModelsLLM Alignment

  19. CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

    Jul 2, 2026Fangfei Li, Chenyang Zhao, Long Wang +3LLM Agent EvaluationLLM Post-Training

  20. MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

    Jun 29, 2026Wenhan Ma, Jianyu Wei, Liang Zhao +10Multi-Teacher Knowledge DistillationOn-Policy Distillation

  21. OracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training

    Jun 24, 2026Zijia Song, Yelin Wang, Zhengyi Ma +5VLM ReasoningPreference Optimization

  22. Post-Training Speech Enhancement Language Models with Perceptual Rewards

    Jun 19, 2026Frédéric Berdoz, Luca A. Lanzendörfer, Antonis Asonitis +1Multi-Objective Reinforcement LearningRL for Language Models

  23. How Post-Training Shapes Biological Reasoning Models

    Jun 15, 2026Lukas Fesser, Hanlin Zhang, Michelle M. Li +5Neural Network GeneralizationSupervised Fine-Tuning