Language Model Post-Training

Momentum

23 papers in the last four weeks, up 283% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 132

All topics
CardsList
  1. TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

    May 12, 2026Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van +3Pairwise Preference LearningLLM Alignment

  2. On Predicting the Post-training Potential of Pre-trained LLMs

    May 12, 2026Xiaoyuan Li, Yubo Ma, Kexin Yang +5LLM EvaluationLanguage Model Post-Training

  3. From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation

    May 12, 2026Guobin Shen, Lei Huang, Xiang Cheng +4Reinforcement LearningOn-Policy Self-Distillation

  4. Annotations Mitigate Post-Training Mode Collapse

    May 11, 2026Jacob Mitchell Springer, Madhu Advani, Lukas Aichberger +7Supervised Fine-TuningDiverse Text Generation

  5. Post-training makes large language models less human-like

    May 8, 2026Marcel Binz, Elif Akata, Abdullah Almaatouq +76LLM EvaluationLLM Alignment

  6. Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

    May 8, 2026Pingbang Hu, Xueshen Liu, Z. Morley Mao +1Supervised Fine-TuningTraining Data Selection

  7. Post-Reasoning: Improving the Performance of Non-Thinking Models at No Cost

    May 7, 2026Richmond Sin Jing Xuan, Rishabh Bhardwaj, Soujanya PoriaLLM PromptingLanguage Model Post-Training

  8. EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

    May 5, 2026Shuyue Stella Li, Rui Xin, Teng Xiao +8RL for Language ModelsLLM Evaluation

  9. Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare

    Apr 30, 2026Jasmine Brazilek, Harper DunnMoral Reasoning in Language ModelsLanguage Model Post-Training

  10. Instruction-Guided Poetry Generation in Arabic and Its Dialects

    Apr 30, 2026Abdelrahman Sadallah, Kareem Elozeiri, Mervat Abassy +5Arabic NLPControllable Text Generation

  11. Backtranslation Augmented Direct Preference Optimization for Neural Machine Translation

    Apr 28, 2026Mehrdad Ghassabi, Spehr Rajabi, Hamidreza Baradaran Kashani +3Language Model Post-TrainingMachine Translation

  12. S2\mathcal{S}^2IT: Stepwise Syntax Integration Tuning for Large Language Models in Aspect Sentiment Quad Prediction

    Apr 25, 2026Bingfeng Chen, Chenjie Qiu, Yifeng Xie +3LLM Fine-TuningAspect-Based Sentiment Analysis

  13. On Reasoning Behind Next Occupation Recommendation

    Apr 23, 2026Shan Dong, Palakorn Achananuparp, Hieu Hien Mai +3Large Language Model-Based RecommendationLanguage Model Post-Training

  14. Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech

    Apr 22, 2026Siqi Ouyang, Shuoyang Ding, Oleksii Hrinchuk +4RL for Language ModelsSpeech Translation

  15. Self-Improving Tabular Language Models via Iterative Reward-Guided Post-Training

    Apr 21, 2026Yunbo Long, Tejumade Afonja, Guangya Hao +2Tabular Foundation ModelsGroup Relative Policy Optimization

  16. Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts

    Apr 20, 2026Jacob Morrison, Sanjay Adhikesaven, Akshita Bhagia +3Continual Learning for LLMsMixture-of-Experts Language Models

  17. Post-training is (Massive) Supervised Learning

    Apr 20, 2026Michael Hassid, Yossi Adi, Roy SchwartzSupervised Fine-TuningLanguage Model Post-Training

  18. PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs

    Apr 19, 2026Yuting Huang, Yinghao Hu, Qian Xiao +7LLM GroundingLanguage Model Post-Training

  19. Jupiter-N Technical Report

    Apr 19, 2026George DraysonLLM AlignmentCultural Alignment