Language Model Post-Training

Momentum

23 papers in the last four weeks, up 283% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 132

All topics
CardsList
  1. Shaer: Controlled Arabic Poetry Generation with Meter Subform and Semantic Conditioning

    Oct 7, 2026Ahmad Abbas, Tamara Fakih, Nour Fakih +1Controllable Text GenerationArabic NLP

  2. OTel: Open Telco AI Datasets, Benchmarks, and Models

    Oct 6, 2026Farbod Tavakkoli, Gregory Diamos, Kenneth Church +15Language Model Post-TrainingLLM Reranking

  3. Improving Diversity in LLM Short Story Generation

    Oct 5, 2026Zahra Solati Dehkordi, Vasileios LamposDiverse Text GenerationLanguage Model Post-Training

  4. Representation-Space MMD for Diffusion Language Models

    Oct 5, 2026Ilya Drobyshevskiy, Ilia Sudakov, Maksim Semenov +7Diffusion Model AlignmentMaximum Mean Discrepancy

  5. ImproveAnyTask: An Autonomous Post-Training Harness for Iterative Model Self-Improvement

    Oct 5, 2026Xingbo Yao, Xiaoman Wang, Zhengwu Lei +11LLM Fine-TuningLLM Post-Training

  6. FAER: Auditable Utility-Aligned Trajectory Replay for Language Model Post-Training

    Sep 30, 2026Miaobo Hu, Shuhao Hu, Xiaobo Guo +5LLM AuditingLanguage Model Post-Training

  7. Does Learning Protein Folding Generalize to Broader Reasoning?

    Sep 30, 2026Yong Liu, Zhanpeng Shi, Yizhou Dang +4Protein Structure PredictionStructured Reasoning

  8. What Does Post-Training Change in Multilingual Reasoning?

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +2Multilingual Language Model EvaluationCross-Lingual Reasoning in Language Models

  9. Can Language Models Learn to Forecast Stock Prices

    Sep 29, 2026Jiacheng Guo, Suozhi Huang, Shuzhen Li +11Financial ForecastingLLM-Based Time Series Forecasting

  10. RSI-Master: Structuring Experiments to Guide Autonomous Model Improvement

    Sep 28, 2026Yaxin Du, Xiyuan Yang, Zhifan Zhou +10Language Model Post-TrainingSelf-Improving Agents

  11. ABC-Align: Prediction-Powered Alignment with Adaptive Bias Control

    Sep 28, 2026Eric Frankel, Banghua Zhu, Sewoong Oh +1RL for Language ModelsLLM Alignment

  12. Where Do Test-Time Scaling and Training Fall Short in Individual Stance Prediction?

    Sep 27, 2026Yuyang Zhao, Xuan Liu, HaoYang Shang +1Test-Time ScalingHuman Behavior Prediction

  13. Post-Training Leaves Behavioral Shadows on Unrelated Decisions

    Sep 24, 2026Ziyang Zhang, Yubin Jing, Yuanhao Zeng +3Subliminal LearningLanguage Model Distillation

  14. Stress-testing Alignment Midtraining

    Sep 17, 2026Sid Baines, Jonathan Bostock, Maria Angelica Martinez +3LLM AlignmentLanguage Model Post-Training

  15. StalePO: Anchored Token-Level Preference Optimization using Legacy Post-Edits in Machine Translation

    Sep 14, 2026Rohit Dhaipule, Sukhdeep Singh Kharbanda, Prasanth Bathala +2Preference OptimizationLanguage Model Post-Training

  16. Training-Free Task Vectors for LLM Behavioral Control

    Sep 8, 2026Gabriel J. Perin, Lucas Boscaini, André Araujo +1Task VectorsAI Control

  17. You Can't Prefer Emotions You Don't Sample: Intensity Undershoot in DPO-Tuned LLMs

    Sep 7, 2026Hyunwoo Kim, Usama KhalidDirect Preference OptimizationValence-Arousal Modeling

  18. In-Place Instruction Following in Diffusion Language Models

    Sep 7, 2026Zheng Nie, Zherui Li, Jiaming Zhang +3Instruction FollowingDiffusion Language Models