Self-Training for Language Models

Latest papers 41

All topics
CardsList
  1. Environmental Feedback Modeling Matters: Rethinking Feedback Treatment in Agentic Hindsight Self-Distillation

    Oct 8, 2026Hangxi Guo, Fengyuan Liu, Yue Wang +4LLM Agent TrainingSelf-Distillation

  2. Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation

    Oct 4, 2026Cheng Luo, Bing Li, Bernard GhanemTest-Time AdaptationContinual Test-Time Adaptation

  3. Questioning the Questions: Sustaining Self-Evolution in Reasoning Models

    Oct 3, 2026Jinyuan Li, Chengsong Huang, Langlin Huang +4Language Model Self-ImprovementSelf-Training for Language Models

  4. SE-ADD: Self-Evolving Audio Deepfake Detection with Mistake-Driven Supervision

    Sep 30, 2026Rong Wan, Wei Xie, Jiaxi Li +4Audio Deepfake DetectionSelf-Training for Language Models

  5. Shockingly Simple Self-retrospection Improves Agentic Models Without RL

    Sep 28, 2026Jonathan Light, Christopher Zhang Cui, Jeonghye Kim +7Self-Training for Language ModelsLLM Agent Self-Improvement

  6. Teach to Learn: Hint Annealing for Self-improving LLM Reasoning

    Sep 28, 2026Zile Wang, Zijian Li, Haodong Wang +5Reinforcement LearningSelf-Training for Language Models

  7. Direct Self-Evolving Optimization: Evolving LLMs without Challenger Training

    Sep 28, 2026Yuyang Deng, Yu Wang, Jiayun WangSelf-Training for Language ModelsLarge Language Model-Guided Optimization

  8. Not Too Hard, Not Too Easy: Learning from Intermediate States for LLM Structured Reasoning

    Sep 27, 2026Hongbo Chen, Guohua Lu, Ting Dang +1Self-Training for Language ModelsStructured Reasoning

  9. STRETCH the Boundaries: A Unified Self-Taught Framework for Progressive LLM Evolution

    Sep 16, 2026Yajie Yu, Mark Lee, Yue FengSelf-Training for Language ModelsRL for Language Model Reasoning

  10. From Rollouts to Recipes: Self-Contained Post-Training for LLMs

    Sep 1, 2026Yifei Li, Lingling Zhang, Muye Huang +3Self-Training for Language ModelsRL for Language Model Reasoning

  11. Learning What to Practice: Diagnosis-Guided Self-Evolution for Language Models

    Sep 1, 2026Xincheng Wei, Yifan Ding, Fucheng Xiong +6Self-Training for Language ModelsLanguage Model Self-Improvement

  12. WebWorld: The Browser as a World Model for Self-Improving Web Code

    Aug 31, 2026Jiajun Wu, Jian Yang, Yaxin Du +7Self-Training for Language ModelsCode Generation

  13. Learning to Reason and Use Tools through Unsupervised Fine-Tuning in Task-Oriented Dialog Systems

    Aug 31, 2026Markel Ferro, Oier Lopez de LacalleSelf-Training for Language ModelsLLM Fine-Tuning

  14. Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast

    Aug 9, 2026Jiaxin Guo, Yanwei Yue, Xuanbo Fan +2Self-Training for Language ModelsLanguage Model Distillation

  15. The Fairness Collapse Phenomenon: Bias Amplification in Language Models Trained on Synthetic Data

    Aug 4, 2026Irina Proskurina, Antoine Gourru, Julien VelcinSynthetic Data PretrainingSelf-Training for Language Models

  16. Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

    Aug 1, 2026Zhuowen Han, Jinwei Xiao, Zhengxi Lu +9Self-Training for Language ModelsRL for Language Model Reasoning

  17. Learning from Synthetic Data without Model Collapse in Iterative Instruction Tuning

    Jul 19, 2026Xiaonan Luo, Yue Huang, Kehan Guo +4Self-Training for Language ModelsModel Collapse

  18. Consensus as Privileged Context for Label-Free Self-Distillation

    Jul 15, 2026John Gkountouras, Josip Jukić, Ivan TitovSelf-Training for Language ModelsLanguage Model Distillation

  19. DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

    Jun 29, 2026Haisen Luo, Yiwei Liu, Haoning Wang +13Self-Training for Language ModelsRL for Language Model Reasoning

  20. Integrating Reasoning and Generalization in Text-to-SQL via Self-Enhanced Fine-Tuning

    Jun 14, 2026Feng Lyu, Jinfeng Cen, Sijing Duan +4Self-Training for Language ModelsLLM Fine-Tuning

  21. Not All Synthetic Data Is Yours to Learn From

    May 29, 2026Sina Alemohammad, Li Chen, Richard G. Baraniuk +1Synthetic Data PretrainingMemorization in Language Models