Language Model Self-Improvement

Latest papers 119

All topics
CardsList
  1. On the Generalization Gap in Self-Evolving Language Model Reasoning

    May 31, 2026Zhenting Qi, Susanna Maria Baby, Stefanie Anna Baby +5LLM Self-RefinementLanguage Modeling

  2. SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks

    May 29, 2026Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang +1Open-Ended GenerationSelf-Play RL

  3. Not All Synthetic Data Is Yours to Learn From

    May 29, 2026Sina Alemohammad, Li Chen, Richard G. Baraniuk +1Synthetic Data PretrainingMemorization in Language Models

  4. Self-Improving Language Models with Bidirectional Evolutionary Search

    May 27, 2026Guowei Xu, Zhenting Qi, Huangyuan Su +4Evolutionary OptimizationLLM Planning

  5. CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning

    May 27, 2026Linas Nasvytis, Simon Jerome Han, Ben Prystawski +3LLM Self-RefinementEfficient Language Model Reasoning

  6. SIA: Self Improving AI with Harness & Weight Updates

    May 26, 2026Prannay Hebbar, Yogendra Manawat, Samuel Verboomen +4Agent Harness OptimizationLLM Agent Self-Improvement

  7. Better, Faster: Harnessing Self-Improvement in Large Reasoning Models

    May 24, 2026Qihuang Zhong, Liang Ding, Juhua Liu +3Overthinking in Language ModelsRL for Language Model Reasoning

  8. Model Collapse as Cultural Evolution

    May 21, 2026Dongxin Guo, Jikun Wu, Siu Ming YiuCultural EvolutionSelf-Training for Language Models

  9. Self-Policy Distillation via Capability-Selective Subspace Projection

    May 21, 2026Guangya Hao, Yitong Shang, Yunbo Long +2Self-Training for Language ModelsLanguage Model Distillation

  10. One-Way Policy Optimization for Self-Evolving LLMs

    May 21, 2026Shuo Yang, Jinda Lu, Kexin Huang +6Policy OptimizationReinforcement Learning with Verifiable Rewards

  11. RISE: Reliable Improvement in Self-Evolving Vision-Language Models

    May 20, 2026Chaoran Xu, Yingmao Miao, Pengfei Zhang +3Vision-Language ModelsVLM Adaptation

  12. LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

    May 19, 2026Yanyu Chen, Jiyue Jiang, Dianzhi Yu +8RL for Language Model ReasoningProcess Supervision

  13. Test-Time Learning with an Evolving Library

    May 14, 2026Weijia Xu, Alessandro Sordoni, Chandan Singh +4Memory-Augmented Language ModelsContinual Test-Time Adaptation

  14. Query-Conditioned Test-Time Self-Training for Large Language Models

    May 13, 2026Chaehee Song, Minseok Seo, Yeeun Seong +2Test-Time AdaptationTest-Time Optimization

  15. STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning

    May 13, 2026Junjie Zhang, Guozheng Ma, Shunyu Liu +5RL for Language Model ReasoningProcess Supervision

  16. ICRL: Learning to Internalize Self-Critique with Reinforcement Learning

    May 13, 2026Jianbo Lin, Xiaomin Yu, Yi Xin +7RL for Language ModelsLLM Self-Refinement

  17. AcquisitionSynthesis: Targeted Data Generation using Acquisition Functions

    May 13, 2026Ishika Agarwal, Sofia Stoica, Emre Can Acikgoz +4Synthetic Data GenerationSynthetic Data Generation for Language Models

  18. NOVA: Fundamental Limits of Knowledge Discovery Through AI

    May 12, 2026Salman Avestimehr, Ken Duffy, Muriel MédardAdaptive SamplingAutonomous Scientific Discovery

  19. Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation

    May 12, 2026Yuwei Zhang, Sha Li, Changlong Yu +9Continual Learning for LLMsSelf-Distillation

  20. Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training

    May 12, 2026Qihuang Zhong, Liang Ding, Wenjie Xuan +3Multimodal Large Language ModelsMultimodal Reasoning

  21. Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling

    May 11, 2026Yizhu Jiao, Ruixiang Zhang, Richard Bai +3RL for Code GenerationTest-Time Scaling