Language Model Self-Improvement

Latest papers 119

All topics
CardsList
  1. Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents

    May 11, 2026Zhiyuan Fan, Wenwei Jin, Feng Zhang +4Reinforcement LearningLanguage Model Self-Improvement

  2. G-Zero: Self-Play for Open-Ended Generation from Zero Data

    May 11, 2026Chengsong Huang, Haolin Liu, Tong Zheng +7Open-Ended GenerationSelf-Play RL

  3. Self-Play Enhancement via Advantage-Weighted Refinement in Online Federated LLM Fine-Tuning

    May 8, 2026Seohyun Lee, Wenzhi Fang, Dong-Jun Han +2LLM Fine-TuningLanguage Model Self-Improvement

  4. SEIF: Self-Evolving Reinforcement Learning for Instruction Following

    May 8, 2026Qingyu Ren, Qianyu He, Jiajie Zhu +7RL for Language ModelsReinforcement Learning

  5. EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

    May 5, 2026Shuyue Stella Li, Rui Xin, Teng Xiao +8RL for Language ModelsLLM Evaluation

  6. Iterative Finetuning is Mostly Idempotent

    May 1, 2026Zephaniah Roe, Jack Sanderson, Dang Nguyen +5Supervised Fine-TuningLLM Post-Training

  7. From Context to Skills: Can Language Models Learn from Context Skillfully?

    Apr 30, 2026Shuzheng Si, Haozhe Zhao, Yu Lei +10In-Context LearningAgent Skill Learning

  8. IRIS: Interpolative Rényi Iterative Self-play for Large Language Model Fine-Tuning

    Apr 22, 2026Wenjie Liao, Like Wu, Liangjie Zhao +2Fine-TuningLLM Fine-Tuning

  9. Scaling Self-Play with Self-Guidance

    Apr 22, 2026Luke Bailey, Kaiyue Wen, Kefan Dong +2Self-Play RLAutomated Theorem Proving

  10. Self-Improving Tabular Language Models via Iterative Reward-Guided Post-Training

    Apr 21, 2026Yunbo Long, Tejumade Afonja, Guangya Hao +2Tabular Foundation ModelsGroup Relative Policy Optimization

  11. EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations

    Apr 20, 2026Yongrui Heng, Chaoya Jiang, Han Yang +2Synthetic Data GenerationMultimodal Large Language Models

  12. SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression

    Apr 20, 2026Shaowei Zhang, Faqiang Qian, Yan Chen +5RL for Language ModelsEmotion Recognition in Conversations

  13. Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning

    Apr 19, 2026Ziqing Zhuang, Linhai Zhang, Jiasheng Si +2Continual Learning for LLMsMeta-Learning

  14. Easy Samples Are All You Need: Self-Evolving LLMs via Data-Efficient Reinforcement Learning

    Apr 19, 2026Zhiyin Yu, Bo Zhang, Qibin Hou +3Self-Training for Language ModelsRL for Language Model Reasoning

  15. Peer-Predictive Self-Training for Language Model Reasoning

    Apr 14, 2026Shi Feng, Hanlin Zhang, Fan Nie +2Self-Training for Language ModelsLanguage Model Post-Training

  16. Maximizing Mutual Information Between Prompt and Response Improves LLM Performance With No Additional Data

    Mar 10, 2026Hyunji Nam, Haoran Li, Natasha JaquesLLM PersonalizationMutual Information Maximization

  17. TTSR: Test-Time Self-Evolving via Reflection

    Feb 6, 2026Haoyang He, Zihua Rong, Yunjia Zhao +3LLM Self-RefinementTest-Time Optimization

  18. Self-Improvement as Coherence Optimization: A Theoretical Account

    Jan 20, 2026Tianyi Qiu, Ahmed Hani Ismail, Zhonghao He +1Language Model Self-Improvement

  19. OpenSIR: Open-Ended Self-Improving Reasoner

    Nov 1, 2025Wai-Chung Kwan, Joshua Ong Jun Leang, Pavlos Vougiouklis +3Self-Play RLRL for Language Model Reasoning

  20. A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning

    Oct 21, 2025Mengqi Li, Lei Zhao, Anthony Man-Cho So +2Self-Training for Language ModelsMathematical Reasoning

  21. Discovering New Theorems via LLMs with In-Context Proof Learning in Lean

    Sep 16, 2025Kazumi Kasaura, Naoto Onda, Yuta Oriike +3Automated Theorem ProvingIn-Context Learning

  22. ReST-RL: Reinforcing LLM Reasoning through Unified Self-Training and Value-Guided Search

    Aug 27, 2025Sining Zhoubian, Dan Zhang, Jie TangRL for Code GenerationRL for Language Model Reasoning

  23. SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning

    Jul 22, 2025Xiuwei Chen, Wentao Hu, Hanhui Li +9Synthetic Data GenerationMultimodal Large Language Models

  24. RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner

    Oct 31, 2024Fu-Chieh Chang, Yu-Ting Lee, Hui-Ying Shih +2Reinforcement LearningRL for Language Model Reasoning

  25. EVOQUANT: Self-Evolving Verifier-Guided Strategy Optimization for Robust Quantitative Trading

    Date pendingJie Mao, Changlun Li, Xiang Li +6Large Language Model-Guided OptimizationLanguage Model Self-Improvement