Language Model Self-Improvement

Latest papers 119

All topics
CardsList
  1. ImproveAnyTask: An Autonomous Post-Training Harness for Iterative Model Self-Improvement

    Oct 5, 2026Xingbo Yao, Xiaoman Wang, Zhengwu Lei +11LLM Fine-TuningLLM Post-Training

  2. Questioning the Questions: Sustaining Self-Evolution in Reasoning Models

    Oct 3, 2026Jinyuan Li, Chengsong Huang, Langlin Huang +4Language Model Self-ImprovementSelf-Training for Language Models

  3. Prompt2Skill: Unsupervised Skill Optimization From Natural Language Instructions

    Sep 29, 2026Bo Ni, Li Li, Ryan A. Rossi +2LLM Agent Skill LearningLanguage Model Self-Improvement

  4. Direct Self-Evolving Optimization: Evolving LLMs without Challenger Training

    Sep 28, 2026Yuyang Deng, Yu Wang, Jiayun WangSelf-Training for Language ModelsLarge Language Model-Guided Optimization

  5. COEVO: Co-Evolving Context and Parameters for Recursive Self-Improvement

    Sep 27, 2026Siwei Chen, Xinping Bao, Xinyu Cai +3RL for Language ModelsPrompt Optimization

  6. NLPG: Natural-Language Policy Gradients for Self-Evolving Language Agents

    Sep 27, 2026Xu Liu, WenZhang Wei, Jun Cao +4Continual Learning for LLM AgentsPolicy Optimization

  7. Exact Feedback Is Not Control: Evaluating Text-based Closed-Loop Revision in LLMs

    Sep 23, 2026Haitong Jiang, Chunlin Liu, Yile Wang +1LLM Self-CorrectionControllable Text Generation

  8. STRETCH the Boundaries: A Unified Self-Taught Framework for Progressive LLM Evolution

    Sep 16, 2026Yajie Yu, Mark Lee, Yue FengSelf-Training for Language ModelsRL for Language Model Reasoning

  9. Smarter by the Moment: Environment-Driven Dynamic Policies for Continual LLM Improvement

    Sep 15, 2026Ting-Wei Chang, Po-Chun Chen, Hen-Hsen Huang +1Continual Learning for LLMsMemory-Augmented Language Models

  10. Data-Efficient Language Modeling: From Frontier Advancement to Principle-Guided Model Improvement

    Sep 12, 2026Shuxing Yang, Kaihao Zhu, Junjie Yang +13Efficient Language Model TrainingLanguage Modeling

  11. The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement

    Sep 10, 2026Yi Duan, Ying Liu, Zirui Tang +32Self-Improving AgentsLanguage Model Self-Improvement

  12. Negative Self-Distillation: Learning to Reason by Avoiding Flaws

    Sep 10, 2026Rongcan Pei, Zhepei Wei, Shuyao Xu +3Language Model DistillationSelf-Distillation

  13. Harness-agnostic detection and immunization of reward hacking in self-evolving language models

    Sep 7, 2026Rongxin Yang, Yang Liu, Shang Luo +10Reward HackingLanguage Model Self-Improvement

  14. FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

    Sep 3, 2026Zixun Huang, Kishan Panaganti, Haitao Mi +1RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  15. StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability?

    Sep 1, 2026Yinghao Chen, Zixi Chen, Bingxiang He +7Benchmark DesignLanguage Model Self-Improvement

  16. Learning What to Practice: Diagnosis-Guided Self-Evolution for Language Models

    Sep 1, 2026Xincheng Wei, Yifan Ding, Fucheng Xiong +6Self-Training for Language ModelsLanguage Model Self-Improvement

  17. Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

    Aug 31, 2026Zhiqin Yang, Jingwen Fu, Yuhan Liu +16Reinforcement LearningRL for Language Model Reasoning

  18. WebWorld: The Browser as a World Model for Self-Improving Web Code

    Aug 31, 2026Jiajun Wu, Jian Yang, Yaxin Du +7Self-Training for Language ModelsCode Generation

  19. DataFoundry: Evolving Data Preparators via Recursive Self-Improvement

    Aug 30, 2026Cehao Yang, Xiaojun Wu, Xueyuan Lin +4Training Data CurationDomain Adaptation for LLMs

  20. DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution

    Aug 12, 2026Siheng Xiong, Ali Payani, Oguzhan Gungordu +1Language Model Self-Improvement

  21. Dual-Loop Self-Evolution via Verifiable Emotion Feedback for Multi-Turn Empathetic Dialogue

    Aug 11, 2026Yi Wei, Shuo Jiang, Huaixia Dou +5Reinforcement Learning with Verifiable RewardsCurriculum Learning

  22. On-Policy Self-Distillation without Any Supervision

    Aug 6, 2026Yijiang Li, Bingyang Wang, Yijun Liang +3On-Policy Self-DistillationLanguage Model Self-Improvement

  23. Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index

    Aug 5, 2026Benjamin Barlog, Hudson Craig, Zedong PengLLM EvaluationLLM Alignment