Language Model Self-Improvement

Latest papers 119

All topics
CardsList
  1. Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement

    Aug 4, 2026Chunyang Jiang, Pingping Zhang, Yuzhi Zhao +9Synthetic Data AugmentationData Augmentation

  2. Self-Improving Large Language Models via Progressive Experience Evolution

    Aug 3, 2026Shijie Ren, Xiting Wang, Meng Li +8RL for Language Model ReasoningLanguage Model Self-Improvement

  3. SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

    Jul 29, 2026Jianze Wang, Kunwang Zheng, Ying Liu +5Reinforcement LearningTest-Time RL

  4. DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

    Jul 28, 2026Jiangwang Chen, Zixin Song, Junlin Liu +10Large Language Model-Guided OptimizationLanguage Model Self-Improvement

  5. From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

    Jul 26, 2026Qinsi Wang, Jing Shi, Huazheng Wang +8Self-Play RLReinforcement Learning with Verifiable Rewards

  6. Learning from Synthetic Data without Model Collapse in Iterative Instruction Tuning

    Jul 19, 2026Xiaonan Luo, Yue Huang, Kehan Guo +4Self-Training for Language ModelsModel Collapse

  7. Consensus as Privileged Context for Label-Free Self-Distillation

    Jul 15, 2026John Gkountouras, Josip Jukić, Ivan TitovSelf-Training for Language ModelsLanguage Model Distillation

  8. Self-Improving is Often Sudden: Enlightenment-style Finetuning for Large-Scale Models

    Jul 15, 2026Jing-Xiao Liao, Tianwei Zhang, Yu-Hao Jiang +3LLM Fine-TuningLanguage Model Self-Improvement

  9. Hallucination Self-Play: Bootstrapping Reinforced Detector via Evolved Generator

    Jul 8, 2026Shiping Yang, Shining Liang, Weihao Liu +4LLM Hallucination DetectionSynthetic Data Generation for Language Models

  10. Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops

    Jul 8, 2026Mingguang Chen, Licheng Wang, Bo QuLLM Self-RefinementHuman-in-the-Loop Evaluation

  11. Self-Reference in Large Language Models: The Introspection Threshold for Recursive Self-Improvement

    Jul 5, 2026Jiang Zhang, Bing Yuan, Qian ZhangLanguage Model IntrospectionLanguage Model Self-Improvement

  12. AutoTrainess: Teaching Language Models to Improve Language Models Autonomously

    Jun 30, 2026Zhaojian Yu, Penghao Yin, Shuzheng Gao +3Tool-Augmented Language Model AgentsLLM Tool Use

  13. On the Convergence of Self-Improving Online LLM Alignment

    Jun 30, 2026Xudong Wu, Pangpang Liu, Vaneet Aggarwal +1LLM AlignmentOptimization Convergence Analysis

  14. What Drives Interactive Improvement from Feedback?

    Jun 29, 2026Bartłomiej Cupiał, Jan Łojek, Mikołaj Garstecki +3LLM Self-RefinementLLM Agent Evaluation

  15. DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

    Jun 29, 2026Haisen Luo, Yiwei Liu, Haoning Wang +13Self-Training for Language ModelsRL for Language Model Reasoning

  16. When Rules Learn: A Self-Evolving Agent for Legal Case Retrieval

    Jun 15, 2026Mingxu Tao, Jiawei Hu, Xian Zhou +5Legal NLPLegal IR

  17. Integrating Reasoning and Generalization in Text-to-SQL via Self-Enhanced Fine-Tuning

    Jun 14, 2026Feng Lyu, Jinfeng Cen, Sijing Duan +4Self-Training for Language ModelsLLM Fine-Tuning

  18. From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI

    Jun 12, 2026Yongheng Zhang, Ziang Liu, Jiaxuan Zhu +17LLM Tool UseLong-Horizon LLM Agents

  19. Self-Evolving Visual Questioner

    Jun 11, 2026Yijun Liang, Hengguang Zhou, Ming Li +3Visual Question AnsweringLanguage Model Self-Improvement

  20. INFUSER: Influence-Guided Self-Evolution Improves Reasoning

    Jun 8, 2026Siyu Chen, Miao Lu, Beining Wu +7RL for Language Model ReasoningGroup Relative Policy Optimization

  21. More Yap Less Meaning: Uncovering Self-Improvement Behavior in SLMs

    Jun 7, 2026Marina Igitkhanian, Erik ArakelyanLLM Self-CorrectionTest-Time Scaling

  22. Self-Evolving Deep Research via Joint Generation and Evaluation

    Jun 3, 2026Han Zhu, Chengkun Cai, Yuanfeng Song +3LLM EvaluationLLM Agent Training