On-Policy Self-Evolution

Latest papers 39

All topics
CardsList
  1. My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning

    Oct 1, 2026Yihua Zhu, Qianying Liu, Weixu Qiao +10Credit AssignmentAgentic Reinforcement Learning

  2. Direct Self-Evolving Optimization: Evolving LLMs without Challenger Training

    Sep 28, 2026Yuyang Deng, Yu Wang, Jiayun WangOn-Policy Self-EvolutionLLM Reasoning Strategies

  3. COEVO: Co-Evolving Context and Parameters for Recursive Self-Improvement

    Sep 27, 2026Siwei Chen, Xinping Bao, Xinyu Cai +3On-Policy Self-EvolutionRecursive Self-Improvement

  4. When Tomorrow Becomes Today: Self-Evolving Policies for Agentic Time-Series Forecasting

    Sep 21, 2026Yifan Hu, Xilin Dai, Zhiyuan Qu +4Time Series ForecastingData-Driven Forecasting

  5. EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning

    Sep 14, 2026Weiyuan Li, Aili Chen, Xintao Wang +11On-Policy Self-EvolutionOffline Reinforcement Learning

  6. Experience Funnel: A State-Policy Alternating Loop for Self-Evolving Agents

    Sep 8, 2026Wenbo Gao, Zhaomou Song, Zhiyuan Ji +7On-Policy Self-EvolutionSelf-Evolving Agents

  7. Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks

    Sep 8, 2026Hongbang Yuan, Zhuoran Jin, Yixin CaoOn-Policy Self-EvolutionSelf-Evolving Agents

  8. ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning

    Sep 1, 2026Fanrui Zhang, Ruixue Ding, Qiang Zhang +13On-Policy Self-EvolutionIcr-Rl

  9. RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States

    Aug 3, 2026Yi Yang, Zhennan Chen, Yihong Zhuang +5On-Policy Self-EvolutionPeak Memory

  10. Self-Improving Large Language Models via Progressive Experience Evolution

    Aug 3, 2026Shijie Ren, Xiting Wang, Meng Li +8Unsupervised On-Policy Self-DistillationOn-Policy Self-Evolution

  11. MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution

    Jul 24, 2026Alkis Sygkounas, Victor Aregbede, Amy Loutfi +1On-Policy Self-EvolutionRobot Policies

  12. Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning

    Jul 24, 2026Shujin Wu, Cheng Qian, Xiusi Chen +1On-Policy Self-EvolutionSelf-Evolution

  13. Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

    Jul 14, 2026Yaopei Zeng, Congchao Wang, JianHang Chen +3Large Language Model AgentsConfidence Estimation

  14. EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

    Jul 2, 2026Zhilin Wang, Han Song, Runzhe Zhan +13On-Policy Self-EvolutionSkillgym

  15. DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

    Jun 29, 2026Haisen Luo, Yiwei Liu, Haoning Wang +13Unsupervised On-Policy Self-DistillationLarge Language Model Reinforcement Learning

  16. EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

    Jun 22, 2026Hongxin Ding, Baixiang Huang, Yue Fang +6On-Policy Self-EvolutionLarge Language Model Reinforcement Learning

  17. REFLEX: Reflective Evolution from LLM Experience

    Jun 15, 2026Pan WangLarge Language Model Policy OptimizationOn-Policy Self-Evolution

  18. Self-evolving LLM agents with in-distribution Optimization

    Jun 5, 2026Yudi Zhang, Meng Fang, Zhenfang Chen +1On-Policy Self-EvolutionSelf-Evolving Agents

  19. Rethinking Continual Experience Internalization for Self-Evolving LLM Agents

    Jun 3, 2026Jingwen Chen, Wenkai Yang, Shengda Fan +7InternalizationOn-Policy Self-Evolution

  20. EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

    Jun 2, 2026Guhong Chen, Yingcheng Shi, Yongbin Li +6On-Policy Self-EvolutionAgentic Reinforcement Learning

  21. EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models

    May 12, 2026Zhikai Zhao, Chuanbo Hua, Federico Berto +4Robot NavigationOn-Policy Self-Evolution

  22. Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents

    May 11, 2026Zhiyuan Fan, Wenwei Jin, Feng Zhang +4On-Policy Self-EvolutionSelf-Evolving Agents

  23. Teacher-Aware Evolution of Heuristic Programs from Learned Optimization Policies

    May 11, 2026Minyu Chen, Song Qin, Ling-I Wu +2Automated Heuristic DesignEvolutionary Search

  24. Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

    May 11, 2026Huilin Zhou, Jian Zhao, Yilu Zhong +7Large Language Model JailbreaksOn-Policy Self-Evolution

  25. Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents

    May 9, 2026Minzheng Wang, Run Luo, Yanbo Wang +6On-Policy Self-Evolution

  26. RewardHarness: Self-Evolving Agentic Post-Training

    May 9, 2026Yuxuan Zhang, Penghui Du, Bo Li +11Progress Reward ModelingMulti-Image Editing Benchmarks

  27. SEIF: Self-Evolving Reinforcement Learning for Instruction Following

    May 8, 2026Qingyu Ren, Qianyu He, Jiajie Zhu +7On-Policy Self-EvolutionInstruction

  28. Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence

    Apr 20, 2026Guanting Dong, Junting Lu, Junjie Huang +17Synthetic EnvironmentsSelf-Evolving Agents

  29. Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration

    Apr 20, 2026Qifan Zhang, Dongyang Ma, Tianqing Fang +5On-Policy Self-EvolutionSelf-Evolution

  30. Survival Dynamics of Neural and Programmatic Policies in Evolutionary Reinforcement Learning

    Jan 7, 2026Anton Roupassov-Ruiz, Yiyang ZuoNeural PoliciesOn-Policy Self-Evolution

  31. Illuminating the Three Dogmas of Reinforcement Learning under Evolutionary Light

    Jul 15, 2025Mani Hamidi, Terrence W. DeaconOn-Policy Self-EvolutionAgentic Control