RL for Code Generation

RL: Reinforcement Learning

Momentum

14 papers in the last four weeks, up 367% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 89

All topics
CardsList
  1. Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

    Jul 23, 2026Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali JannesariRL for Code GenerationGPU Kernel Optimization

  2. GFlowRL: Scaling Distribution-Matching RL to Large Language Models

    Jul 15, 2026Xiaodong Liu, Michael Xu, Jack W. Stokes +3RL for Code GenerationReinforcement Learning

  3. Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards

    Jul 11, 2026Pengfei Cai, Utkarsh Utkarsh, Alan Edelman +2RL for Code GenerationScientific Code Generation

  4. Anchored Self-Play for Code Repair

    Jul 3, 2026Caroline Choi, Zeyneb Kaya, Shirley Wu +3RL for Code GenerationAutomated Program Repair

  5. DecompRL: Solving Harder Problems by Learning Modular Code Generation

    Jul 2, 2026Juliette Decugis, Fabian Gloeckle, Francis Bach +2RL for Code GenerationCode Generation

  6. The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning

    Jul 1, 2026Daniel Thi Graviet, Lovre Pesut, Ivan Dagelic +2RL for Code GenerationSoftware Engineering Agents

  7. UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

    Jun 30, 2026Yaozhi Zheng, Yilei Jiang, Manyuan Zhang +5RL for Code GenerationReinforcement Learning

  8. Reinforcement Learning without Ground-Truth Solutions can Improve LLMs

    Jun 25, 2026Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang +6RL for Code GenerationReinforcement Learning

  9. Reinforcement learning to improve large language model-based automated code compliance systems

    Jun 21, 2026Jack Wei Lun Shi, Minghao Dang, Wawan Solihin +2RL for Code GenerationLLM Code Generation

  10. When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study

    Jun 18, 2026Xiaolong Jin, Xuandong Zhao, Wenbo Guo +2RL for Code GenerationIntrinsic Reward Methods

  11. StepPRM-RTL: Stepwise Process-Reward Guided LLM Fine-Tuning for Enhanced RTL Synthesis

    Jun 2, 2026Prashanth Vijayaraghavan, Apoorva Nitsure, Luyao Shi +2RL for Code GenerationProcess Reward Models

  12. Learn from Your Mistakes: Tree-like Self-Play for Secure Code LLMs

    Jun 2, 2026Wenqi Chen, Ziyan Zhang, Bin Wang +3RL for Code GenerationLLM Self-Correction

  13. EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

    Jun 2, 2026Guhong Chen, Yingcheng Shi, Yongbin Li +6RL for Code GenerationAgentic RL

  14. Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination

    May 29, 2026Jiasheng Zheng, Boxi Cao, Boxi Yu +6RL for Code GenerationReinforcement Learning with Verifiable Rewards

  15. Automating Formal Verification with Reinforcement Learning and Recursive Inference

    May 29, 2026Max TanRL for Code GenerationInference-Time Search

  16. Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL

    May 27, 2026Kunhao Zheng, Pierre Chambon, Juliette Decugis +4Multi-Objective Reinforcement LearningRL for Code Generation

  17. Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning

    May 27, 2026Mingze Wu, Abhinav Anand, Shweta Verma +1RL for Code GenerationOffline RL

  18. Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

    May 27, 2026Le Bronnec Florian, Alexandre Verine, Rio Yokota +1RL for Code GenerationCode Generation

  19. Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning

    May 26, 2026Yilong Li, Suman Banerjee, Tong CheRL for Code GenerationCode Generation

  20. CoRe-Code: Collaborative Reinforcement Learning for Code Generation

    May 24, 2026Zhihao Dou, Qinjian Zhao, Zhongwei Wan +2RL for Code GenerationMulti-Agent Coordination

  21. Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

    May 20, 2026Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand +2RL for Code GenerationReinforcement Learning