RL for Code Generation

RL: Reinforcement Learning

Momentum

14 papers in the last four weeks, up 367% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 89

All topics
CardsList
  1. AGAR: a reinforcement learning substrate for LLM program evolution

    Oct 6, 2026Haoran Li, Zengle Ge, Xiaomin Yuan +11LLM-Based Program SynthesisRL for Code Generation

  2. CodeForge-MA: Execution-Verified Multi-Agent Learning with Language-Conditioned LoRA for Multilingual Code Generation

    Oct 4, 2026Zhizhou Gu, Xianting Wu, Siyu Gu +2RL for Code GenerationSynthetic Data Generation for Language Models

  3. CATCH: A Controllable Analysis Testbed for Reward Hacking in Coding RL

    Sep 30, 2026Shouli Wang, Yanfeng Jia, Zhihao Ou +6RL BenchmarksRL for Code Generation

  4. Reinforcement Learning from Intermediate Renders for Image-to-Code Generation

    Sep 28, 2026Omri Kaduri, Kate Feingold, Phillip Isola +1RL for Code GenerationCode Generation

  5. Counterfactual Rollout Replay: Forkable Environments as Free Process Rewards for Software Engineering Agents

    Sep 27, 2026Yuanhao Li, Hongbo Wang, Xuhong Chen +2RL for Code GenerationSoftware Engineering Agents

  6. FLARE: A Full-Lifecycle Dense Supervision Paradigm for Long-Horizon Coding Agents via Generative Reward Model

    Sep 20, 2026Jingxuan Xu, Gang Wu, Yanan Wu +13RL for Code GenerationReward Modeling

  7. Performance, Efficiency and Collapse -- Advantages and Challenges in Offline Post-training of Code LLMs

    Sep 14, 2026Abhinav Anand, Sanjana Reddy Pachika, Shweta Verma +1RL for Code GenerationOffline RL

  8. ExecCritic: Learn to Test, Test to Improve for Coding Agents

    Sep 8, 2026Leitian Tao, Baolin Peng, Haorui Wang +7RL for Code GenerationSoftware Engineering Agents

  9. FrogNano: Training a 4B Coding Agent via Online Task Synthesis

    Sep 7, 2026Minseon Kim, Zhengyan Shi, Emiliano Penaloza +14RL for Code GenerationSoftware Engineering Agents

  10. What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents

    Sep 7, 2026Chenqian Le, Jiayi Cheng, Qijia He +3RL for Code GenerationGroup Relative Policy Optimization

  11. DiffPDE: Masked Diffusion Language Models as PDE Solver

    Aug 31, 2026Wenxuan Guo, Yuyang Hong, Lubin Fan +4RL for Code GenerationMasked Diffusion Models

  12. Rubric-to-Code Credit Assignment for Reinforcement Learning

    Aug 28, 2026Rui Jin, Jikai Chen, Yihan Chen +6RL for Code GenerationCode Generation

  13. CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation

    Aug 10, 2026Hejia Zhang, Sheng Lu, Zhongming Yu +3RL for Code GenerationAutomated Test Generation

  14. DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

    Aug 7, 2026Xucong Wang, Zhe Zhao, Liheng Yu +3RL for Code GenerationCredit Assignment in RL

  15. WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader

    Aug 6, 2026Boshui Chen, Huiping Liu, Shaolei ZhangRL for Code GenerationAutomated Software Testing

  16. RA-CAD: Learning Post-Execution Critique for State-Aware Text-to-CAD Generation

    Aug 6, 2026Shuhao Yan, Changhao He, Peng Hu +1RL for Code GenerationCode Generation

  17. TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation

    Aug 1, 2026Aofan Liu, Jingxiang Meng, Fangxin Liu +1RL for Code GenerationReward Shaping

  18. RLPF: Reinforcement Learning from Performance Feedback for Code Generation

    Jul 29, 2026Huihao Jing, Haozhe Cui, Wenbin Hu +9RL for Code GenerationReinforcement Learning

  19. Reinforcement Learning for Code Optimization

    Jul 28, 2026Pierre Chambon, Kunhao Zheng, Juliette Decugis +2RL for Code GenerationReinforcement Learning

  20. Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning

    Jul 24, 2026Shujin Wu, Cheng Qian, Xiusi Chen +1RL for Code GenerationLLM Self-Refinement