RL for Code Generation

RL: Reinforcement Learning

Momentum

14 papers in the last four weeks, up 367% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 89

All topics
CardsList
  1. Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers

    May 18, 2026Soheyl Massoudi, Gabriel Apaza, Milad Habibi +1RL for Code GenerationLLM-Based Program Synthesis

  2. Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation

    May 16, 2026Shuyin Ouyang, Zhaozhi Qian, Faroq AL-Tam +2RL for Code GenerationDiffusion Guidance

  3. Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution

    May 14, 2026Han Li, Jinyu Tian, Rili Feng +10RL for Code GenerationContinual Learning for LLM Agents

  4. Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

    May 14, 2026Mengjie Ren, Jie Lou, Boxi Cao +6RL for Code GenerationLLM Self-Correction

  5. ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation

    May 13, 2026Zhongkai Yu, Yichen Lin, Chenyang Zhou +12RL for Code GenerationCode Generation

  6. Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling

    May 11, 2026Yizhu Jiao, Ruixiang Zhang, Richard Bai +3RL for Code GenerationTest-Time Scaling

  7. Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair

    May 8, 2026Jia Li, Yuxin Su, Ting Peng +3RL for Code GenerationReward Shaping

  8. Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs

    May 7, 2026Yujia Chen, Yang Ye, Xiao Chu +2RL for Code GenerationReinforcement Learning

  9. Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards

    May 5, 2026Tianyang Han, Hengyu Shi, Junjie Hu +3RL for Code GenerationProcess Reward Models

  10. Strategy-Aware Optimization Modeling with Reasoning LLMs

    May 4, 2026Ruiqing Zhao, Fengzhi Li, Yuan Zuo +5RL for Code GenerationLLM-Based Program Synthesis

  11. Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation

    May 1, 2026Xin-Ye Li, Ren-Biao Liu, Yun-Ji Zhang +3RL for Code GenerationReinforcement Learning

  12. Improving LLM Code Generation via Requirement-Aware Curriculum Reinforcement Learning

    May 1, 2026Shouyu Yin, Zhao Tian, Junjie Chen +1RL for Code GenerationCurriculum Learning

  13. Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Trainig-Time Reward Hacking in Code Generation

    Apr 26, 2026Lichen Li, Hengguang Zhou, Yijun Liang +2RL for Code GenerationReward Hacking

  14. CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution

    Apr 24, 2026Xiangxi Zheng, Kuang He, Jiayi Hu +6RL for Code GenerationVLM Adaptation

  15. Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL

    Apr 22, 2026Zhaofeng Wu, Shiqi Wang, Boya Peng +5Supervised Fine-TuningRL for Code Generation

  16. WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning

    Apr 22, 2026Juyong Jiang, Chenglin Cai, Chansung Park +4RL for Code GenerationRL for Language Models

  17. Training and Agentic Inference Strategies for LLM-based Manim Animation Generation

    Apr 20, 2026Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle +2RL for Code GenerationText-to-Video Generation

  18. MARS2^2: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation

    Apr 16, 2026Pengfei Li, Shijie Wang, Fangyuan Li +7RL for Code GenerationMulti-Agent Collaboration

  19. An Imperfect Verifier is Good Enough: Learning with Noisy Rewards

    Apr 9, 2026Andreas Plesner, Francisco Guzmán, Anish AthalyeRL for Code GenerationReinforcement Learning

  20. RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning

    Apr 1, 2026Shaopeng Fu, Xingxing Zhang, Li Dong +1RL for Code GenerationLLM Self-Refinement

  21. CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models

    Feb 4, 2026Xiao Zhu, Xinyu Zhou, Boyu Zhu +5RL for Code GenerationReward Modeling

  22. ReST-RL: Reinforcing LLM Reasoning through Unified Self-Training and Value-Guided Search

    Aug 27, 2025Sining Zhoubian, Dan Zhang, Jie TangRL for Code GenerationRL for Language Model Reasoning

  23. Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment

    Aug 6, 2025Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu +4RL for Code GenerationCode Generation