Credit Assignment in RL

RL: Reinforcement Learning

Momentum

32 papers in the last four weeks, up 220% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 171

All topics
CardsList
  1. FLARE: A Full-Lifecycle Dense Supervision Paradigm for Long-Horizon Coding Agents via Generative Reward Model

    Sep 20, 2026Jingxuan Xu, Gang Wu, Yanan Wu +13RL for Code GenerationReward Modeling

  2. Anchoring What Matters: A Dual-Level Learning Framework for Visually-Grounded Multimodal Reasoning

    Sep 16, 2026Xinxin Song, Siyuan Li, Tingxiong Xiao +1Credit Assignment in RLExperience Replay

  3. Granularity-Adaptive Credit Assignment for Long-Horizon LLM Agent Reinforcement Learning

    Sep 11, 2026Taoran Liang, Yang Liu, Shang Luo +10Credit Assignment in RLStep-Level Credit Assignment in RL

  4. What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents

    Sep 7, 2026Chenqian Le, Jiayi Cheng, Qijia He +3RL for Code GenerationGroup Relative Policy Optimization

  5. VERPO: Verified Evidence Regularized Policy Optimization

    Sep 5, 2026Haijiang Li, Chengyu Lv, Yi Zhang +8RL for Language Model ReasoningCredit Assignment in RL

  6. Dense Process Supervision for Search Agents via Fact Utility Estimation

    Sep 1, 2026Rongzhi Zhu, Xiangyu Liu, Yi Liu +7Reinforcement LearningCredit Assignment in RL

  7. Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

    Aug 31, 2026Jiani Guo, Junjie Wang, Jie Wu +5RL for Language Model ReasoningCredit Assignment in RL

  8. A^2Agent: Action-Aware Reinforcement Learning for Repository-Level Code Localization Agents

    Aug 30, 2026Doyeon Kim, Suyoung Bae, Yumin Lee +1Software Engineering AgentsCredit Assignment in RL

  9. Rubric-to-Code Credit Assignment for Reinforcement Learning

    Aug 28, 2026Rui Jin, Jikai Chen, Yihan Chen +6RL for Code GenerationCode Generation

  10. Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents

    Aug 13, 2026Haoze Wu, Chuqiao Kuang, Tianyi Zhuang +1Group Relative Policy OptimizationCredit Assignment in RL

  11. Redistribution-based Cost Inference Improves Sparse Safe Offline RL

    Aug 12, 2026Ebenezer Gelo, Geraud Nangue Tasse, Steven James +1Credit Assignment in RLStep-Level Credit Assignment in RL

  12. Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning

    Aug 8, 2026Yifu Huo, Shunjie Xing, Chenglong Wang +8Agentic RLCredit Assignment in RL

  13. Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

    Aug 7, 2026Haoyu Zheng, Yun Zhu, Qing Wang +1Agentic RLCredit Assignment in RL

  14. DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

    Aug 7, 2026Xucong Wang, Zhe Zhao, Liheng Yu +3RL for Code GenerationCredit Assignment in RL

  15. How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning

    Aug 7, 2026Lichao Ma, Yang Sun, Shuaitao Zhao +9Token-Level Credit AssignmentCredit Assignment in RL

  16. Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

    Aug 7, 2026Hongxi Yan, Ziyue Huang, Shichao Fan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  17. AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

    Aug 6, 2026Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao +10Agentic RLReinforcement Learning

  18. Multi-Branch Policy Optimization for Multimodal Large Language Models

    Aug 5, 2026Shuai Lyu, Yuning Gong, Ruiling Gao +7Credit Assignment in RLMultimodal Large Language Models

  19. Agentic Reinforcement Learning with Self-Distilled Reward Shaping

    Aug 4, 2026Ranxu Zhang, Guinan Chen, Chenshaodong +5Reward ShapingToken-Level Credit Assignment

  20. Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation

    Aug 3, 2026Lecheng Yan, Jianze Lin, Yichong Zhang +5Credit Assignment in RLVideo Editing

  21. Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning

    Aug 3, 2026Xuyang Zhao, Liting Zhang, Zichen Xu +4Numerical Reasoning in Language ModelsRL for Language Model Reasoning