Step-Level Credit Assignment in RL

RL: Reinforcement Learning

Momentum

25 papers in the last four weeks, up 178% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 90

All topics
CardsList
  1. DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

    Sep 3, 2026Shubham Gandhi, Saurabh Goyal, Kiran Kate +1Agentic RLStep-Level Credit Assignment in RL

  2. Dense Process Supervision for Search Agents via Fact Utility Estimation

    Sep 1, 2026Rongzhi Zhu, Xiangyu Liu, Yi Liu +7Reinforcement LearningCredit Assignment in RL

  3. A^2Agent: Action-Aware Reinforcement Learning for Repository-Level Code Localization Agents

    Aug 30, 2026Doyeon Kim, Suyoung Bae, Yumin Lee +1Software Engineering AgentsCredit Assignment in RL

  4. Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

    Aug 13, 2026Zechuan Wang, Siyuan Lu, Hongxuan Zhang +3Token-Level Credit AssignmentStep-Level Credit Assignment in RL

  5. Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

    Aug 13, 2026Yao Zhou, Hang Gao, Fengge Wu +2Group Relative Policy OptimizationStep-Level Credit Assignment in RL

  6. Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents

    Aug 13, 2026Haoze Wu, Chuqiao Kuang, Tianyi Zhuang +1Group Relative Policy OptimizationCredit Assignment in RL

  7. Redistribution-based Cost Inference Improves Sparse Safe Offline RL

    Aug 12, 2026Ebenezer Gelo, Geraud Nangue Tasse, Steven James +1Credit Assignment in RLStep-Level Credit Assignment in RL

  8. How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning

    Aug 7, 2026Lichao Ma, Yang Sun, Shuaitao Zhao +9Token-Level Credit AssignmentCredit Assignment in RL

  9. Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

    Aug 7, 2026Hongxi Yan, Ziyue Huang, Shichao Fan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  10. AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

    Aug 6, 2026Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao +10Agentic RLReinforcement Learning

  11. Agentic Reinforcement Learning with Self-Distilled Reward Shaping

    Aug 4, 2026Ranxu Zhang, Guinan Chen, Chenshaodong +5Reward ShapingToken-Level Credit Assignment

  12. BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

    Aug 2, 2026Yibin Huang, Bin Xu, Hailong Cao +1Process Reward ModelsCredit Assignment in RL

  13. Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

    Jul 30, 2026Qiangqiang He, Zhongheng Wu, ZiJian WangToken-Level Credit AssignmentRL for Language Model Reasoning

  14. CAST: Game Solvers as Turn-Level Teachers for LLM Agents

    Jul 28, 2026Yu Wang, Yi-Kai Zhang, Wentao Shi +8Reinforcement LearningGame-Playing Agents

  15. TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

    Jul 15, 2026Leitian Tao, Baolin Peng, Wenlin Yao +5Credit Assignment in RLStep-Level Credit Assignment in RL

  16. ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy

    Jul 3, 2026Zijun Xie, Yuyang You, Yongzhi Li +6Token-Level Credit AssignmentRL for Language Model Reasoning

  17. TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

    Jun 30, 2026Yuanda Xu, Zhengze Zhou, Hejian Sang +6Agentic RLStep-Level Credit Assignment in RL

  18. Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents

    Jun 24, 2026Peng Xu, Sijia Chen, Junzhuo Li +1Reward ShapingCredit Assignment in RL

  19. Learning with a Single Rollout via Monte Carlo Pass@k Critic

    Jun 24, 2026Fengdi Che, Yang Liu, Lei Yu +4RL for Language Model ReasoningCredit Assignment in RL

  20. ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents

    Jun 19, 2026Zihang Tian, Jingsen Zhang, Rui Li +3Process Reward ModelsCredit Assignment in RL

  21. Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards

    Jun 17, 2026Yingyu Shan, Yuhang Guo, Zihao Cheng +7Token-Level Credit AssignmentRL for Language Model Reasoning

  22. STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning

    Jun 14, 2026Qinjian Zhao, Zhihao Dou, Dinggen Zhang +10RL for Language Model ReasoningCredit Assignment in RL

  23. Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

    Jun 14, 2026Yu Li, Shu Hong, Tian LanRL for Language Model ReasoningCredit Assignment in RL