Step-Level Credit Assignment in RL

RL: Reinforcement Learning

Momentum

25 papers in the last four weeks, up 178% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 90

All topics
CardsList
  1. SPLIT-RL: Staged Perception-Language Reasoning Training with Claim-Level Advantages

    Oct 7, 2026Raja Kumar, Rajat Koner, Ritwick Chaudhry +3VLM ReasoningRL for VLMs

  2. Beyond Outcome Rewards: Constructing and Assigning Retrieval Credit for Search Agents

    Oct 7, 2026Wenyu Huang, Xinyu Hou, Pavlos Vougiouklis +2Reward Design for RLRL for IR

  3. Convex-Concave Reinforcement Learning

    Oct 6, 2026Shripad V. Deshmukh, Yaswanth Chittepu, Dhawal Gupta +2Reinforcement LearningPolicy Gradient Methods

  4. RELACE: retrospective likelihood-based action credit estimation for long-horizon language agents

    Oct 5, 2026Sayak Chakrabarti, Sathish Reddy IndurthiGroup Relative Policy OptimizationCredit Assignment in RL

  5. SCAD: Structured Credit Assignment and Distillation for Long-Horizon Agents

    Oct 2, 2026Shangyang Wu, Shuai Zhao, Ziyue Zhu +3Hierarchical PlanningStep-Level Credit Assignment in RL

  6. Dependency-Aware Reward Shaping for Agentic Reinforcement Learning

    Oct 1, 2026Ziyi Chen, Yan Zhang, Jianhui Wei +2RL for Language ModelsAgentic RL

  7. My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning

    Oct 1, 2026Yihua Zhu, Qianying Liu, Weixu Qiao +10Agentic RLCredit Assignment in RL

  8. Semifactual Credit-Augmented Policy Optimization

    Sep 30, 2026Junshu Pan, Zhizhang Fu, Shulin Huang +5Prompt SensitivityRL for Language Model Reasoning

  9. T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

    Sep 30, 2026Bo-Wen Zhang, Junwei He, Maoqi Liu +6Agentic RLReward Shaping

  10. PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning

    Sep 30, 2026Yangang Zou, Jiajun Lu, Weitao Zhou +6Credit Assignment in RLStep-Level Credit Assignment in RL

  11. Privy to the Foil: Recasting Value Estimation with a Self-Privileged Critic for RLVR

    Sep 29, 2026Kun Liang, Chenming Tang, Clive Bai +5Value Function EstimationRL for Language Model Reasoning

  12. Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning

    Sep 28, 2026Dongwon Jung, Hemanth Neelgund Ramesh, Yifan Wang +7Agentic RLGroup Relative Policy Optimization

  13. Beyond Saying Less: Fine-Grained Alignment for Informative and Faithful Vision-Language Models

    Sep 28, 2026Xingming Long, Jie Zhang, Yuecong Min +2Credit Assignment in RLStep-Level Credit Assignment in RL

  14. SpikeCredit: Temporal Credit Carrier for Reinforcement Learning with Sparse Rewards

    Sep 28, 2026Yingchao Yu, Pengfei Sun, Wenxuan Pan +4Credit Assignment in RLStep-Level Credit Assignment in RL

  15. ASCT: Attentive Search over Counterfactual Trees for Credit Assignment in Agentic Reinforcement Learning

    Sep 28, 2026Yang Li, Jinhan Yang, hai liu +8Agentic RLCredit Assignment in RL

  16. GraphHCA: Closed-Form Hindsight Credit Assignment for Long-Horizon LLM Agents

    Sep 28, 2026Haodong Zhu, Yangyang Ren, Changbai Li +4Credit Assignment in RLStep-Level Credit Assignment in RL

  17. Cross-Rollout Bellman Closure for Long-Horizon Agentic Reinforcement Learning

    Sep 28, 2026Yangyang Ren, Haodong Zhu, Linlin Yang +3Agentic RLStep-Level Credit Assignment in RL

  18. Can We Trust the Teacher? Decoupled Credit Direction-Magnitude for Self-Distillation

    Sep 28, 2026Yugu Li, Zehong Cao, Peizhen Li +3Token-Level Credit AssignmentRL for Language Model Reasoning

  19. UniOPSD: Unifying Outcome and Hindsight Feedback for Agentic Reinforcement Learning

    Sep 28, 2026Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai +8Agentic RLCredit Assignment in RL

  20. Dr.Credit: Rubric-Grounded Process Credit Assignment for Deep Research Agents

    Sep 28, 2026Yingjian Zhu, Zhenyi Wang, Jiaxin Guo +6Deep Research AgentsStep-Level Credit Assignment in RL

  21. Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning

    Sep 24, 2026Xincheng Yao, Haobo Fu, Weiming Liu +1Agentic RLCredit Assignment in RL

  22. ProCredit: From Outcome Rewards to Progress Credit in Agentic Reinforcement Learning

    Sep 23, 2026Ming Ma, Yi Zhu, Yiran Zhong +7Agentic RLCredit Assignment in RL

  23. Granularity-Adaptive Credit Assignment for Long-Horizon LLM Agent Reinforcement Learning

    Sep 11, 2026Taoran Liang, Yang Liu, Shang Luo +10Credit Assignment in RLStep-Level Credit Assignment in RL

  24. DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization

    Sep 10, 2026Arjun Sohal, Yuchi Zhao, Miroslav Bogdanovic +1RL for RoboticsStep-Level Credit Assignment in RL

  25. VERPO: Verified Evidence Regularized Policy Optimization

    Sep 5, 2026Haijiang Li, Chengyu Lv, Yi Zhang +8RL for Language Model ReasoningCredit Assignment in RL