Step-Level Credit Assignment in RL

RL: Reinforcement Learning

Momentum

25 papers in the last four weeks, up 178% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 90

All topics
CardsList
  1. 3SPO: State-Score-Supervised Policy Optimization for LLM Agents

    Jun 8, 2026Yu Han, Kailing Li, Yang Jiao +4Credit Assignment in RLStep-Level Credit Assignment in RL

  2. The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning

    Jun 8, 2026Aakriti Agrawal, Souradip Chakraborty, Armin Saghafian +6Process Reward ModelsRL for Language Model Reasoning

  3. RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

    Jun 4, 2026Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger +1Reinforcement LearningRL for Language Model Reasoning

  4. When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training

    Jun 4, 2026Yuanfan Li, Qi Zhou, Wenjing Duan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  5. SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

    May 30, 2026Qiming Shi, Zhaolu Kang, Yunfan Zhou +2Credit Assignment in RLStep-Level Credit Assignment in RL

  6. Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling

    May 28, 2026Yuchen Liu, Yingjie Feng, Lixiong Qin +5Reward ModelingAgentic RL

  7. StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning

    May 26, 2026Yanfei Zhang, Xu Lin, Chenglin WuCredit Assignment in RLStep-Level Credit Assignment in RL

  8. Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning

    May 26, 2026Xin Cheng, Shuo He, Lang Feng +4Group Relative Policy OptimizationCredit Assignment in RL

  9. RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

    May 25, 2026Mingchen Li, Hansi Zeng, Zhuo Qian +3RL for Language Model ReasoningCredit Assignment in RL

  10. Credit Assignment with Resets in Language Model Reasoning

    May 25, 2026Ankur Samanta, Akshayaa Magesh, Ayush Jain +7RL for Language Model ReasoningCredit Assignment in RL

  11. From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning

    May 21, 2026Xitai Jiang, Zihan Tang, Wenze Lin +3RL for Language Model ReasoningCredit Assignment in RL

  12. OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning

    May 21, 2026Yu Li, Rui Miao, Tian Lan +1Value Function EstimationToken-Level Credit Assignment

  13. What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents

    May 19, 2026Xiaozhe Li, Tianyi Lyu, Yang Li +6Reinforcement LearningCredit Assignment in RL

  14. AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment

    May 18, 2026Zhenlin Wei, Pu Jian, Yingzhuo Deng +6Token-Level Credit AssignmentRL for Language Model Reasoning

  15. PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

    May 18, 2026Wonjoong Kim, Yeonjun In, Sangwu Park +2Reward ModelingCredit Assignment in RL

  16. Step-wise Rubric Rewards for LLM Reasoning

    May 17, 2026Weichu Xie, Haozhe Zhao, Wenpu Liu +15Reward ModelingCredit Assignment in RL

  17. GAGPO: Generalized Advantage Grouped Policy Optimization

    May 13, 2026Siyuan Zhu, Chao Yu, Rongxin Yang +4Reinforcement LearningGroup Relative Policy Optimization

  18. Verifiable Process Rewards for Agentic Reasoning

    May 11, 2026Huining Yuan, Zelai Xu, Huaijie Wang +6Process Reward ModelsCredit Assignment in RL

  19. PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning

    May 10, 2026Dongyi Liu, Yifan Niu, Qinwen Wang +2Reinforcement LearningReward Shaping

  20. Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

    May 9, 2026Zhida He, Xiaoyu Wen, Han Qi +7RL for Language ModelsCredit Assignment in RL

  21. Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR

    May 7, 2026Chaoli Mou, Zhan Zhuang, Xinning Chen +1RL for Language Model ReasoningCredit Assignment in RL

  22. Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers

    May 6, 2026Senkang Hu, Yong Dai, Xudong Han +4Agentic RLReinforcement Learning

  23. DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

    May 5, 2026Hongbo Jin, Rongpeng Zhu, Zhongjing Du +4Token-Level Credit AssignmentRL for Language Model Reasoning

  24. SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution

    Apr 21, 2026Xiachong Feng, Yi Jiang, Xiaocheng Feng +9Credit Assignment in RLStep-Level Credit Assignment in RL

  25. Reducing Credit Assignment Variance via Counterfactual Reasoning Paths

    Apr 20, 2026Fei Ding, Yongkang Zhang, Youwei Wang +1RL for Language Model ReasoningCredit Assignment in RL

  26. Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning

    Feb 26, 2026Chris Samarinas, Haw-Shiuan Chang, Hamed ZamaniReinforcement LearningProcess Reward Models

  27. TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels

    Apr 17, 2025Siow Meng Low, Ze Gong, Akshat KumarRL ControlCredit Assignment in RL