Credit Assignment in RL

RL: Reinforcement Learning

Momentum

32 papers in the last four weeks, up 220% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 171

All topics
CardsList
  1. SHARP: A Self-Evolving Human-Auditable Rubric Policy for Financial Trading Agents

    May 7, 2026Xiwen Chen, Wenhui Zhu, Songzhu Zheng +3Reinforcement LearningCredit Assignment in RL

  2. A2^2TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping

    May 7, 2026Dingwei Chen, Zefang Zong, Zhipeng Ma +5Credit Assignment in RLPolicy Gradient Methods

  3. Milestone-Guided Policy Learning for Long-Horizon Language Agents

    May 7, 2026Zixuan Wang, Yuchen Yan, Hongxing Li +7Credit Assignment in RLLong-Horizon Agent Tasks

  4. Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR

    May 7, 2026Chaoli Mou, Zhan Zhuang, Xinning Chen +1RL for Language Model ReasoningCredit Assignment in RL

  5. EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance

    May 6, 2026Song Yu, Li Li, Wenwen Zhao +1RL for Language Model ReasoningGroup Relative Policy Optimization

  6. Every Step Counts: Step-Level Credit Assignment for Tool-Integrated Text-to-SQL

    May 6, 2026Yaxun Dai, Baolin Sun, Junying Wang +6Credit Assignment in RLText-to-SQL

  7. Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards

    May 5, 2026Tianyang Han, Hengyu Shi, Junjie Hu +3RL for Code GenerationProcess Reward Models

  8. DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

    May 5, 2026Hongbo Jin, Rongpeng Zhu, Zhongjing Du +4Token-Level Credit AssignmentRL for Language Model Reasoning

  9. AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning

    May 1, 2026Haotian Zhao, Songlin Zhou, Yuxin Zhang +9Agentic RLCredit Assignment in RL

  10. SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

    Apr 24, 2026Jichao Wang, Liuyang Bian, Yufeng Zhou +9RL for GUI AgentsCredit Assignment in RL

  11. SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution

    Apr 21, 2026Xiachong Feng, Yi Jiang, Xiaocheng Feng +9Credit Assignment in RLStep-Level Credit Assignment in RL

  12. StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning

    Apr 20, 2026Daoyu Wang, Qingchuan Li, Mingyue Cheng +4Agentic RLCredit Assignment in RL

  13. Reducing Credit Assignment Variance via Counterfactual Reasoning Paths

    Apr 20, 2026Fei Ding, Yongkang Zhang, Youwei Wang +1RL for Language Model ReasoningCredit Assignment in RL

  14. Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought

    Apr 20, 2026Muhammed Emrullah Ildiz, Halil Alperen Gozeten, Ege Onur Taga +1CoT ReasoningRL for Language Model Reasoning

  15. COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams

    Apr 20, 2026Shripad Deshmukh, Jayakumar Subramanian, Raghavendra Addanki +1Sequential MARLCredit Assignment in RL

  16. Explicit Credit Assignment through Local Rewards and Dependence Graphs in Multi-Agent Reinforcement Learning

    Jan 29, 2026Bang Giang Le, Viet Cuong TaCredit Assignment in RLCredit Assignment

  17. Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents

    Nov 11, 2025Chih-Hsuan, Yang, Tanwi Mallick +5Multi-Agent LLM SystemsCooperative Game Theory

  18. TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels

    Apr 17, 2025Siow Meng Low, Ze Gong, Akshat KumarRL ControlCredit Assignment in RL

  19. Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

    Date pendingZikang Shan, Han Zhong, Liwei Wang +1RL for Language ModelsReinforcement Learning