Credit Assignment in RL

RL: Reinforcement Learning

Momentum

32 papers in the last four weeks, up 220% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 171

All topics
CardsList
  1. Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization

    May 28, 2026Shufan Li, Konstantinos Kallidromitis, Akash Gokul +2Token-Level Credit AssignmentRL for Language Model Reasoning

  2. PRO-CUA: Process-Reward Optimization for Computer Use Agents

    May 27, 2026Yifei He, Rui Yang, Hao Bai +2Reinforcement LearningProcess Reward Models

  3. StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning

    May 26, 2026Yanfei Zhang, Xu Lin, Chenglin WuCredit Assignment in RLStep-Level Credit Assignment in RL

  4. Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning

    May 26, 2026Xin Cheng, Shuo He, Lang Feng +4Group Relative Policy OptimizationCredit Assignment in RL

  5. RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

    May 25, 2026Mingchen Li, Hansi Zeng, Zhuo Qian +3RL for Language Model ReasoningCredit Assignment in RL

  6. Credit Assignment with Resets in Language Model Reasoning

    May 25, 2026Ankur Samanta, Akshayaa Magesh, Ayush Jain +7RL for Language Model ReasoningCredit Assignment in RL

  7. Not only where, But when: Temporal Scheduling for RLVR

    May 25, 2026Jinghao Zhang, Ruilin Li, Feng Zhao +1RL for Language Model ReasoningCredit Assignment in RL

  8. Scaling up Energy-Aware Multi-Agent Reinforcement Learning for Mission-Oriented Drone Networks with Individual Reward

    May 24, 2026Changling Li, Ying LiReinforcement LearningCredit Assignment in RL

  9. From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning

    May 21, 2026Xitai Jiang, Zihan Tang, Wenze Lin +3RL for Language Model ReasoningCredit Assignment in RL

  10. OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning

    May 21, 2026Yu Li, Rui Miao, Tian Lan +1Value Function EstimationToken-Level Credit Assignment

  11. Memory-R2: Fair Credit Assignment for Long-Horizon Memory-Augmented LLM Agents

    May 20, 2026Sikuan Yan, Ahmed Bahloul, Ercong Nie +4Group Relative Policy OptimizationCredit Assignment in RL

  12. Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents

    May 19, 2026Wenjie Tang, Minne Li, Sijie Huang +2Reinforcement LearningPartially Observable RL

  13. PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models

    May 19, 2026Peizheng Guo, Jingyao Wang, Changwen Zheng +1Robot Policy LearningCredit Assignment in RL

  14. What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents

    May 19, 2026Xiaozhe Li, Tianyi Lyu, Yang Li +6Reinforcement LearningCredit Assignment in RL

  15. PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

    May 18, 2026Wonjoong Kim, Yeonjun In, Sangwu Park +2Reward ModelingCredit Assignment in RL

  16. Step-wise Rubric Rewards for LLM Reasoning

    May 17, 2026Weichu Xie, Haozhe Zhao, Wenpu Liu +15Reward ModelingCredit Assignment in RL

  17. Mind Dreamer: Untethering Imagination via Active Causal Intervention on Latent Manifolds

    May 15, 2026Shaojun Xu, Xiaoling Zhou, Yihan Lin +4Reinforcement LearningCredit Assignment in RL

  18. Addressing Terminal Constraints in Data-Driven Demand Response Scheduling

    May 14, 2026Maximilian Bloor, Martha White, Ehecatl Antonio del Rio Chanona +1Hierarchical RLCredit Assignment in RL

  19. Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy

    May 14, 2026Langzhou He, Junyou Zhu, Yue Zhou +7Agentic RLToken-Level Credit Assignment

  20. GAGPO: Generalized Advantage Grouped Policy Optimization

    May 13, 2026Siyuan Zhu, Chao Yu, Rongxin Yang +4Reinforcement LearningGroup Relative Policy Optimization

  21. GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation

    May 12, 2026Sijia Li, Yuchen Huang, Zifan Liu +7RL for Language Model ReasoningCredit Assignment in RL

  22. Verifiable Process Rewards for Agentic Reasoning

    May 11, 2026Huining Yuan, Zelai Xu, Huaijie Wang +6Process Reward ModelsCredit Assignment in RL

  23. PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning

    May 10, 2026Dongyi Liu, Yifan Niu, Qinwen Wang +2Reinforcement LearningReward Shaping

  24. BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models

    May 9, 2026Yuanhao Li, Hongbo Wang, Xiaotang Shang +3Automated Program RepairProcess Reward Models

  25. Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

    May 9, 2026Zhida He, Xiaoyu Wen, Han Qi +7RL for Language ModelsCredit Assignment in RL

  26. Learning CLI Agents with Structured Action Credit under Selective Observation

    May 8, 2026Haoyang Su, Ying WenComputer-Use AgentsCredit Assignment in RL

  27. The Reciprocity Gradient

    May 8, 2026Yue Lin, Pascal Poupart, Shuhui Zhu +5Credit Assignment in RLPolicy Gradient Methods