Credit Assignment in RL

RL: Reinforcement Learning

Momentum

32 papers in the last four weeks, up 220% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 171

All topics
CardsList
  1. AGAR: a reinforcement learning substrate for LLM program evolution

    Oct 6, 2026Haoran Li, Zengle Ge, Xiaomin Yuan +11LLM-Based Program SynthesisRL for Code Generation

  2. VETTA: Coordinating Turn- and Token-Level Credit Assignment for Multi-Turn LLM Agents

    Oct 6, 2026Jiaju Chen, Min Yang, Jinghua Piao +4Token-Level Credit AssignmentCredit Assignment in RL

  3. RELACE: retrospective likelihood-based action credit estimation for long-horizon language agents

    Oct 5, 2026Sayak Chakrabarti, Sathish Reddy IndurthiGroup Relative Policy OptimizationCredit Assignment in RL

  4. Minimal Witness Reinforcement Learning

    Oct 5, 2026T. Y. Tsui, Zihao Ye, Pengxiang Cai +3RL for Language Model ReasoningCredit Assignment in RL

  5. Dependency-Aware Reward Shaping for Agentic Reinforcement Learning

    Oct 1, 2026Ziyi Chen, Yan Zhang, Jianhui Wei +2RL for Language ModelsAgentic RL

  6. My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning

    Oct 1, 2026Yihua Zhu, Qianying Liu, Weixu Qiao +10Agentic RLCredit Assignment in RL

  7. SHARPO: Segment-Level Credit Assignment for Agentic Reinforcement Learning

    Sep 30, 2026Xinchen Du, Zhengze Zhou, Wenhui Zhu +4Agentic RLGroup Relative Policy Optimization

  8. Semifactual Credit-Augmented Policy Optimization

    Sep 30, 2026Junshu Pan, Zhizhang Fu, Shulin Huang +5Prompt SensitivityRL for Language Model Reasoning

  9. Trust the Critic More

    Sep 30, 2026Kaiyue Wen, Luke Bailey, Arvind Mahankali +1RL for Language Model ReasoningCredit Assignment in RL

  10. PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning

    Sep 30, 2026Yangang Zou, Jiajun Lu, Weitao Zhou +6Credit Assignment in RLStep-Level Credit Assignment in RL

  11. Privy to the Foil: Recasting Value Estimation with a Self-Privileged Critic for RLVR

    Sep 29, 2026Kun Liang, Chenming Tang, Clive Bai +5Value Function EstimationRL for Language Model Reasoning

  12. How Can Recommendation Feedback Evolve Agent Memory?

    Sep 29, 2026Shanwen Mao, Mingming Li, Hao Zhang +4Credit Assignment in RLAgent Memory Management

  13. Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning

    Sep 29, 2026Zhongan Bi, Kepeng Lin, Xuanang Gao +2Counterfactual Evaluation of VLMsCredit Assignment in RL

  14. Beyond Saying Less: Fine-Grained Alignment for Informative and Faithful Vision-Language Models

    Sep 28, 2026Xingming Long, Jie Zhang, Yuecong Min +2Credit Assignment in RLStep-Level Credit Assignment in RL

  15. SpikeCredit: Temporal Credit Carrier for Reinforcement Learning with Sparse Rewards

    Sep 28, 2026Yingchao Yu, Pengfei Sun, Wenxuan Pan +4Credit Assignment in RLStep-Level Credit Assignment in RL

  16. ASCT: Attentive Search over Counterfactual Trees for Credit Assignment in Agentic Reinforcement Learning

    Sep 28, 2026Yang Li, Jinhan Yang, hai liu +8Agentic RLCredit Assignment in RL

  17. GraphHCA: Closed-Form Hindsight Credit Assignment for Long-Horizon LLM Agents

    Sep 28, 2026Haodong Zhu, Yangyang Ren, Changbai Li +4Credit Assignment in RLStep-Level Credit Assignment in RL

  18. UniOPSD: Unifying Outcome and Hindsight Feedback for Agentic Reinforcement Learning

    Sep 28, 2026Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai +8Agentic RLCredit Assignment in RL

  19. Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents

    Sep 27, 2026Mingju Chen, Can Lv, Jinrong Liu +3Credit Assignment in RLReinforcement Learning with Verifiable Rewards

  20. SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL

    Sep 24, 2026Yan Zhan, Shaobo Liu, Qiunan Liu +7Group Relative Policy OptimizationCredit Assignment in RL

  21. When Does Action Credit Need Updating?

    Sep 24, 2026Hongye Yang, Boxiao HuangCredit Assignment in RLCredit Assignment

  22. Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning

    Sep 24, 2026Xincheng Yao, Haobo Fu, Weiming Liu +1Agentic RLCredit Assignment in RL

  23. ProCredit: From Outcome Rewards to Progress Credit in Agentic Reinforcement Learning

    Sep 23, 2026Ming Ma, Yi Zhu, Yiran Zhong +7Agentic RLCredit Assignment in RL

  24. Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use

    Sep 21, 2026Zixiang Chen, Wenting Zhao, Zhepeng Cen +9Reinforcement LearningCredit Assignment in RL