Credit Assignment in RL

RL: Reinforcement Learning

Momentum

32 papers in the last four weeks, up 220% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 171

All topics
CardsList
  1. EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents

    Aug 2, 2026Jianan Xie, Xin Sun, Zhongqi Chen +4Agentic SearchCredit Assignment in RL

  2. BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

    Aug 2, 2026Yibin Huang, Bin Xu, Hailong Cao +1Process Reward ModelsCredit Assignment in RL

  3. Group-Reflective Self-Distillation for Agentic Reinforcement Learning

    Jul 30, 2026Binbin Zheng, Zijun Xie, Guanqun Zhao +4Agentic RLCredit Assignment in RL

  4. MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation

    Jul 30, 2026Dawei Wang, Di Zhao, Xinyuan Liu +5Credit Assignment in RLCooperative MARL

  5. Harness-G: A Graph-Structured Harness for Search Agents

    Jul 30, 2026Yanning Hou, Haoyuan Chen, Sihang Zhou +7Graph Retrieval-Augmented GenerationCredit Assignment in RL

  6. ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

    Jul 30, 2026Zhenrong Zhang, Fei Wu, Jun Du +2RL for Language Model ReasoningCredit Assignment in RL

  7. CAST: Game Solvers as Turn-Level Teachers for LLM Agents

    Jul 28, 2026Yu Wang, Yi-Kai Zhang, Wentao Shi +8Reinforcement LearningGame-Playing Agents

  8. Rewarding Better Thinking for LLM Preference Alignment

    Jul 22, 2026Xubo Liu, Wenya Guo, Ruxue Yan +2Process Reward ModelsCredit Assignment in RL

  9. CriPO: Enhancing Rubric-based RL via Self-Distillation

    Jul 20, 2026Mingxuan Xia, Yuhang Yang, Chao Ye +7Credit Assignment in RLRubric-Based RL

  10. Decentralized Multi-agent Reinforcement Learning for Resilient Critical Infrastructures

    Jul 20, 2026Minghui Ding, Evangelos PournarasMulti-Agent CoordinationCredit Assignment in RL

  11. Counterfactual Shapley Credit Assignment

    Jul 18, 2026Mingxuan Li, Kai-Zhan Lee, Elias BareinboimCredit Assignment in RLTemporal Credit Assignment

  12. TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

    Jul 15, 2026Leitian Tao, Baolin Peng, Wenlin Yao +5Credit Assignment in RLStep-Level Credit Assignment in RL

  13. When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

    Jul 8, 2026Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang +4RL for Language ModelsToken-Level Credit Assignment

  14. Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry

    Jul 4, 2026Weiyang Guo, Zesheng Shi, Longhui Zhang +3Reinforcement LearningCredit Assignment in RL

  15. ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL

    Jun 30, 2026Zijun Xie, Binbin Zheng, Enlei Gong +7Agentic RLCredit Assignment in RL

  16. Toward an Energy-Optimized Operation of Data Centers Located in Wind Farms Using Reinforcement Learning

    Jun 29, 2026Jan Stenner, Alexander Kilian, Sebastian Peitz +1RL ControlCredit Assignment in RL

  17. ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit

    Jun 29, 2026Abhijnan Nath, Nikhil KrishnaswamyBelief-Space PlanningCredit Assignment in RL

  18. UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation

    Jun 28, 2026Songjun Tu, Chengdong Xu, Qichao Zhang +6Credit Assignment in RLLLM Agent Skill Learning

  19. Mesh-RL: Coupled subgrid reinforcement learning

    Jun 24, 2026Behnam Gheshlaghi, Bahador Rashidi, Shahin AtakishiyevReinforcement LearningCredit Assignment in RL

  20. Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents

    Jun 24, 2026Peng Xu, Sijia Chen, Junzhuo Li +1Reward ShapingCredit Assignment in RL

  21. Learning with a Single Rollout via Monte Carlo Pass@k Critic

    Jun 24, 2026Fengdi Che, Yang Liu, Lei Yu +4RL for Language Model ReasoningCredit Assignment in RL

  22. Drowning in Routine: Signal Dilution in Multi-Turn Agent Training

    Jun 20, 2026Yann Pernot, Vi RetaultReinforcement LearningCredit Assignment in RL