Credit Assignment in RL

RL: Reinforcement Learning

Momentum

32 papers in the last four weeks, up 220% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 171

All topics
CardsList
  1. Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

    Jun 20, 2026Zhao Yang, Yuxuan Jiang, Ting-Chih Chen +18RL for Language ModelsCredit Assignment in RL

  2. ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents

    Jun 19, 2026Zihang Tian, Jingsen Zhang, Rui Li +3Process Reward ModelsCredit Assignment in RL

  3. Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models

    Jun 16, 2026Zihao Wei, Wenjie Shi, Liang Pang +8Overthinking in Language ModelsRL for Language Model Reasoning

  4. Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

    Jun 15, 2026Tongyan Fang, Siyuan Huang, Naiyu Fang +6Credit Assignment in RLRobotic RL

  5. HiMPO: Hindsight-Informed Memory Policy Optimization for Less-Entangled Credit in Long-Horizon Agents

    Jun 15, 2026Jiangze Yan, Yi Shen, Wenjing Zhang +5Credit Assignment in RLLong-Horizon Agent Tasks

  6. STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning

    Jun 14, 2026Qinjian Zhao, Zhihao Dou, Dinggen Zhang +10RL for Language Model ReasoningCredit Assignment in RL

  7. Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

    Jun 14, 2026Yu Li, Shu Hong, Tian LanRL for Language Model ReasoningCredit Assignment in RL

  8. APPO: Agentic Procedural Policy Optimization

    Jun 10, 2026Xucong Wang, Ziyu Ma, Yong Wang +5Agentic RLCredit Assignment in RL

  9. PAWS: Preference Learning with Advantage-Weighted Segments

    Jun 10, 2026Aleksandar Taranovic, Onur Celik, Niklas Freymuth +6Credit Assignment in RLRobotic RL

  10. ReCal: Reward Calibration for RL-based LLM Routing

    Jun 10, 2026Qihang Yu, Hanwen Tong, Zhengqi Zhang +5Multi-Objective Reinforcement LearningRL for Language Models

  11. HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation

    Jun 10, 2026Haoran Liu, Yuwei Zhang, Xiyao Li +2Credit Assignment in RLOn-Policy Distillation

  12. 3SPO: State-Score-Supervised Policy Optimization for LLM Agents

    Jun 8, 2026Yu Han, Kailing Li, Yang Jiao +4Credit Assignment in RLStep-Level Credit Assignment in RL

  13. Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

    Jun 7, 2026Yawen Shao, Jie Xiao, Kai Zhu +6RL for Language Model ReasoningCredit Assignment in RL

  14. Self-evolving LLM agents with in-distribution Optimization

    Jun 5, 2026Yudi Zhang, Meng Fang, Zhenfang Chen +1Reinforcement LearningProcess Reward Models

  15. StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents

    Jun 5, 2026Haojie Hao, Longkun Hao, Yihang Lou +8Reinforcement LearningRL for GUI Agents

  16. RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

    Jun 4, 2026Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger +1Reinforcement LearningRL for Language Model Reasoning

  17. Reward hacking in physical reinforcement learning revealed by turbulent drag reduction

    Jun 4, 2026Giorgio Maria Cavallazzi, Miguel Pérez-Cuadrado, Alfredo PinelliRL ControlReward Hacking

  18. When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training

    Jun 4, 2026Yuanfan Li, Qi Zhou, Wenjing Duan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  19. TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents

    Jun 4, 2026Chengqi Dong, Chuhuai Yue, Hang He +6Multimodal IRToken-Level Credit Assignment

  20. Reinforcement Learning from Rich Feedback with Distributional DAgger

    Jun 3, 2026Rishabh Agrawal, Jacob Fein-Ashley, Paria RashidinejadDistributional RLRL for Language Model Reasoning

  21. GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards

    Jun 3, 2026Tej Deep Pala, Vernon Toh, Soujanya PoriaRL for Language Model ReasoningCredit Assignment in RL

  22. Preference-Calibrated Human-in-the-Loop Reinforcement Learning for Robotic Manipulation

    Jun 2, 2026Zeyi Liu, Guangyao Liu, Yinuo Qu +6Credit Assignment in RLRobotic RL

  23. SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

    May 30, 2026Qiming Shi, Zhaolu Kang, Yunfan Zhou +2Credit Assignment in RLStep-Level Credit Assignment in RL

  24. LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training

    May 29, 2026Argyrios Gerogiannis, Yekaterina Yegorova, Mark Hasegawa-Johnson +1RL for Language ModelsCredit Assignment in RL

  25. Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward

    May 29, 2026Mustafa Anis Hussain, Xinle Wu, Yao LuDeep Research AgentsLLM Planning

  26. VeriGate: Verifier-Gated Step-Level Supervision for GRPO

    May 28, 2026Aakriti Agrawal, Minghui Liu, Furong HuangProcess Reward ModelsRL for Language Model Reasoning

  27. Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling

    May 28, 2026Yuchen Liu, Yingjie Feng, Lixiong Qin +5Reward ModelingAgentic RL