Temporal Credit Assignment

Latest papers 20

All topics
CardsList
  1. T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

    Sep 30, 2026Bo-Wen Zhang, Junwei He, Maoqi Liu +6Agentic RLReward Shaping

  2. Learning Process Rewards via Reasoning State Propagation

    Sep 30, 2026Kai Gan, Zi-Hao Zhou, Bo Ye +3Process Reward ModelsRL for Language Model Reasoning

  3. Cross-Rollout Bellman Closure for Long-Horizon Agentic Reinforcement Learning

    Sep 28, 2026Yangyang Ren, Haodong Zhu, Linlin Yang +3Agentic RLStep-Level Credit Assignment in RL

  4. A Systematic Benchmark of Explainable Methods for Temporal Attribution in Sequential Recommendation Systems

    Sep 23, 2026Akash Pandey, Kanisha Shah, Addrish Roy +5Gradient-Based AttributionSequential Recommendation

  5. Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation

    Sep 15, 2026Shiqi Liu, Zeyu He, Letian Tao +9RL for Language Model ReasoningTemporal Credit Assignment

  6. Phase-and-First-Arrival VLM Feedback for Sparse-Reward Reinforcement Learning in Surgical Manipulation

    Sep 7, 2026Wanli Liuchen, Fangyuan Wang, Bin Li +4Reward ShapingTemporal Credit Assignment

  7. RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

    Aug 19, 2026Yugu Li, Zehong Cao, Jianglin Qiao +1Agentic RLReinforcement Learning

  8. Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

    Aug 13, 2026Yao Zhou, Hang Gao, Fengge Wu +2Group Relative Policy OptimizationStep-Level Credit Assignment in RL

  9. Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

    Aug 7, 2026Renye Yan, Jikang Cheng, You Wu +4Diffusion Model AlignmentTemporal Credit Assignment

  10. Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

    Jul 30, 2026Henglin Liu, Fangyuan Kong, Jing Wang +7Diffusion Model AlignmentVideo Diffusion Models

  11. Counterfactual Shapley Credit Assignment

    Jul 18, 2026Mingxuan Li, Kai-Zhan Lee, Elias BareinboimCredit Assignment in RLTemporal Credit Assignment

  12. When Dynamics Models Read the Wrong Time Steps: Label-Free Event Credit Re-Anchoring for Robust Global Readouts

    Jun 16, 2026Yifan WangLatent Dynamics ModelingOOD Generalization

  13. Trace-Mediated Peak Bias: Bridging Temporal Credit Assignment and Cognitive Heuristics in Deep Reinforcement Learning

    Jun 3, 2026Viktor Veselý, Aleksandar Todorov, Erwan Escudie +1Temporal Credit AssignmentTemporal-Difference Learning

  14. Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition

    Jun 1, 2026Pengyang Ling, Jiazi Bu, Yujie Zhou +6Diffusion Model AlignmentGroup Relative Policy Optimization

  15. Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning

    Apr 22, 2026Aravind Venugopal, Jiayu Chen, Xudong Wu +3Reward ShapingTemporal Credit Assignment

  16. Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO

    Feb 6, 2026Yunze Tong, Mushui Liu, Canyu Zhao +7Flow MatchingTemporal Credit Assignment

  17. Teaching signal synchronization in deep neural networks with prospective neurons

    Nov 18, 2025Nicolas Zucchet, Qianqian Feng, Axel Laborieux +3Neural ProcessesTemporal Credit Assignment

  18. A Gradient-based yet Spike-Timing-Dependent Solution to the Feedback Learning Problem in Neural Microcircuits

    Date pendingXiangnan Zhang, Jingxin Liu, Ranqi Lu +6Neural ProcessesTemporal Credit Assignment