Temporal-Difference Learning

Momentum

9 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 57

All topics
CardsList
  1. Common-Mode Errors Limit Low-Timestep Deep Spiking Q-Networks

    Oct 6, 2026Zijie Xu, Bingrui Guo, Yiding Sun +3Deep Q-LearningTemporal-Difference Learning

  2. Hierarchical Time-aware Bootstrapping for Off-Policy Subgoal Value Learning

    Oct 4, 2026Bingyun Liu, Yuheng JingHierarchical RLTemporal-Difference Learning

  3. Temporal-Difference Learning for Dragonchess

    Oct 1, 2026Jim O'Connor, Annika Hoag, Sarah Goyette +1Game-Playing AgentsTemporal-Difference Learning

  4. Fast Regularized Policy Mirror Descent with One-Step TD Updates

    Sep 30, 2026Qipei Chen, Wenye Li, Yule Sun +1Markov Decision ProcessesPolicy Optimization

  5. Sharp Statistical Rates for Asynchronous TD Learning with Markovian Data

    Sep 30, 2026Yang PengAsynchronous RLStochastic Approximation

  6. GTRL: Grounding Divide-and-Conquer Value Learning with Temporal Differences

    Sep 27, 2026Abdul Monaf Chowdhury, MD Sameer Iqbal Chowdhury, Shifat E Arman +1Reinforcement LearningTemporal-Difference Learning

  7. A Contraction Framework for Stochastic Operators with Bootstrapping: Application to TD Learning

    Sep 24, 2026Ids van der Werf, Sergio Rozada, Antonio G. MarquesStochastic ApproximationTemporal-Difference Learning

  8. Policy Complexity, Reaction Time, and Bounded Rationality in Reinforcement Learning

    Sep 23, 2026James Wu, Chris R. SimsComputational Cognitive ModelingReinforcement Learning

  9. Limiting-Kernel Q(λλ): Bridging Short and Long Horizons

    Sep 23, 2026Tolga Ok, Arman Sharifi Kolarijani, Peyman Mohajerin Esfahani +1Value Function EstimationPolicy Evaluation

  10. CARE-VI: Conservative Adaptive Reliability Estimation for Value Improvement in Off-Policy Actor-Critic Learning

    Sep 17, 2026Xiang Zou, Shengzhu Shi, Junqi Gao +1Temporal-Difference LearningActor-Critic Methods

  11. A Finite-Sample Analysis of Quantile Temporal-Difference Learning

    Aug 27, 2026Zijie Cheng, Xiang Li, Yang Peng +1Distributional RLStochastic Approximation

  12. Online Inference for Quantile Temporal Difference Learning in Distributional Reinforcement Learning

    Aug 13, 2026Zijie Cheng, Yang Peng, Zhihua ZhangDistributional RLReinforcement Learning

  13. Self-Normalized Inference for Constant-Stepsize Temporal-Difference Learning under Markovian Sampling

    Aug 11, 2026Min Zeng, Yichen Zhang, Xiaofeng ShaoConfidence Region EstimationStochastic Approximation

  14. Learning Suffers More Than the Policy Class Under Partial Observability: A Closed-Form Analysis

    Aug 7, 2026Idil GözelRL ControlReinforcement Learning

  15. Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

    Aug 7, 2026Hongxi Yan, Ziyue Huang, Shichao Fan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  16. Revisiting TD Target Aggregation under Uncertainty in Q-Learning

    Aug 4, 2026Lipeng Zu, Xiaonan ZhangDeep Q-LearningValue Function Estimation

  17. Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning

    Aug 3, 2026Abdelghani Ghanem, Mounir GhoghoQ-LearningTemporal-Difference Learning

  18. Online Policy Evaluation for MDPs with Dynamic UBSR Measures

    Jul 25, 2026Weikai Wang, Erick DelagePolicy EvaluationRisk-Sensitive RL

  19. General Value Functions for Remaining Useful Life and Failure-Mode Prediction

    Jul 24, 2026Hao Yan, Ali Sarabi, Qing Zou +1RUL EstimationValue Function Estimation

  20. Relative Value Learning

    Jul 23, 2026Marc Höftmann, Jan Robine, Stefan HarmelingValue Function EstimationTemporal-Difference Learning

  21. Generalized Kalman filter based temporal difference reinforcement learning

    Jul 22, 2026Vasos Arnaoutis, Eric Lutters, Bojana RosićRL ControlReinforcement Learning

  22. Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces

    Jul 20, 2026Dongming Wang, Pengcheng Dai, Wenwu Yu +1Multi-Agent ControlTemporal-Difference Learning

  23. TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

    Jul 15, 2026Leitian Tao, Baolin Peng, Wenlin Yao +5Credit Assignment in RLStep-Level Credit Assignment in RL

  24. Non-Convex Sparse Reinforcement Learning via Non-Monotone Inclusions

    Jul 6, 2026Kyohei Suzuki, Konstantinos SlavakisTemporal-Difference LearningNonconvex Optimization

  25. Mesh-RL: Coupled subgrid reinforcement learning

    Jun 24, 2026Behnam Gheshlaghi, Bahador Rashidi, Shahin AtakishiyevReinforcement LearningCredit Assignment in RL

  26. A Single Stepsize Suffices for Unprojected Linear TD(0): Simultaneous Robust and Fast Rates via Polyak--Ruppert Averaging

    Jun 23, 2026Wei-Cheng Lee, Francesco OrabonaStochastic ApproximationTemporal-Difference Learning

  27. On the Variance of Temporal Difference Learning and its Reduction Using Control Variates

    Jun 18, 2026Hsiao-Ru Pan, Bernhard SchölkopfValue Function EstimationTemporal-Difference Learning

  28. A Diffusion Approximation for Temporal-Difference Learning with Linear Features under Markovian Noise

    Jun 16, 2026M. Forzo, E. Monzio Compagnoni, A. Russo +1Stochastic Differential EquationsTemporal-Difference Learning