Bellman Equation

Momentum

16 papers in the last four weeks, against 1 the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 81

All topics
CardsList
  1. Robust and Learned Online Matching in Growing Trees

    Sep 30, 2026Marek Gałązka, Hanna WdowickaDistribution MatchingBellman Equation

  2. Fast Regularized Policy Mirror Descent with One-Step TD Updates

    Sep 30, 2026Qipei Chen, Wenye Li, Yule Sun +1Mirror DescentTemporal Difference

  3. A First Glance at Jev for Network Traffic Classification: Accuracy, Processing Time, and Cost

    Sep 30, 2026Shenghe Xu, Lifan MeiModel EvaluationCloud

  4. Cross-Rollout Bellman Closure for Long-Horizon Agentic Reinforcement Learning

    Sep 28, 2026Yangyang Ren, Haodong Zhu, Linlin Yang +3Group-Based Reinforcement LearningBellman Equation

  5. Deep Weighted Bellman Residual Minimization for Q∗Q^* Estimation

    Sep 28, 2026Lican Kang, Jerry Zhijian Yang, Cheng Yuan +1Offline Reinforcement LearningBellman Equation

  6. Vector Bellman Theory for Multichain Robust Average-Reward Markov Decision Processes

    Sep 23, 2026Yue Wang, George AtiaMarkov Decision ProcessesBellman Equation

  7. Lifted Bellman Linear Programming for Offline Reinforcement Learning

    Sep 21, 2026Hyukjun Yang, Jongchan Park, Narim Jeong +1Model-Based Reinforcement LearningOffline Reinforcement Learning

  8. A Convergence Framework for Deep VV-Learning: Error Propagation and Sharp Action-Gap Bounds

    Sep 16, 2026Yury KolomeytsevValue FunctionsOptimal Learner

  9. Symmetric solution of the Bellman optimality equation for repeated harmony game

    Sep 14, 2026Hisato KomatsuBellman EquationSymmetry

  10. Bellman Policy Optimization

    Sep 14, 2026Zhuoqing Song, Haotian Xu, Xikun Zhang +1Reinforcement Learning With Verifiable RewardFrictive Policy Optimization

  11. Adaptive Agent Design

    Sep 14, 2026Raj Kiriti Velicheti, Subhonmesh Bose, Tamer BaşarQ-LearningMarkov Decision Processes

  12. A Bellman Optimality Equation for Plasticity

    Sep 11, 2026Jeremy Lucas, Doina PrecupPlasticityBellman Equation

  13. BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL

    Sep 9, 2026Guanqun Zhao, Zijun Xie, Binbin Zheng +3Gradient StalenessLarge Language Model Training

  14. CODS: Iterative Bellman-Residual Data Selection for Reusable Offline Reinforcement Learning

    Aug 7, 2026Ibne Farabi Shihab, Sanjeda Akter, Abu Sa-Adat Mohamed Moon-Im Al Ahsan +2Model-Based Reinforcement LearningOffline Reinforcement Learning

  15. Adaptive Finite-Budget Training for CVaR Risk-Aware Q-Learning

    Aug 5, 2026Yifan Wu, Junjie Lei, Wenjie HuangConditional-Value-At-RiskQ-Learning

  16. Revisiting TD Target Aggregation under Uncertainty in Q-Learning

    Aug 4, 2026Lipeng Zu, Xiaonan ZhangDeep Q-NetworksQ-Learning

  17. Search as Computation Allocation

    Jul 30, 2026Alexander TuisovComputational CostBellman Equation

  18. Reliability-Contagion Feasibility in LLM Multi-Agent Networks

    Jul 24, 2026Ruiwu Niu, Xincheng Shu, Ying ZhaoMulti-Agent CommunicationLarge Language Model Reliability

  19. Relative Value Learning

    Jul 23, 2026Marc Höftmann, Jan Robine, Stefan HarmelingValue FunctionsBellman Equation

  20. Long-Term Sequential Decision Making under Risk

    Jul 22, 2026Irmaan, Mirzanejad, Nadjet Bourdache +1Target RiskSequential Decision Making

  21. Generalised Bellman recurrence and three dualities in sequential decision-making

    Jul 20, 2026Fernando E. Rosas, David Hyland, Daniel PolaniBellman EquationValue Functions

  22. Distributional Soft Bellman Operator under the Cramér Geometry

    Jul 20, 2026Keru Wang, Yixin Deng, Yao Lyu +2Distributional Reinforcement LearningBellman Equation

  23. Statistical Efficiency and Inference of Quantile Distributional Reinforcement Learning

    Jul 9, 2026Zijie Cheng, Yang Peng, Zhihua ZhangDistributional Reinforcement LearningDistributions

  24. Fitted Occupancy-Ratio Evaluation without Bellman Completeness

    Jul 6, 2026Lars van der Laan, Nathan KallusBellman EquationOccupancy

  25. Tight Lower Bounds for the Multi-Secretary Problem via Bellman Certificates

    Jul 2, 2026Jiawei Zhang\Widetilde{\Mathcal{O}}(\Sqrt{T})$ RegretLower Bounds

  26. Learning the Supports for Categorical Critic in Reinforcement Learning

    Jul 2, 2026Jen-Yen Chang, Takayuki Osa, Tatsuya HaradaSoft Actor-CriticValue Functions

  27. PedNStream: Scalable Network Flow Simulation for Pedestrian Traffic Management

    Jul 1, 2026Weiming Mai, Dorine Duives, Serge HoogendoornMicroscopic Traffic SimulationsFlow Models

  28. Regularized Reward-Punishment Reinforcement Learning

    Jun 26, 2026Jiexin Wang, Eiji UchibeDeep Q-NetworksBellman Equation

  29. Mean-Field PhiBE: Continuous-Time Mean-Field Reinforcement Learning from Discrete-Time Data

    Jun 25, 2026Erhan Bayraktar, Martin Hernandez, Qinxin Yan +1Stochastic Optimal ControlModel-Free

  30. A Transport-Based Geometry of Belief-Cost

    Jun 19, 2026Laurent CaraffaBellman Equation

  31. Inverting the Bellman Equation: From QQ-Values to World Models

    Jun 19, 2026Alistair Letcher, Mattie Fellows, Alexander D. Goldie +3Model-Free Reinforcement LearningGoal-Conditioned Reinforcement Learning

  32. Robust QQ-learning for mean-field control under Wasserstein uncertainty in common noise

    Jun 18, 2026Mathieu Laurière, Ariel Neufeld, Kyunghyun ParkStochastic Optimal ControlQ-Learning

  33. A Diffusion Approximation for Temporal-Difference Learning with Linear Features under Markovian Noise

    Jun 16, 2026M. Forzo, E. Monzio Compagnoni, A. Russo +1Temporal DifferenceStochastic Differential Equations

  34. Maximum Entropy Inverse Reinforcement Learning for Mean-Field Games with Average Reward

    Jun 15, 2026Şevket Kaan Alkır, Naci Saldı, Berkay Anahtarcı +1Mean Field GamesEntropy Regularized Reinforcement Learning

  35. Bellman-Taylor Score Decoding for Markov Decision Processes with State-Dependent Feasible Action Sets

    Jun 9, 2026Yi Chen, Rushuai Yang, Qiang Chen +2Markov Decision ProcessesBellman Equation

  36. FLOWREADER: Min-Cost Flow Optimization for Multi-Modal Long Document Q&A

    Jun 5, 2026Ambuj Mehrish, Sebastiano VasconMultimodal DocumentsTop-K

  37. Prospect-Theory Behavior from Bellman Optimality in MDPs with Catastrophic States

    May 31, 2026Yujiao ChenConditional-Value-At-RiskMarkov Decision Processes

  38. Multivariate Distributional Reinforcement Learning Using Sliced Divergences

    May 29, 2026Baptiste Debes, Tinne TuytelaarsDistributional Reinforcement LearningBellman Equation

  39. On Distributional Reinforcement Learning in Chaotic Dynamical Systems

    May 28, 2026James Rudd-Jones, Mirco Musolesi, María Pérez-OrtizDistributional Reinforcement LearningChaos

  40. Reward Transfer from Inverse Reinforcement Learning: A Coupled Minimax Approach

    May 27, 2026Guang-Yuan Hao, Lars van der Laan, Aurélien Bibaut +1Offline Reinforcement LearningValue Functions

  41. A Contractive Feedback Semantics for Reinforcement Learning

    May 23, 2026Zuyuan ZhangBellman EquationFeedback

  42. Beyond the Bellman Recursion: A Pontryagin-Guided Framework for Non-Exponential Discounting

    May 20, 2026Hojin Ko, Jeonggyu HuhFrictive Policy OptimizationBellman Equation

  43. On Gaussian approximation for entropy-regularized Q-learning with function approximation

    May 17, 2026Artemy Rubtsov, Rahul Singh, Eric Moulines +2Entropy Regularized Reinforcement LearningQ-Learning

  44. Adaptive Multi-Round Allocation with Stochastic Arrivals

    May 12, 2026Yuqi Pan, Davin Choo, Haichuan Wang +3Queue ControlBellman Equation

  45. Stochastic Minimum-Cost Reach-Avoid Reinforcement Learning

    May 12, 2026Jingduo Pan, Taoran Wu, Yiling Xue +1Offline Reinforcement LearningBellman Equation

  46. Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation

    May 12, 2026Hao Wang, Joshua Bowden, Colton Crosby +1Robot PoliciesPolicy Evaluation

  47. Natural Policy Gradient as Doubly Smoothed Policy Iteration: A Bellman-Operator Framework

    May 11, 2026Phalguni Nanda, Zaiwei ChenPolicy GradientBoltzmann Policies

  48. Quantile-Coupled Flow Matching for Distributional Reinforcement Learning

    May 8, 2026Michael Groom, Victor-Alexandru Darvariu, Lars Kunze +2Distributional Reinforcement LearningConditional Flow Matching

  49. Central Limit Theorem for Two-Time-Scale Approximate Distributionally Robust RL

    May 8, 2026Shengbo Wang, Zexi ZhangDistributional Reinforcement LearningLarge Deviation Principle