Value Functions

Momentum

12 papers in the last four weeks, against 1 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 78

All topics
CardsList
  1. One-Step Generative Modeling via Training Dynamics Action

    Sep 30, 2026Zhangyong Liang, Ying Huang, Haibin LingGenerative ModelsStudent-Generated Trajectories

  2. Loop-Free Inverse Reinforcement Learning via Sequential Value Recovery with Q-Score Matching

    Sep 30, 2026Yang chen, Yitan Zhang, Michael Witbrock +1Offline Reinforcement LearningValue Functions

  3. A Reachability-based Safety Certificate for Dynamical System Motion Policies

    Sep 29, 2026Aditya Vats, Tianyi Xia, Nadia FigueroaProbabilistic SafetyControl Barrier Functions

  4. Deep Epistemic Value Functions for Optimistic Exploration

    Sep 28, 2026Leander Diaz-Bone, Marco Bagatella, Jonas Hübotter +1Stochastic ExplorationValue Functions

  5. Statistical Convergence of Transformer Encoder-Accelerated Robust Reinforcement Learning

    Sep 20, 2026Suman Banerjee, Hiroyasu TsukamotoOffline Reinforcement LearningValue Functions

  6. SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

    Sep 18, 2026Saksham Singh, Zheyuan Hu, Max Sobol Mark +3Robot PoliciesRobotic Manipulation

  7. Winning a Won Game: Strict Reach-Avoid-Stay Control Barrier Functions for High-Dimensional Black-Box Systems

    Sep 16, 2026Donggeon David Oh, Duy P. Nguyen, Gongkai Yuan +3Control Barrier FunctionsValue Functions

  8. A Convergence Framework for Deep VV-Learning: Error Propagation and Sharp Action-Gap Bounds

    Sep 16, 2026Yury KolomeytsevValue FunctionsOptimal Learner

  9. Learning to Solve Stochastic Controls with Unknown Drifts and Running Rewards: Theory, Algorithms and Convergence

    Sep 14, 2026Jin Ma, Gaozhan Wang, Jianfeng Zhang +1Stochastic Optimal ControlValue Functions

  10. The Surprising Effectiveness of Approximate Value Iteration in Self-Play

    Sep 8, 2026Raphael Boige, Amine Boumaza, Bruno ScherrerSelf-PlayMonte Carlo Tree Search

  11. Game-Agnostic Value Functions through Automatic JSON Feature Extraction

    Aug 30, 2026Dien Nguyen, Diego Perez-LiebanaValue FunctionsAutonomous Agents

  12. Aftab: A Progressive Design Study of Visual Encoders and Value Estimation for Replay-Free Parallelized Q-Learning

    Aug 7, 2026Taha Shieenavaz, Shabnam Zareshahraki, Loris NanniDeep Q-NetworksValue Functions

  13. Analytic Planning under Uncertainty with Moment Closure

    Aug 3, 2026Shishir Sharma, Doina PrecupPredictive UncertaintyValue Functions

  14. Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning

    Aug 3, 2026Abdelghani Ghanem, Mounir GhoghoQ-LearningValue Functions

  15. Climate-Dyna Deep Hedging for XVAs: Model-Based Reinforcement Learning, Residual Climate HVA, and Hedge-Instrument Discovery

    Aug 2, 2026Xiaozhen Wang, Francois Buet-GolfouseClimateValue Functions

  16. Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?

    Jul 29, 2026Perry Dong, Ron Polonsky, Dorsa Sadigh +1Reinforcement Fine-TuningValue Functions

  17. Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning

    Jul 26, 2026Minh Vu, Konstantinos SlavakisOffline Reinforcement LearningValue Functions

  18. General Value Functions for Remaining Useful Life and Failure-Mode Prediction

    Jul 24, 2026Hao Yan, Ali Sarabi, Qing Zou +1Useful Life PredictionEarly Failure Prediction

  19. Variance-Reduced Q-Learning over Static and Time-Varying Networks

    Jul 24, 2026Sreejeet Maity, Feng Zhu, Aritra Mitra +1Multi-Agent Reinforcement LearningDecentralized Learning

  20. Relative Value Learning

    Jul 23, 2026Marc Höftmann, Jan Robine, Stefan HarmelingValue FunctionsBellman Equation

  21. Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence

    Jul 22, 2026Runlong Zhou, Zihan Zhang, Maryam Fazel +1Model-Free Reinforcement LearningValue Functions

  22. Generalised Bellman recurrence and three dualities in sequential decision-making

    Jul 20, 2026Fernando E. Rosas, David Hyland, Daniel PolaniBellman EquationValue Functions

  23. Environment Parameter Gradient Theorem for Policy-Environment Co-Design in Reinforcement Learning

    Jul 14, 2026Amber SrivastavaPolicy GradientValue Functions

  24. Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning

    Jul 10, 2026Wenke Xia, Pei Ren, Wenbo Yu +10Model-Based Reinforcement LearningValue Functions

  25. Deep Learning for Dynamic Programming with Recursive Utility

    Jul 5, 2026Xianhua Peng, Wu GuoValue FunctionsOptimal Learner

  26. Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models

    Jul 4, 2026Xinyi Xie, Zican Hu, Zhanyu Liu +7Frozen Vision-Language ModelsAction Generation

  27. Generalization in offline RL: The structure is more important than the amount of pessimism

    Jul 2, 2026Max Weltevrede, Matthijs T. J. Spaan, Wendelin BöhmerPessimismModel-Based Reinforcement Learning

  28. Learning the Supports for Categorical Critic in Reinforcement Learning

    Jul 2, 2026Jen-Yen Chang, Takayuki Osa, Tatsuya HaradaSoft Actor-CriticValue Functions

  29. ShardNet: Training Neural Controllers with Hard, Non-Convex Constraints

    Jun 29, 2026Long Kiu Chung, Shreyas KousikSafety ConstraintsLearning-Based Control

  30. World Value Models for Robotic Manipulation

    Jun 23, 2026Zhihao Wang, Jianxiong Li, Yu Cui +4Efficient World-Action ModelRobotic Manipulation

  31. Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation

    Jun 23, 2026Xinyao Qin, Junjie Lu, Kaixin Wang +7ImitationValue Functions

  32. Hessian-augmented Supervised Learning for Hamilton-Jacobi-Bellman PDEs

    Jun 22, 2026Matías Gómez-Aedo, Behzad Azmi, Yuyang Huang +2Optimal ControlHamilton-Jacobi Reachability

  33. Horizon Adaptive Offline Policy Learning via Value Stitching

    Jun 19, 2026Kexin Zheng, Xianyuan Zhan, Xintao YanValue FunctionsHorizon

  34. VIMPO: Value-Implicit Policy Optimization for LLMs

    Jun 18, 2026Zhewei Kang, Aosong Feng, Sergey Levine +2Reinforcement Learning With Verifiable RewardFrictive Policy Optimization

  35. UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning

    Jun 10, 2026Haoyuan Deng, Yitong Gao, Yudong Lin +3Value FunctionsAgentic

  36. Bellman-Taylor Score Decoding for Markov Decision Processes with State-Dependent Feasible Action Sets

    Jun 9, 2026Yi Chen, Rushuai Yang, Qiang Chen +2Markov Decision ProcessesBellman Equation

  37. Bayesian learning for the stochastic shortest path problem

    Jun 3, 2026Chon Wai Ho, Sumeetpal S. Singh, Jiaqi GuoMarkov Decision ProcessesBayesian Neural Networks

  38. ShaplEIG: Bayesian Experimental Design for Shapley Value Estimation

    Jun 1, 2026David Rundel, Fabian Fumagalli, Maximilian Muschalik +2Shapley ValueBayesian Experimental Design

  39. Shape Your Body: Value Gradients for Multi-Embodiment Robot Design

    May 30, 2026Nico Bohlinger, Jan PetersValue FunctionsBody

  40. Value Functions as Supermartingale Certificates

    May 29, 2026Alessandro Abate, Daniel Contro, Mirco Giacobbe +2Value FunctionsReinforcement Learning With Verifiable Reward

  41. Reward Transfer from Inverse Reinforcement Learning: A Coupled Minimax Approach

    May 27, 2026Guang-Yuan Hao, Lars van der Laan, Aurélien Bibaut +1Offline Reinforcement LearningValue Functions

  42. BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning

    May 26, 2026Shijin Gong, Erhan Xu, Kai Ye +3Value FunctionsVerifiable Rewards

  43. Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning

    May 25, 2026Zhaoyu Zhu, Rui Gao, Shuang LiEntropy Regularized Reinforcement LearningPolicy Gradient

  44. On the Sample Complexity of Discounted Reinforcement Learning with Optimized Certainty Equivalents

    May 20, 2026Oliver Mortensen, Mohammad Sadegh TalebiConditional-Value-At-RiskValue Functions

  45. Dynamic Shapley Computation

    May 20, 2026Xuan Yang, Hsi-Wen Chen, Ming-Syan Chen +1Shapley ValueLearning Dynamics

  46. Stitched Value Model for Diffusion Alignment

    May 19, 2026Hyojun Go, Hyungjin Chung, Prune Truong +8Diffusion AlignmentDiffusion Models

  47. Learning Interpretable Point-Based Clinical Risk Scores via Direct Optimization

    May 18, 2026Ying Cui, Albert M Li, Vivek Charu +3Risk StratificationMultimorbidity

  48. TabQL: In-Context Q-Learning with Tabular Foundation Models

    May 18, 2026Qisai Liu, Zhanhong Jiang, Timilehin Ayanlade +4Deep Q-NetworksQ-Learning

  49. Sign-Separated Asymmetric Finite-Time Error Analysis of Q-Learning

    May 15, 2026Donghwan LeeQ-LearningValue Functions

  50. Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques

    May 14, 2026Juho Kim, Tuomas SandholmVarianceValue Functions

  51. Executable Agentic Memory for GUI Agent

    May 12, 2026Zerui Qin, Sheng Yue, Xingyuan Hua +2Graphical User Interface AgentsAgentic Memory

  52. ACSAC: Adaptive Chunk Size Actor-Critic with Causal Transformer Q-Network

    May 10, 2026Qian Chen, Junqiao Zhao, Hongtu Zhou +4Soft Actor-CriticAction Chunks