Value Function Estimation

Latest papers 45

All topics
CardsList
  1. Evaluation of Active Feature Acquisition Policies with Tabular Foundation Models

    Oct 5, 2026Yuta Kobayashi, Divyam Madaan, Shalmali JoshiOff-Policy EvaluationValue Function Estimation

  2. Privy to the Foil: Recasting Value Estimation with a Self-Privileged Critic for RLVR

    Sep 29, 2026Kun Liang, Chenming Tang, Clive Bai +5Value Function EstimationRL for Language Model Reasoning

  3. Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +3Reinforcement LearningValue Function Estimation

  4. Deep Epistemic Value Functions for Optimistic Exploration

    Sep 28, 2026Leander Diaz-Bone, Marco Bagatella, Jonas Hübotter +1Value Function EstimationRL Exploration

  5. Deep Weighted Bellman Residual Minimization for Q∗Q^* Estimation

    Sep 28, 2026Lican Kang, Jerry Zhijian Yang, Cheng Yuan +1Off-Policy EvaluationValue Function Estimation

  6. Limiting-Kernel Q(λλ): Bridging Short and Long Horizons

    Sep 23, 2026Tolga Ok, Arman Sharifi Kolarijani, Peyman Mohajerin Esfahani +1Value Function EstimationPolicy Evaluation

  7. Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

    Sep 16, 2026Yizhuo Li, Jianhao Yan, Yun Luo +9RL for Language ModelsValue Function Estimation

  8. The Surprising Effectiveness of Approximate Value Iteration in Self-Play

    Sep 8, 2026Raphael Boige, Amine Boumaza, Bruno ScherrerGame-Playing AgentsSelf-Play RL

  9. Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL

    Sep 2, 2026Hyeonseong Jeon, Youngwoon LeeReinforcement LearningOffline RL

  10. Game-Agnostic Value Functions through Automatic JSON Feature Extraction

    Aug 30, 2026Dien Nguyen, Diego Perez-LiebanaGame-Playing AgentsValue Function Estimation

  11. Revisiting TD Target Aggregation under Uncertainty in Q-Learning

    Aug 4, 2026Lipeng Zu, Xiaonan ZhangDeep Q-LearningValue Function Estimation

  12. Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning

    Aug 3, 2026Botao Dong, Longyang Huang, Ning Pang +1Distribution ShiftValue Function Estimation

  13. General Value Functions for Remaining Useful Life and Failure-Mode Prediction

    Jul 24, 2026Hao Yan, Ali Sarabi, Qing Zou +1RUL EstimationValue Function Estimation

  14. Relative Value Learning

    Jul 23, 2026Marc Höftmann, Jan Robine, Stefan HarmelingValue Function EstimationTemporal-Difference Learning

  15. Generalized Kalman filter based temporal difference reinforcement learning

    Jul 22, 2026Vasos Arnaoutis, Eric Lutters, Bojana RosićRL ControlReinforcement Learning

  16. Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning

    Jul 10, 2026Wenke Xia, Pei Ren, Wenbo Yu +10Value Function EstimationRobotic Manipulation

  17. Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models

    Jul 4, 2026Xinyi Xie, Zican Hu, Zhanyu Liu +7Value Function EstimationTest-Time Scaling

  18. Accelerating Q-learning through Efficient Value-Sharing across Actions

    Jun 29, 2026Prabhat Nagarajan, Brett Daley, Martha White +1Deep Q-LearningValue Function Estimation

  19. Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation

    Jun 23, 2026Xinyao Qin, Junjie Lu, Kaixin Wang +7Value Function EstimationImitation Learning

  20. Hessian-augmented Supervised Learning for Hamilton-Jacobi-Bellman PDEs

    Jun 22, 2026Matías Gómez-Aedo, Behzad Azmi, Yuyang Huang +2Value Function EstimationPDE Solving

  21. Horizon Adaptive Offline Policy Learning via Value Stitching

    Jun 19, 2026Kexin Zheng, Xianyuan Zhan, Xintao YanValue Function EstimationOffline RL

  22. On the Variance of Temporal Difference Learning and its Reduction Using Control Variates

    Jun 18, 2026Hsiao-Ru Pan, Bernhard SchölkopfValue Function EstimationTemporal-Difference Learning

  23. Feat2Go: Visual Feature-Grounded Value Estimation for Embodied Reinforcement Learning

    May 29, 2026Junyang Shu, Zhiwei Lin, Bingqing Wei +1Reward ShapingValue Function Estimation

  24. Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning

    May 28, 2026Zizhe Chen, Jiqian Dong, Yizhou Tian +4RL for Language ModelsValue Function Estimation

  25. What Frozen VLAs Already Know About Success: A Probing Study of Value-Like Structure in Foundation Robot Policies

    May 27, 2026Jiachen Zhang, Junnan Nie, Junyi Lao +4Value Function EstimationRobotic Manipulation

  26. Generative Modeling by Value-Driven Transport

    May 21, 2026Pablo Moreno-Muñoz, Adrian Müller, Gergely NeuValue Function EstimationStochastic Optimal Control

  27. OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning

    May 21, 2026Yu Li, Rui Miao, Tian Lan +1Value Function EstimationToken-Level Credit Assignment