Q-Learning

Latest papers 79

All topics
CardsList
  1. Q-Learning for Reachability in MEC-Free MDPs

    Oct 1, 2026Lu-Chin Chang, Suguman BansalQ-LearningMarkov Decision Processes

  2. Persistent Partners Raise Prices Among Learning Agents

    Sep 28, 2026Paul-Peter Arslan, Yubin Kim, Xiao XiaoDynamic PricingPrices

  3. Q-learning Penalized Transformer for Safe Offline Reinforcement Learning

    Sep 28, 2026Shengchao Hu, Peng Wang, Jifeng Hu +5Model-Based Reinforcement LearningQ-Learning

  4. Right Choice of Classification Algorithms Based on Reinforcement Learning for Prediction of Non-Alcoholic Fatty Liver

    Sep 24, 2026Hasan Samadbin, Arman DaliriCholangiocarcinomaClassifier

  5. Offline Reinforcement Learning for Distribution-Grid Protection

    Sep 21, 2026Julian Oelhaf, Alexander Luce, Christian Bergler +2Power SystemsQ-Learning

  6. Mitigating Retaliatory Algorithmic Collusion in Repeated Games

    Sep 17, 2026Karthik Sivachandran, Rohan PalejaCollusionQ-Learning

  7. APGEM: Adaptive Policy-Guided Error Mitigation for Quantum Reinforcement Learning on a Real-World CVRP Case Study

    Sep 16, 2026Shabir Ahmad Sofi, Bisma Majid, Mir Mohammad YousufVariational Quantum CircuitsQ-Learning

  8. Towards Surrogate Based Dequantization of Quantum Reinforcement Learning

    Sep 14, 2026Pablo Rodriguez-Grasa, Sofiene Jerbi, Mikel Sanz +1Q-LearningGradient Quantization

  9. Adaptive Agent Design

    Sep 14, 2026Raj Kiriti Velicheti, Subhonmesh Bose, Tamer BaşarQ-LearningMarkov Decision Processes

  10. SCQ: Stabilizing Conservative Q-Learning with Sigmoid-Bounded Entropy

    Sep 14, 2026Xiefeng Wu, Shu Zhang, Zhaojie Chu +1Q-LearningEntropy Regularized Reinforcement Learning

  11. Decentralized Safe Multi-Agent Reinforcement Learning via Predictive Shielding

    Sep 7, 2026Yacine El Yamani, Hanna Krasowski, Elena VanneauxMulti-Agent Reinforcement LearningMulti-Robot Systems

  12. Revisiting Overestimation Bias Problem of Q-learning: Settling Large Discrete Action Space via Action Intersection

    Aug 13, 2026Pu Li, Tao Tan, Hong Xie +2Q-LearningAction Space

  13. Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry

    Aug 13, 2026Larissa Xu, King Bi, William ChangQ-LearningMulti-Agent Reinforcement Learning

  14. Language-Structured Relational Q-Learning for Threat-Aware Control in Safety-Critical Driving

    Aug 11, 2026Aditya Humnabadkar, Huaizhong Zhang, Ardhendu BeheraQ-LearningTrajectory-Level Credit

  15. Dueling Deep Q-Learning for Intrusion Detection

    Aug 11, 2026Logan Luna, Matthew P. Berkowitz, Laxima Niure Kandel +1Intrusion DetectionDeep Q-Networks

  16. Adaptive Finite-Budget Training for CVaR Risk-Aware Q-Learning

    Aug 5, 2026Yifan Wu, Junjie Lei, Wenjie HuangConditional-Value-At-RiskQ-Learning

  17. Revisiting TD Target Aggregation under Uncertainty in Q-Learning

    Aug 4, 2026Lipeng Zu, Xiaonan ZhangDeep Q-NetworksQ-Learning

  18. Improved Quantum Algorithms for Reinforcement Learning Under a Generative Model

    Aug 3, 2026Joao F. DoriguelloQ-LearningOptimal Policies

  19. Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning

    Aug 3, 2026Abdelghani Ghanem, Mounir GhoghoQ-LearningValue Functions

  20. Robust Asynchronous Q-Learning under Reward and State Corruption via Batching

    Jul 23, 2026Sreejeet Maity, Aritra MitraQ-LearningAdversarial Corruption

  21. Equilibrium stability as a driver of cooperation among Q-learners

    Jul 15, 2026Janusz M. Meylahn, Maximilian SchäferCollusionCooperation

  22. Q-Learning Lab: Teaching Reinforcement Learning Through Learner-Generated Trace Analysis

    Jul 12, 2026Ekkachai JuengQ-LearningOffline Reinforcement Learning

  23. Spectral Analysis of Dueling Q-Learning

    Jul 9, 2026Donghwan LeeQ-LearningDeep Q-Networks

  24. Hybridizing a Grouping Metaheuristic with Reinforcement Learning for the One-Dimensional Bin Packing Problem

    Jul 2, 2026Zitouni Rania, Mostefai Mounir Sofiane, Tati Youcef +3Knapsack ConstraintMetaheuristics

  25. DiPS: Dialogue Policy Selection for High-Stakes Persuasion Agents

    Jul 2, 2026Tianyi Zhang, Mousumi Das, Abrar Anwar +2PersuasionLarge Language Model Policy Optimization

  26. Accelerating Q-learning through Efficient Value-Sharing across Actions

    Jun 29, 2026Prabhat Nagarajan, Brett Daley, Martha White +1Deep Q-NetworksQ-Learning

  27. Heavy-Ball Q-Learning with Residual Weighting Correction

    Jun 25, 2026Donghwan LeeQ-LearningCorrection

  28. Mesh-RL: Coupled subgrid reinforcement learning

    Jun 24, 2026Behnam Gheshlaghi, Bahador Rashidi, Shahin AtakishiyevTemporal DifferenceQ-Learning

  29. NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning

    Jun 19, 2026Xinwei Liu, Junyuan Liang, Zicong Hong +2Model-Free Reinforcement LearningQ-Learning

  30. Robust QQ-learning for mean-field control under Wasserstein uncertainty in common noise

    Jun 18, 2026Mathieu Laurière, Ariel Neufeld, Kyunghyun ParkStochastic Optimal ControlQ-Learning

  31. Pareto Q-Learning with Reward Machines

    Jun 17, 2026Arnaud Lequen, Clément Legrand-Lixon, Léo SaulièresMulti-Objective Reinforcement LearningQ-Learning

  32. Reinforcement Learning Foundation Models Should Already Be A Thing

    Jun 17, 2026Abdelrahman Zighem, Jill-Jênn VieTabular Foundation ModelsWireless Foundation Models

  33. Quantum Annealing Enhanced Reinforcement Learning for Accurate Remaining Useful Lifetime Prediction

    Jun 16, 2026Manoranjan Gandhudi, Arunkumar V., G. R. Anil +1Quantum AnnealingUseful Life Prediction

  34. Reversal Q-Learning

    Jun 16, 2026Aditya Oberai, Seohong Park, Sergey LevineFlow PoliciesModel-Based Reinforcement Learning

  35. QPILOTS: Efficient Test-Time Q-Steering for Flow Policies

    Jun 11, 2026Yifan Ruan, Chenyang Cao, Andreas Burger +7Flow PoliciesQ-Learning

  36. Geometrically Averaged Hard Target Updates for Linear Q-Learning

    Jun 9, 2026Donghwan LeeQ-LearningLinear Quadratic Regulator

  37. QnRL: Quantum-Native Reinforcement Learning

    Jun 6, 2026Alexander DeRieux, Walid SaadQuantum LearningQ-Learning

  38. COP-Q: Safety-First Reinforcement Learning for Robot Control via Cholesky-Ordered Projection

    Jun 3, 2026Guopeng Li, Moritz A. Zanger, Matthijs T. J. Spaan +1Safety ConstraintsQ-Learning

  39. Autopilot-Preserving Residual Q-Learning with HJB-Inspired Finite-Action Risk Filtering for Fixed-Wing UAV Command Supervision

    May 31, 2026Mehmet Iscan, Batuhan TemizResidual PolicyUnmanned Aerial Vehicles

  40. Target Updates May Stabilize Linear Q-Learning: Periodic and Soft Dynamics

    May 31, 2026Donghwan LeeQ-LearningLinear Quadratic Regulator

  41. Moment Matching Q-Learning

    May 27, 2026Yiyan, Liang, Sifei Liu +1Q-LearningGenerative Flow Networks

  42. Return-to-Go Is More Than a Number: Q-Guided Alignment for Return-Conditioned Supervised Learning

    May 27, 2026Yuxiao Yang, Weitong ZhangQ-LearningSequence Modeling

  43. Commit to the Bit: Reactive Reinforcement Learning Done Right

    May 27, 2026Onno Eberhard, Claire Vernade, Michael MuehlebachQ-LearningMarkov Decision Processes

  44. Trust Region Q Adjoint Matching

    May 26, 2026Yonghoon Dong, Kyungmin Lee, Changyeon Kim +2Flow PoliciesQ-Learning

  45. ReversedQ: Opportunities for Faster Q-Learning in Episodic Online Reinforcement Learning

    May 20, 2026Sofia R. Miskala-Dinc, Aviva PrinsQ-LearningModel-Free Reinforcement Learning

  46. Learning to Hand Off: Provably Convergent Workflow Learning under Interface Constraints

    May 18, 2026Jiayu Li, Enpei Zhang, Dawei Zhou +2Q-LearningMulti-Agent Workflows

  47. TabQL: In-Context Q-Learning with Tabular Foundation Models

    May 18, 2026Qisai Liu, Zhanhong Jiang, Timilehin Ayanlade +4Deep Q-NetworksQ-Learning

  48. On Gaussian approximation for entropy-regularized Q-learning with function approximation

    May 17, 2026Artemy Rubtsov, Rahul Singh, Eric Moulines +2Entropy Regularized Reinforcement LearningQ-Learning

  49. Sign-Separated Asymmetric Finite-Time Error Analysis of Q-Learning

    May 15, 2026Donghwan LeeQ-LearningValue Functions

  50. Clock-state olfactory search in turbulent flows using Q-learning: The geometry of plume recovery

    May 15, 2026Marco Rando, Robin A. Heinonen, Yujia Qi +1Q-LearningSmells

  51. ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization

    May 14, 2026Letian Yang, Xu Liu, Yiqiang Lu +3Q-LearningModel Fine-Tuning

  52. Learning What Matters: Adaptive Information-Theoretic Objectives for Robot Exploration

    May 12, 2026Youwei Yu, Jionghao Wang, Zhengming Yu +2Bayesian Experimental DesignExploration

  53. Debiased Model-based Representations for Sample-efficient Continuous Control

    May 12, 2026Jiafei Lyu, Zichuan Lin, Scott Fujimoto +5Q-LearningLatent Dynamics