Optimal Policies

Momentum

2 papers in the last four weeks, down 33% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 61

All topics
CardsList
  1. Should I stay or should I show? Learning to selectively disclose information

    Sep 30, 2026Carlotta Giacchetta, Alessando Bogani, Cesare Barbera +4DisclosuresOptimal Policies

  2. A Decentralized Partially Observable Team Decision Methodology with Delayed Information Sharing

    Sep 22, 2026Xiaoxing Ren, Thomas Parisini, Andreas A. MalikopoulosPartially Observable Markov Decision ProcessMarkov Decision Processes

  3. From Relaxed Indexability to Exact Indexability: A tt-Step Approach for Partially Observable Restless Bandits

    Aug 25, 2026Qizhen Jia, Keqin LiuStochastic Multi-Armed BanditsOptimal Policies

  4. Fast A/B/n Testing: Exact Multi-Policy Comparison via Tree-Coupled Feedback Sharing

    Aug 13, 2026Yuxiao WenOptimal PoliciesFeedback

  5. Threshold Structure of Optimal Policies in Restart POMDPs

    Aug 11, 2026Konstantin Avrachenkov, Alexey Piunovskiy, Yi ZhangPartially Observable Markov Decision ProcessOptimal Policies

  6. Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions

    Aug 6, 2026Yuepeng Yang, Yuxin Chen, Yuejie ChiMarkov Decision ProcessesOptimal Policies

  7. Differentiating Through Dual Prices: End-to-End Policy Learning Under Capacity Constraints

    Aug 5, 2026Mohammadsaeed Haghi, Mahdi Salmani, Nima KelidariQueue ControlDynamic Pricing

  8. Minimax-Optimal Semiparametric Contextual Dynamic Pricing with Multimodal Revenue

    Aug 4, 2026Xueping Gong, Zhuoluo Zhang, Zhaowei Miao +1Dynamic PricingPrices

  9. Improved Quantum Algorithms for Reinforcement Learning Under a Generative Model

    Aug 3, 2026Joao F. DoriguelloQ-LearningOptimal Policies

  10. Learning Not to Optimize: Physics-Informed Action-Space Reshaping for Intent-Based Network Control

    Aug 2, 2026Zuyuan Zhang, Vaneet Aggarwal, Tian LanOptimal PoliciesOptical Networks

  11. The Greedy Advantage in Finite-Horizon Bandits

    Jul 31, 2026Kai Zhou, Michael Lingzhi Li, Kai WangStochastic Multi-Armed BanditsInterval Regret

  12. A Unified Algorithmic Framework for Hybrid Reinforcement Learning in Tabular MDPs with Shifted Transition Dynamics

    Jul 28, 2026Zheshun Wu, Renjie Zheng, Jinhang Zuo +2Model-Based Reinforcement LearningMarkov Decision Processes

  13. Robust Asynchronous Q-Learning under Reward and State Corruption via Batching

    Jul 23, 2026Sreejeet Maity, Aritra MitraQ-LearningAdversarial Corruption

  14. Optimizing Regret

    Jul 21, 2026Irene AldridgeRegretPolicy Gradient

  15. Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning

    Jul 19, 2026Joseph Lazzaro, Alessio Russo, Aldo PacchianoOptimal PoliciesMarkov Decision Processes

  16. From Optimal Policies to Individual Differences: Rethinking Reinforcement Learning for Biology

    Jul 17, 2026Patrick Govoni, Palina Bartashevich, Clémence Bergerot +3Optimal Policies

  17. Learning to Fine-tune Foundation Models under Resource Limitations

    Jul 12, 2026Thomas Tsouparopoulos, Iordanis KoutsopoulosContinual Fine-TuningWireless Foundation Models

  18. Provably Optimal Learning Algorithms for Assistance Games

    Jul 9, 2026Nivasini Ananthakrishnan, Mark Bedaywi, Michael I. Jordan +2Optimal LearnerMulti-Agent Reinforcement Learning

  19. CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning

    Jul 4, 2026Jiayi Guan, Tianle Zhang, Li Shen +8Model-Based Reinforcement LearningDiffusion Models

  20. Learning in Markovian bandits with non-observable states and constrained decision epochs

    Jun 25, 2026Thomas Hira, Victor Boone, Urtzi Ayesta +1Stochastic Multi-Armed Bandits\Widetilde{\Mathcal{O}}(\Sqrt{T})$ Regret

  21. Asymptotically Optimal Learning for Parametric Prophet Inequalities

    Jun 25, 2026Jung-hun Kim, Anna Grebennikova, Vianney PerchetConcentration BoundsOptimal Policies

  22. Mean-Field PhiBE: Continuous-Time Mean-Field Reinforcement Learning from Discrete-Time Data

    Jun 25, 2026Erhan Bayraktar, Martin Hernandez, Qinxin Yan +1Stochastic Optimal ControlModel-Free

  23. Low-Complexity Policy Tessellations in Structured Markov Decision Processes

    Jun 24, 2026Fredy PokouMarkov Decision ProcessesOptimal Policies

  24. Taiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM-Enhanced Recommendation

    Jun 2, 2026Yuecheng Li, Zeyu Song, Jing Yao +3Sequential RecommendationRetrievers

  25. A No-Regret Framework for Adaptive Incentive Design

    Jun 1, 2026Georgios Vasileiou, Lantian Zhang, Silun ZhangIncentivesOptimal Policies

  26. Auditing Near-Optimal Policies Can Be Exponentially Hard: Conditional Query Lower Bounds via Occupancy Rashomon Capacity

    May 29, 2026Ibne Farabi Shihab, Sanjeda Akter, Anuj SharmaModel AuditingOptimal Policies

  27. Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems

    May 29, 2026Jonathan Colaço Carr, Prakash Panangaden, Doina Precup +1Markov Decision ProcessesOptimal Policies

  28. Safe Equilibrium Policy Optimization for Strategic Agent Policies

    May 29, 2026Karthika Arumugam, Kiran Kumar Manku, Amit DhandaStrategic AgentsOptimal Policies

  29. Certified Policy Optimisation for Nested Causal Bandits via PAC-Bayes Risk

    May 28, 2026Tim Woydt, Paul-David ZuercherOptimal PoliciesThompson Sampling

  30. Variance-Adaptive Optimal Algorithm for Reinforcement Learning with Multinomial Logit Function Approximation

    May 27, 2026Wonyoung Kim, Min-Hwan Oh, Garud Iyengar +1Markov Decision ProcessesOptimal Policies

  31. Commit to the Bit: Reactive Reinforcement Learning Done Right

    May 27, 2026Onno Eberhard, Claire Vernade, Michael MuehlebachQ-LearningMarkov Decision Processes

  32. Human Decision-Making with AI Assistance under Correlated Features

    May 27, 2026Yanru Guan, Naveen Raman, Fei FangSpurious CorrelationsDecisions

  33. Generative Modeling by Value-Driven Transport

    May 21, 2026Pablo Moreno-Muñoz, Adrian Müller, Gergely NeuGenerative ModelsStochastic Optimal Control

  34. Scalable Bi-causal Optimal Transport via KL Relaxation and Policy Gradients

    May 17, 2026Haoyang Cao, Jesse Hoekstra, Renyuan Xu +2Optimal Transport ApproachStochastic Optimization

  35. Dynamic Latent Routing

    May 14, 2026Fangyuan Yu, Xin Su, Amir AbdullahMarkov Decision ProcessesOptimal Policies

  36. BSO: Safety Alignment Is Density Ratio Matching

    May 12, 2026Tien-Phat Nguyen, Truong Nguyen, Thin Nguyen +3Safety AlignmentLarge Language Model Alignment

  37. Optimal Policy Learning under Budget and Coverage Constraints

    May 12, 2026Giovanni CerulliOptimal PoliciesKnapsack Constraint

  38. Delightful Gradients Accelerate Corner Escape

    May 12, 2026Jincheng Mei, Ian OsbandPolicy GradientOptimal Policies

  39. Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with kk-step Policy Gradients

    May 11, 2026Alex DeWeese, Guannan QuPolicy GradientOptimal Policies

  40. Teacher-Aware Evolution of Heuristic Programs from Learned Optimization Policies

    May 11, 2026Minyu Chen, Song Qin, Ling-I Wu +2Automated Heuristic DesignEvolutionary Search

  41. Provable imitation learning for control of instability in partially-observed Vlasov--Poisson equations

    May 6, 2026Xiaofan Xia, Qin Li, Wenlong MouTemporally Coherent Imitation LearningPhase Space

  42. Structural Equivalence and Learning Dynamics in Delayed MARL

    May 5, 2026Jules Sintes, Ana Bušić, Jiamin ZhuPartially Observable Markov Decision ProcessMulti-Agent Reinforcement Learning

  43. Optimal Posterior Sampling for Policy Identification in Tabular Markov Decision Processes

    May 5, 2026Cyrille Kone, Kevin JamiesonOptimal PoliciesMarkov Decision Processes

  44. Right-Sizing Communication and Recommendation Set Size in AI-Assisted Search

    May 2, 2026Jing Dong, Prakirt Raj Jhunjhunwala, Yash KanoriaRecommendationAgentic Search

  45. Value Functions for Temporal Logic: Optimal Policies and Safety Filters

    May 1, 2026Oswin So, William Sharpless, Sylvia Herbert +1Value FunctionsSignal Temporal Logic

  46. Continuous-time q-learning for mean-field control with common noise, part-I: Theoretical foundations

    Apr 30, 2026Zhenjie Ren, Xiaoli Wei, Xiang Yu +1Stochastic Optimal ControlQ-Learning

  47. Optimally Auditing Adversarial Agents

    Apr 28, 2026Sanmay Das, Fang-Yi Yu, Yuang ZhangModel AuditingBounded Adversary

  48. Sample Complexity Bounds for Stochastic Shortest Path with a Generative Model

    Apr 17, 2026Jean Tarbouriech, Matteo Pirotta, Michal Valko +1Optimal PoliciesShortest Paths

  49. Separation is Optimal for LQR under Intermittent Feedback

    Mar 29, 2026Abdullah Y. Etcibasi, C. Emre Koksal, Eylem EkiciLinear Quadratic RegulatorOptimal Policies

  50. Calculating Mutual Information between a Reward Maximizer and its Environment

    Feb 13, 2026Alfred Harwood, Jose Faustino, Alex AltairOptimal PoliciesMutual Information

  51. Model-Free Robust Average-Reward Reinforcement Learning with Sample Complexity Analysis

    May 18, 2025Zachary Roch, George Atia, Yue WangModel-FreeOffline Reinforcement Learning

  52. Adaptive Resolving Methods for Markov Decision Processes with Function Approximations

    May 17, 2025Jiashuo Jiang, Yinyu Ye, Yiming ZongMarkov Decision ProcessesOptimal Policies

  53. Bridging Rested and Restless Bandits with Graph-Triggering: Rising and Rotting

    Sep 9, 2024Gianmarco Genalti, Marco Mussi, Nicola Gatti +3Stochastic Multi-Armed BanditsBandits

  54. Unfair Utilities and First Steps Towards Improving Them

    Jun 1, 2023Frederik Hytting Jørgensen, Sebastian Weichwald, Jonas PetersAlgorithmic FairnessUtility Maximization

  55. Incentives to Offer Algorithmic Recourse

    Jan 27, 2023Matthew Olckers, Toby WalshRejectionAlgorithmic Cores