Bandits

Momentum

9 papers in the last four weeks, up 50% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 100

All topics
CardsList
  1. Reserve-Aware Contrast Certificates for Conservative Bandits with Uncertain Baselines

    Sep 30, 2026Qinchuan ChengBanditsConservative

  2. Bandits with Multiple Optimal Arms: Minimax Regret and Non-Adaptivity

    Sep 29, 2026Kaixuan Ji, Qiwei Di, Qingyue Zhao +2Stochastic Multi-Armed BanditsBandits

  3. Challenges and Solutions for Bandits in the Wild: Warm-Started Mixture Bandits for Cross-Cohort Slate Recommendation

    Sep 29, 2026Serafima Lebedeva, Sumantrak Mukherjee, Ali Arshad Sadal +8RecommendationBandits

  4. Future Information-Directed Sampling for Bayesian Nonstationary Bandits

    Sep 27, 2026Yichen Song, Alessio Russo, Aldo PacchianoBanditsStochastic Exploration

  5. Nearly Minimax-Optimal Regret for Linear Contextual Bandits with Arbitrary Adaptive Action Sets

    Sep 14, 2026Tianyuan JinContextual Bandit FrameworkBandits

  6. ALIGN-HOLD: Experience Alignment for Real-Time Hold Control in Large-Scale Ride-Hailing Matching at DiDi

    Sep 9, 2026Zuhao Zhang, Xu Liu, Kai Wan +3Bike-Sharing SystemsValue Alignment

  7. Bandits in Prod: Hyperparameter Optimization at Inference Time

    Sep 1, 2026Louis Abraham, Tuan-Anh Nguyen, Nicolas DevatineGeneral Grid Search FrameworkAgentic Optimization

  8. Designing for the Next Click: Bandits for Real-Time Page Layout

    Aug 30, 2026Bhavtosh Rath, Harshith Narasimhamurthy, Bob Eisinger +3LayoutsBandits

  9. From Relaxed Indexability to Exact Indexability: A tt-Step Approach for Partially Observable Restless Bandits

    Aug 25, 2026Qizhen Jia, Keqin LiuStochastic Multi-Armed BanditsOptimal Policies

  10. DCM Bandits: Multiplayer Information Asymmetric Cascading Bandits for Multiple Clicks

    Aug 12, 2026Andy Wang, Charlton Shih, William ChangBanditsInformation Asymmetry

  11. Robust Multi-Agent Bandits with Heavy-Tailed Rewards and Information Asymmetry

    Aug 11, 2026Daphne Feng, Ricardo Parada, Lily Jiang +2Stochastic Multi-Armed BanditsMulti-Agent Reinforcement Learning

  12. Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation

    Aug 5, 2026Bo Xue, Zhi Hong, Jiayi Li +3Cost-AwareLarge Language Model Evaluation

  13. Efficient Online Lexicographic Generalized Low-Rank Matrix Bandits

    Aug 5, 2026Bo Xue, Ji Cheng, Haodong Jing +2BanditsSubspace

  14. Parameter-Free Heavy-Tailed Bandits

    Jul 31, 2026Gianmarco Genalti, Alberto Maria MetelliLong-Tailed DistributionBandits

  15. The Greedy Advantage in Finite-Horizon Bandits

    Jul 31, 2026Kai Zhou, Michael Lingzhi Li, Kai WangStochastic Multi-Armed BanditsInterval Regret

  16. RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems

    Jul 31, 2026Haoran Ling, Yuecheng Li, Zeyu Song +5Prompt OptimizationBandits

  17. Outcome-Fair Restless Multi-Armed Bandits for Stochastic Deadline Scheduling

    Jul 26, 2026Shakti Sharma, Rahul MeshramStochastic Multi-Armed BanditsAlgorithmic Fairness

  18. Breaking the Total Variance Barrier: Sharp Sample Complexity for Linear Heteroscedastic Bandits with Fixed Action Set

    Jul 26, 2026Heyang Zhao, Tianyuan Jin, Weixin Wang +3Stochastic Multi-Armed BanditsVariance Reduction

  19. Periodic Bootstrap Thompson Sampling For Periodically Non-Stationary Bandit Problems

    Jul 18, 2026Boning ShaoThompson SamplingBandits

  20. Price of Fairness in Bandits: A Tight Minimax Characterization

    Jul 15, 2026Dhruv Sarkar, Soumyadeep Dutta, Sayak Ray ChowdhuryBanditsMinimax

  21. Diversified Multinomial Logit Contextual Bandits

    Jul 13, 2026Heesang Ann, Taehyun Hwang, Min-hwan OhAssortmentStochastic Multi-Armed Bandits

  22. Learning from Local Walks on Dynamic Graphs with Bandit Feedback

    Jul 12, 2026Sourav Chakraborty, Amit Kiran Rege, Claire Monteleoni +1Stochastic Multi-Armed BanditsBandits

  23. Optimal Top-kk Identification from Pairwise Comparisons

    Jul 9, 2026Motti Goldberger, Nils RudiTop-KActive Learning

  24. Balancing Expressivity and Learnability in Quantum Kernel Bandit Optimization

    Jul 1, 2026Yuqi Huang, Vincent Y. F. Tan, Sharu Theresa JoseQuantum KernelsVariational Quantum Algorithms

  25. Distributed Online Bandit Submodular Maximization with Bounded Sampling Violations

    Jul 1, 2026Bin Du, Chang Liu, Dingqi Zhu +2Submodular FunctionsBandits

  26. Learning to Bid in Discriminatory Auctions with Budget Constraints

    Jun 28, 2026Negin Golrezaei, Sourav SahooFirst-Price AuctionsBidding

  27. A Linear Matching Bandit Approach to Online Multi-Human Multi-Robot Teaming

    Jun 28, 2026Yaohui Guo, X. Jessie Yang, Cong ShiDistribution MatchingMulti-Robot Systems

  28. Analysis of Parameter Settings for the Bat Algorithm Using Variance Evolution

    Jun 26, 2026Xin-She Yang, Mehmet KaramanogluEvolutionary OptimizationGenetic Algorithms

  29. Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries

    Jun 25, 2026Prarabdh Shukla, Ritik, Suhas Rao +2Jailbreak AttacksMalicious Agents

  30. Capacity-Constrained Online Convex Optimization with Delayed Feedback

    Jun 10, 2026Alexander Ryabchenko, Idan Attias, Daniel M. Roy\Widetilde{\Mathcal{O}}(\Sqrt{T})$ RegretNonconvex

  31. Bandits for Efficient Experimentation: Adapting to Control Group, Preferences, and Context Drifts

    Jun 8, 2026Udvas Das, Waris Radji, Debabrota Basu +1BanditsPreference Alignment Learning

  32. Constrained user-item allocation for e-commerce marketing campaigns

    Jun 8, 2026Maja Lindström, Natalija Glisovic, Jan von Pichowski +2Sales LeadUser Modeling

  33. Cutting LLM Evaluation Costs with SySRs: A Bandit Algorithm that Provably Exploits Model Similarity

    Jun 5, 2026Zifan Lyu, Chahine Nejma, Tobias Wegel +2Similarity and MetricsBandits

  34. Adaptive Learning Rates with Surrogate Probability for Follow-the-Perturbed-Leader

    Jun 4, 2026Jongyeong Lee, Junya Honda, Shinji Ito +1Learning-Augmented AlgorithmsOptimistic Follow-The-Regularized-Leader

  35. Mean-based algorithms: A lower bound and regret

    Jun 3, 2026Julius Durmann, Amelie KleberBanditsNash Equilibrium

  36. Fairness in two-player zero-sum games with bandit feedback

    May 31, 2026S Akash, Pratik GajaneImperfect-Information GamesBandits

  37. Bandit Simulation for Average Reward Inference

    May 30, 2026Samya Praharaj, Chih-Yu Chang, Koulik Khamaru +1BanditsConfidence Intervals

  38. CUPID in the Model Zoo: Online Matchmaking for Selecting Your Dream LLM

    May 30, 2026Son Nguyen, Xinyuan Liu, Ransalu SenanayakeLarge Language Model AlignmentBandits

  39. Compute Allocation in Evolutionary Search: From Depth-Breadth to Multi-Armed Bandits

    May 28, 2026Sixue Xing, Haoyu He, Kerui Wu +4Evolutionary SearchBandits

  40. Adaptive Bandit Algorithms for Contextual Matching Markets

    May 27, 2026Shiyun Lin, Simon Mauras, Vianney Perchet +1Stochastic Multi-Armed BanditsBandits

  41. Learning to Orchestrate Agents under Uncertainty

    May 26, 2026Mary Chriselda Antony Oliver, Lan Jiang, Aaron Bundi Anampiu +3Multi-Agent OrchestrationOrchestration

  42. Near-Optimal Regret in Adversarial Kernel Bandits

    May 26, 2026Yu-Jie Zhang, Hao Qiu, Jonathan Scarlett +1\Widetilde{\Mathcal{O}}(\Sqrt{T})$ RegretMinimax Rate

  43. Linear and Neural Dueling Bandits with Delayed Feedback

    May 26, 2026Xiangyi Wang, Pingchen Lu, Jie Mao +4Contextual Bandit FrameworkBandits

  44. Online Learning on Hidden-Convex Losses via Algorithmic Equivalence: Optimal Regret, Geometric Barrier, and Bandit Feedback

    May 25, 2026Anas Barakat, Andreas Kontogiannis, Vasilis Pollatos +2Convex Loss\Widetilde{\Mathcal{O}}(\Sqrt{T})$ Regret

  45. PAC Learning with Bandit Feedback: Sharp Sample Complexity in the Realizable Setting

    May 25, 2026Steve Hanneke, Qinglin Meng, Shay Moran +1Sample ComplexityBandits

  46. Prudent-Banker: No Extra Fees for Baseline Safety in Adversarial Bandits With and Without Delays

    May 22, 2026Ting Hu, Luanda Cai, Emmanouil-Vasileios Vlatakis-GkaragkounisBanditsBounded Adversary

  47. Pure Exploration for a Good Policy in Reinforcement Learning with Bandit Feedback

    May 22, 2026Zitian Li, Wang Chi CheungBanditsOptimality

  48. Bandit Convex Optimization with Gradient Prediction Adaptivity

    May 21, 2026Shuche Wang, Adarsh Barik, Vincent Y. F. TanConvex LossConvex Optimization

  49. Spectral bandits for smooth graph functions with applications in recommender systems

    May 19, 2026Tomáš Kocák, Michal Valko, Rémi Munos +2Real-World Content Recommendation ProblemBandits

  50. Catching a Moving Subspace: Low-Rank Bandits Beyond Stationarity

    May 18, 2026Hamed Khosravi, Xiaoming HuoContextual Bandit FrameworkBandits