Contextual Bandit Framework

Latest papers 57

All topics
CardsList
  1. Variance-Optimal Off-Policy Evaluation with Conjunct Effect Modeling

    Oct 6, 2026Nicolò Felicioni, Michael Benigni, Maurizio Ferrari Dacrema +1Contextual Bandit FrameworkOff-Policy Learning

  2. The Surrogate Is Not the Reward: Post-Surrogate Primary-Outcome Acquisition in Contextual Bandits

    Oct 5, 2026Kyungbok Lee, Michael R. KosorokContextual Bandit Framework

  3. Vanilla Policy Optimization Is Both Optimal and Differentially Private for Stochastic Contextual Bandits

    Sep 27, 2026Idan Attias, Orin Levy, Alexander Ryabchenko +2Contextual Bandit FrameworkEfficient Exploration

  4. Efficient Linear Bandits via Cluster-Aware Sketching

    Sep 23, 2026Hantao Yang, Hong Xie, Defu LianContextual Bandit Framework

  5. Nearly Minimax-Optimal Regret for Linear Contextual Bandits with Arbitrary Adaptive Action Sets

    Sep 14, 2026Tianyuan JinContextual Bandit FrameworkBandits

  6. When Greedy Sampling Explores: KL-Regularized Contextual Bandits without Eluder-Dimension Dependence

    Sep 11, 2026Zichen Wang, Haoyang Hong, Huazheng WangContextual Bandit FrameworkKullback-Leibler Regularization

  7. Meta-LinEXP3: Online-within-Online Learning for Adversarial Linear Contextual Bandits

    Sep 9, 2026Hao Li, Jie Xu, Zheng XieContextual Bandit FrameworkMeta-Learning

  8. Memory--Batch Tradeoffs in Lipschitz Bandits

    Aug 8, 2026Zicheng Lyu, Zengfeng HuangContextual Bandit FrameworkInformation-Theoretic Limits

  9. Progressive Content Refinement with Decaying Reward Joint LinUCB

    Aug 7, 2026Shion Ishikawa, Pablo Loyola, Young-joo Chung +1Contextual Bandit FrameworkLarge Language Model Reinforcement Learning

  10. Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

    Jul 24, 2026Yuta Natsubori, Masataka Ushiku, Yuta SaitoContextual Bandit FrameworkOff-Policy Learning

  11. A Predict-then-Correct Loop Based on Few-Shot Continuous Contextual Bandit for Demand Forecasting

    Jul 17, 2026Zhiwei Lei, Benedict Jun Ma, Ilya JacksonContextual Bandit FrameworkLoop

  12. Kernel weighted importance sampling for off-policy evaluation in contextual bandits

    Jul 16, 2026Joshua Spear, Matthieu Komorowski, Rebecca Pope +2Contextual Bandit FrameworkImportance Weighting

  13. Correlation-Aware Contextual Bandits with Surrogate Rewards for LLM Routing

    Jul 10, 2026Ajay Narayanan Sridhar, Ronak Singh, Mehrdad Mahdavi +1Contextual Bandit FrameworkLarge Language Model Routing

  14. Dynamic Regret for Non-Stationary Linear Bandits via Misspecification Reductions

    Jul 3, 2026Zihao Hu, Yuan Yao, Jiheng Zhang +1Contextual Bandit FrameworkRegret

  15. Contextual Slate GLM Bandits with Limited Adaptivity

    Jun 30, 2026Tanmay Goyal, Sukruta Prakash Midigeshi, Gaurav SinhaContextual Bandit FrameworkGeneralized Linear Model

  16. Graph Dimensionality Reduction for Contextual Bandits: Structure-Specific Regret Bounds under Approximate Smoothness and Noisy Eigenspaces

    Jun 26, 2026Joyanta Jyoti Mondal, Ibne Farabi Shihab, Anuj SharmaContextual Bandit FrameworkDimensionality Reduction

  17. Counterfactual learning of new adaptive instructional policies using logged data

    Jun 22, 2026Samuel Girard, Sein Minn, Amel Bouzeghoub +1Contextual Bandit FrameworkCounterfactual Learning

  18. Statistical Inference for Misspecified Contextual Bandits

    Jun 21, 2026Yongyi Guo, Ziping XuContextual Bandit FrameworkStatistical Inference

  19. AdaPrivate-TS: Private Thompson Sampling for Contextual Bandits with Privacy Amplification

    Jun 19, 2026Mohammadreza Riyazat, Eranga UkwattaContextual Bandit FrameworkThompson Sampling

  20. Stochastic Linear Contextual Bandits with Bounded Noise: A Set-Membership Approach

    Jun 18, 2026Haonan Xu, Yingying LiContextual Bandit FrameworkOptimal Regret

  21. Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification

    Jun 4, 2026Haoyang Hong, Zichen Wang, Quanquan Gu +1Contextual Bandit FrameworkRegularization

  22. Offline-to-Online Learning in Linear Bandits

    Jun 3, 2026Kushagra Chandak, Toshinori Kitamura, Xiaoqi TanContextual Bandit Framework

  23. Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback

    May 31, 2026Wyame Benslimane, Tinghan Ye, Pascal Van Hentenryck +1Contextual Bandit FrameworkOn-Policy

  24. Practical and Optimal Algorithm for Linear Contextual Bandits with Rare Parameter Updates

    May 31, 2026Sanghoon Yu, Min-hwan OhContextual Bandit FrameworkRare Events

  25. Variance-sensitive Thompson sampling for generalised linear bandits, revisited

    May 29, 2026Tom Perneczky, Marc Abeille, David JanzThompson SamplingVariance Reduction

  26. The Sample Complexity of Multiclass and Sparse Contextual Bandits

    May 28, 2026Liad Erez, Fan Chen, Alon Cohen +4Contextual Bandit FrameworkOptimal Sample Complexity

  27. Linear and Neural Dueling Bandits with Delayed Feedback

    May 26, 2026Xiangyi Wang, Pingchen Lu, Jie Mao +4Contextual Bandit FrameworkBandits

  28. Active Learning for Stochastic Contextual Linear Bandits

    May 24, 2026Emma Brunskill, Ishani Karmarkar, Zhaoqi LiContextual Bandit FrameworkActive Learning

  29. Catching a Moving Subspace: Low-Rank Bandits Beyond Stationarity

    May 18, 2026Hamed Khosravi, Xiaoming HuoContextual Bandit FrameworkBandits

  30. Offline Contextual Bandits in the Presence of New Actions

    May 18, 2026Ren Kishimoto, Tatsuhiro Shimizu, Kazuki Kawamura +6Contextual Bandit FrameworkOff-Policy Learning

  31. Harnessing Unimodality in Semiparametric Contextual Pricing via Oracle Price Map Learning

    May 14, 2026Yingying Fan, Yuxuan Han, Jinchi Lv +2Dynamic PricingContextual Bandit Framework

  32. Contextual Bandits for Resource-Constrained Devices using Probabilistic Learning

    May 13, 2026Marco Angioli, Kevin Johansson, Antonello Rosato +2Contextual Bandit FrameworkResource-Constrained Edge Devices

  33. Signature Approach for Contextual Bandits with Nonlinear and Path-dependent Rewards

    May 11, 2026Xin Guo, Grace He, Xinyu LiContextual Bandit FrameworkBandits

  34. Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability

    May 9, 2026Qingyue Zhao, Kaixuan Ji, Heyang Zhao +1Kullback-Leibler RegularizationContextual Bandit Framework

  35. Ensemble Distributionally Robust Bayesian Optimisation with Continuous Context

    May 8, 2026Tigran Ramazyan, Denis DerkachDistributionally-Robust OptimizationBayesian Optimization

  36. Constrained Contextual Bandits with Adversarial Contexts

    May 7, 2026Dhruv Sarkar, Abhishek SinhaContextual Bandit FrameworkToken Budget Allocation

  37. Instance-Level Costs for Nuanced Classifier Evaluation

    May 4, 2026Kabir Kang, Stephen MussmannClassifierEvaluation Metrics

  38. Scaling Federated Linear Contextual Bandits via Sketching

    May 1, 2026Hantao Yang, Hong Xie, Xutong Liu +1Contextual Bandit FrameworkFederated Learning

  39. Direction-Aware Offline-to-Online Learning in Linear Contextual Bandits

    Apr 27, 2026Zean Han, Ruihan Lin, Zezhen Ding +1Contextual Bandit FrameworkBandits

  40. Logistic Bandits with O~(dT)\tilde{O}(\sqrt{dT}) Regret without Context Diversity Assumptions

    Apr 24, 2026Seoungbin Bae, Dabeen Lee\Widetilde{\Mathcal{O}}(\Sqrt{T})$ RegretContextual Bandit Framework

  41. Learning When to Trust in Contextual Social Bandits

    Mar 9, 2026Majid Ghasemi, Mark CrowleyContextual Bandit FrameworkAI Trustworthiness

  42. Learning Peer Influence Probabilities with Linear Contextual Bandits

    Oct 21, 2025Ahmed Sayeed Faruk, Mohammad Shahverdikondori, Elena ZhelevaContextual Bandit FrameworkInfluence Function

  43. Best-of-Both Worlds for linear contextual bandits with paid observations

    Oct 8, 2025Nathan Boyer, Dorian Baudry, Patrick RebeschiniContextual Bandit FrameworkOptimistic Follow-The-Regularized-Leader

  44. Primal-dual algorithm for contextual stochastic combinatorial optimization

    May 7, 2025Louis Bouvier, Thibault Prunet, Vincent Leclère +1Stochastic OptimizationNeural Combinatorial Optimization