Off-Policy Evaluation

Momentum

8 papers in the last four weeks, up 167% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 46

All topics
CardsList
  1. Efficient Best-of-N policy evaluation for inference-time alignment

    Oct 7, 2026Jonas Schweisthal, Yuxin Wang, Athiya Deviyani +2Best-of-N SamplingOff-Policy Evaluation

  2. Variance-Optimal Off-Policy Evaluation with Conjunct Effect Modeling

    Oct 6, 2026Nicolò Felicioni, Michael Benigni, Maurizio Ferrari Dacrema +1Causal Effect EstimationOff-Policy Evaluation

  3. Evaluation of Active Feature Acquisition Policies with Tabular Foundation Models

    Oct 5, 2026Yuta Kobayashi, Divyam Madaan, Shalmali JoshiOff-Policy EvaluationValue Function Estimation

  4. Revealing After Overwriting: An Exponential POMDP OPE Lower Bound under History-Dependent Logging

    Oct 4, 2026Youyu Luo, Pengzhan Zhou, Zhida Qin +4Off-Policy EvaluationPartially Observable Markov Decision Processes

  5. OTROPE: Optimal Transport-based Robust Off-policy Evaluation for Large Language Models

    Sep 28, 2026Liner Xiang, Wenbo Zhang, Hengrui CaiLLM EvaluationOff-Policy Evaluation

  6. Recommendation Ranking Off-Policy Evaluation under Ranking-Dependent Examination via Examination-Relevance Decomposition

    Sep 28, 2026Riki Okamura, Toshiharu SugawaraOff-Policy EvaluationDoubly Robust Estimation

  7. Deep Weighted Bellman Residual Minimization for Q∗Q^* Estimation

    Sep 28, 2026Lican Kang, Jerry Zhijian Yang, Cheng Yuan +1Off-Policy EvaluationValue Function Estimation

  8. Optimal Sequential Annotations for Off-Policy Evaluation

    Sep 22, 2026Woojin Chae, Ezinne Nwankwo, Haitong Qin +1Off-Policy EvaluationLearning with Missing Data

  9. Model-based Bootstrap for Offline Policy Evaluation in Tabular Reinforcement Learning

    Sep 17, 2026Weiwei Wang, Yuqiang Li, Xianyi Wu +1Reinforcement LearningOff-Policy Evaluation

  10. Rank Without an Oracle: Deviation-Aware Interaction-Rank Selection from Offline Multi-Agent Logs

    Sep 8, 2026Xiangwu Wang, Chengwei Cao, Hongyuan TangOff-Policy EvaluationGame Theory

  11. On-Policy and Off-Policy Learning for Large Action Spaces

    Jul 30, 2026Imad AoualiThompson SamplingMulti-Armed Bandits

  12. Learning from the Unseen: Offline Reinforcement Learning with Hidden Actions

    Jul 28, 2026Zeyu Bian, Ying Zhou, Yifan CuiCausal Effect EstimationOff-Policy Evaluation

  13. Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

    Jul 24, 2026Yuta Natsubori, Masataka Ushiku, Yuta SaitoOff-Policy EvaluationContextual Bandits

  14. Kernel weighted importance sampling for off-policy evaluation in contextual bandits

    Jul 16, 2026Joshua Spear, Matthieu Komorowski, Rebecca Pope +2Off-Policy EvaluationImportance Sampling

  15. Fitted Occupancy-Ratio Evaluation without Bellman Completeness

    Jul 6, 2026Lars van der Laan, Nathan KallusOff-Policy EvaluationOffline RL

  16. Critical Interval MSE: Toward Reliable Offline Validation for Robot Manipulation Policies

    Jun 29, 2026Haoxu Huang, Tongsam Zheng, Yifan Chen +2Robot Policy LearningOff-Policy Evaluation

  17. Statistical Inference for Misspecified Contextual Bandits

    Jun 21, 2026Yongyi Guo, Ziping XuInverse Probability WeightingAdaptive Inference

  18. Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random

    Jun 18, 2026Ziheng Wei, Annie Qu, Rui MiaoReinforcement LearningOff-Policy Evaluation

  19. Off-Policy Evaluation with Strategic Agents via Local Disclosure

    Jun 5, 2026Kiet Q. H. Vo, Abbavaram Gowtham Reddy, Julian Rodemann +2Strategic ClassificationOff-Policy Evaluation

  20. Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents

    Jun 4, 2026Kaixuan Liu, Guojun Xiong, Weinan Zhang +1World Model LearningOff-Policy Evaluation

  21. X4Val: Learning Neural Surrogates for Variance-Reduced Policy Evaluation

    Jun 3, 2026Rachel Luo, Michael Watson, Apoorva Sharma +6Off-Policy EvaluationRobotic Policy Evaluation

  22. Bandit Simulation for Average Reward Inference

    May 30, 2026Samya Praharaj, Chih-Yu Chang, Koulik Khamaru +1Multi-Armed BanditsSimulation-Based Inference

  23. Certified Policy Optimisation for Nested Causal Bandits via PAC-Bayes Risk

    May 28, 2026Tim Woydt, Paul-David ZuercherPAC-Bayesian Generalization BoundsMulti-Armed Bandits

  24. Quotient DAGs for Off-Policy Evaluation:Forward-Flow Importance Sampling and Exact Slate Propensities

    May 28, 2026Ziwen Xie, Shaowen Xiang, Hongyu He +1Off-Policy EvaluationImportance Sampling

  25. Insurance Pricing Optimization via Off-Policy Evaluation

    May 27, 2026Sascha Günther, Dimitri Semenovich, Mario V. WüthrichOff-Policy EvaluationPolicy Optimization

  26. Support-aware offline policy selection for advertising marketplaces

    May 20, 2026Prashant Shekhar, Caroline HowardOff-Policy EvaluationOnline Advertising