Policy Evaluation

Momentum

7 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 6Week of Sep 21

Latest papers 43

All topics
CardsList
  1. ARCCS: An Automated Regulatory Compliance Checking System

    Oct 1, 2026Giorgos Filandrianos, José Menezes, Chrysoula Zerva +1ComplianceRegulation

  2. ChunkTrust: Adapting Execution Horizons for Robot Policies with Action-Expert Evidence

    Sep 30, 2026Fanding Huang, Jingyan Jiang, Shifeng Bao +13Robot PoliciesAction Chunks

  3. Graph World Models for Constrained Epidemic Policy Planning

    Sep 28, 2026Yiqi Su, Rashed Shelim, Lingyi Wang +2Epidemiological ModelsWorld Model Planning

  4. Recommendation Ranking Off-Policy Evaluation under Ranking-Dependent Examination via Examination-Relevance Decomposition

    Sep 28, 2026Riki Okamura, Toshiharu SugawaraPolicy EvaluationRanking

  5. Limiting-Kernel Q(λλ): Bridging Short and Long Horizons

    Sep 23, 2026Tolga Ok, Arman Sharifi Kolarijani, Peyman Mohajerin Esfahani +1Off-Policy LearningPolicy Evaluation

  6. Optimal Sequential Annotations for Off-Policy Evaluation

    Sep 22, 2026Woojin Chae, Ezinne Nwankwo, Haitong Qin +1Off-Policy LearningPolicy Evaluation

  7. No Free Checker: A Survey of Verifiers for Robot Policies

    Sep 10, 2026Yang Wan, Xihang Yue, Zhirui Liu +7Verification FrameworkPolicy Evaluation

  8. GPS-Bench: A Governance Policy Benchmark for Automating Policy Analysis

    Sep 3, 2026Linh Le, Melanie Bui, My Chiffon Nguyen +2Policy EvaluationMulti-Agent Simulations

  9. Towards a Belief-Based World Model for LLM Agents

    Aug 31, 2026Shubham Kumar, Harshit Kumar, Narendra Ahuja +1Latent World ModelsLarge Language Model Agents

  10. The Policy Deficit in AI x Social-Emotional Learning Research

    Aug 30, 2026Tran Van Cuong, Liu Yihan, Nguyen Van TuongArtificial Intelligence ResearchPolicy Evaluation

  11. An Instrument to Evaluate Governance Proposals: AI Policy Analysis at Scale

    Jul 30, 2026Paulo Carvao, Claudio Mayrink Verdun, Isabel Adler +1Artificial Intelligence GovernanceEu Artificial Intelligence Act

  12. CoRenew: A large language model agent-based policy simulation platform for multifamily residential redevelopment

    Jul 28, 2026Yudi Zhang, Yuming Lin, Li Tian +2Multi-Agent SimulationsNegotiation

  13. Online Policy Evaluation for MDPs with Dynamic UBSR Measures

    Jul 25, 2026Weikai Wang, Erick DelageConditional-Value-At-RiskMarkov Decision Processes

  14. MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents

    Jul 21, 2026Guofeng Zhang, Yizeng Quan, Huaiyi Fang +6Policy Evaluation

  15. A Formally Grounded ODRL Evaluator: Implementation and Comparison

    Jul 17, 2026Jaime Osvaldo Salas, Paolo Pareti, Adeel Aslam +2Policy EvaluationMulti-Dimensional Evaluation

  16. Discourse-Aware Policy Analysis with Argumentation: A Hybrid LLM-Symbolic Framework for Disaster Governance

    Jul 14, 2026Stylianos Loukas Vasileiou, Olga DerendiaevaArgumentation FrameworksDiscourse

  17. Active Offline-to-Online Reinforcement Learning

    Jul 13, 2026Alper Kamil Bozkurt, Shangtong Zhang, Yuichi MotaiOffline Reinforcement LearningPolicy Evaluation

  18. Trustworthy synthetic data for campaign decision support: strategy simulation fidelity and the PolicySynth framework

    Jul 13, 2026Tung Dang, The Hung Phung, Son Lam Nguyen +1Synthetic DataSoftware Engineering Decision Support

  19. GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

    Jul 2, 2026GigaWorld Team, Angyuan Ma, Boyuan Wang +24Robot PoliciesWorld Models

  20. Critical Interval MSE: Toward Reliable Offline Validation for Robot Manipulation Policies

    Jun 29, 2026Haoxu Huang, Tongsam Zheng, Yifan Chen +2Robot PoliciesPolicy Evaluation

  21. What Does ODRL Mean? A Cross-Level Ontological Grounding of Permissions, Prohibitions, and Duties in UFO-L

    Jun 23, 2026Daham M. Mustafa, Christoph Lange, Giancarlo Guizzardi +3Social NormsPolicy Evaluation

  22. Fed-CausalDiff: Decoupled Synchronization for Federated Do-Simulation and Policy Evaluation

    Jun 21, 2026Pengfei Li, Mohammad KhalilFederated LearningPolicy Evaluation

  23. SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

    Jun 17, 2026Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong +9Video World ModelsAutoregressive Rollout

  24. How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric Position

    Jun 13, 2026Yang Yu, Shiyuan Zhang, Yifei Sheng +2World ModelsEmbodied Artificial Intelligence

  25. Policy-driven Conformal Prediction for Trustworthy QoT Estimation

    Jun 10, 2026Kiarash Rezaei, Omran Ayoub, Paolo Monti +1Online Conformal PredictionConformal Selection

  26. Quotient DAGs for Off-Policy Evaluation:Forward-Flow Importance Sampling and Exact Slate Propensities

    May 28, 2026Ziwen Xie, Shaowen Xiang, Hongyu He +1Policy EvaluationImportance

  27. SL-BiLEM: Structured Learnable Behavior-in-the-Loop Epidemic Modeling for Forecasting and Policy Evaluation

    May 26, 2026Haochun Wang, Sendong Zhao, Jingbo Wang +3Epidemiological ModelsPolicy Evaluation

  28. Support-aware offline policy selection for advertising marketplaces

    May 20, 2026Prashant Shekhar, Caroline HowardPolicy EvaluationOff-Policy Learning

  29. Decision Support for Marketplace Policies under Incomplete Evidence: From Replay to Launch Readiness

    May 13, 2026Prashant Shekhar, Caroline HowardPolicy EvaluationSoftware Engineering Decision Support

  30. Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation

    May 12, 2026Hao Wang, Joshua Bowden, Colton Crosby +1Robot PoliciesPolicy Evaluation

  31. Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning

    May 8, 2026Zixuan Xie, Xinyu Liu, Claire Chen +3In-Context LearningLinear Attention

  32. Bridging the Gap Between Average and Discounted TD Learning

    May 3, 2026Haoxing Tian, Zaiwei Chen, Ioannis Ch. Paschalidis +1Temporal DifferenceBellman Equation

  33. Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs

    May 2, 2026Ruiquan Huang, Donghao Li, Yingbin Liang +1Soft Actor-CriticMarkov Decision Processes

  34. Robustness of Refugee-Matching Gains to Off-Policy Evaluation Choices

    Apr 25, 2026Kirk Bansak, Elisabeth Paulson, Dominik Rothenhäusler +3Distribution MatchingHeterogeneous Treatment Effects

  35. Neurosymbolic Characterization for Reliable Access Control Policy Analysis

    Oct 23, 2025Adarsh Vatsa, Bethel Hall, William EiersAccess ControlPolicy Evaluation

  36. PERRY: Policy Evaluation with Confidence Intervals using Auxiliary Data

    Jul 26, 2025Aishwarya Mandyam, Jason Meng, Ge Gao +4Policy EvaluationConfidence Intervals

  37. Statistical Inference for Policy Evaluation with Temporal Difference Learning

    Oct 21, 2024Weichen Wu, Gen Li, Yuting Wei +1Temporal DifferenceValue Functions