cs.LGSep 13, 2026

Learning Source Acquisition Policies by Offline Planning

Authors: Ziqi Zhao, Run Xu, Qingjian Ni

Abstract

Predicting under an acquisition budget requires choosing feature groups whose value can depend on later queries. O-MPAC transfers finite-horizon risk-cost targets from complete training records into a shared source-action scorer. At inference time, the scorer uses partial observations and source metadata, re-scores after each query, and applies a hard cost mask. We analyze how tied teacher targets and the remaining planning horizon affect the learned decisions. Uniform supervision over tied minima preserves the target distribution under source relabeling. In a five-seed routing experiment, it achieves 0.965 accuracy under both original and context-last orders. On six real tasks, validation selects H1 without action cross-entropy in all thirty splits. O-MPAC has the highest mean budget-integrated accuracy on five tasks against source-adapted GDFS, DIME, AACO+NN and a static policy.

Explore similar work

CardsList
  1. Budgeted Multi-Source Counterfactual Annotation for Off-Policy Evaluation

    Oct 7, 2026Biao Xiang, Ali Eshragh, Yuexing Li +1Off-Policy EvaluationCounterfactual Evaluation

  2. One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning

    Sep 1, 2026Xiaowei Sun, Jin Li, Yili Hong +2Cost-Aware InferenceConstrained RL