cs.LGSep 30, 2026

Scalable Multi-Task Inverse Reinforcement Learning

Authors: Allen Tran, Jia Wan, Nathan Kallus, Aurélien Bibaut

Organizations: Netflix · Massachusetts Institute of Technology · Cornell Tech

Abstract

By learning transferable rewards, inverse reinforcement learning (IRL) enables counterfactual evaluation of agents under modified environments. Such transfer places strict requirements on coverage since target environments affect agents' state occupancy. We propose a multi-task IRL method that pools data across multiple agents with different rewards in the same environment under a low-rank assumption. In addition to alleviating coverage requirements, so each task need not visit every state as long as others do, the method offers scalable evaluation of multiple tasks under new environments as computationally intensive planning scales with rank rather than the number of tasks. We provide finite sample guarantees on reward recovery and on policy learning in new environments. Experiments show our method is robust to limited coverage, recovers rewards on and off of each task's support, transfers to target environments at lower regret than baselines, with its computational advantage over per-task methods widening as tasks grow.

Figures & tables

Appendix figures & tables7 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates

    May 10, 2026Anish Diwan, Davide Tateo, Christopher E. Mower +3Offline Reinforcement LearningReward Functions

  2. ConTraIRL: Factorized Contrastive Abstractions for Transferable IRL

    Jun 2, 2026Yikang Gui, Bikramjit Banerjee, Prashant DoshiOffline Reinforcement LearningContrastive Learning