Policy Distillation

Latest papers 27

All topics
CardsList
  1. Composing What Each Teacher Learned: Multi-Teacher On-Policy Distillation through Teacher-Relative Shifts

    Oct 7, 2026Hejian Sang, Zhengze Zhou, Shayan Mohajer Hamidi +3Multi-Teacher Knowledge DistillationOn-Policy Distillation

  2. iGPC: Generative Motion Priors for Object-Aware Humanoid Interaction

    Oct 6, 2026Anujith Muraleedharan, Abdul Ahad Butt, Nolan Fey +5Contact-Rich Robotic ManipulationHumanoid Robot Control

  3. Interpolated Policy Distillation: A Controllable Continuum Between Off-Policy and On-Policy Distillation

    Sep 29, 2026Youxu Shi, Yifan Sun, Dacheng Yin +5Language Model DistillationOn-Policy Distillation

  4. Distilling Privileged Control Barrier Functions into RGB-Only Safety Filters for Dynamic Visual Navigation

    Sep 29, 2026Seungyeon Yoo, Gawon Lee, Seungwoo Jung +2Control Barrier FunctionsRobotics

  5. Inductive Feedback for Mixed-Policy Distillation

    Sep 28, 2026Amir Moeini, Huaijiang Zhu, Daniel Havir +1Language Model DistillationOn-Policy Distillation

  6. Beyond Token Alignment: Event Completion for Cross-Tokenizer On-Policy Distillation

    Sep 28, 2026Jiacheng Liu, Jingwei Song, Qituan Zhang +2Cross-Tokenizer Knowledge DistillationOn-Policy Distillation

  7. Experience Funnel: A State-Policy Alternating Loop for Self-Evolving Agents

    Sep 8, 2026Wenbo Gao, Zhaomou Song, Zhiyuan Ji +7Continual Learning for LLM AgentsAgent Skill Learning

  8. Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers

    Sep 1, 2026Giovanni Bonetta, Matteo Merler, Davide Zago +2Uncertainty SamplingVisual RL

  9. SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion

    Aug 27, 2026Pihai Sun, Gang Han, Jingkai Sun +17Humanoid Robot Locomotion3D Reconstruction

  10. When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

    Aug 6, 2026Xiaoqing Wu, Xingyu Fan, Feifei Li +1Tool-Use EvaluationLLM Tool Use

  11. DAPD: Dual-Anchored Policy Distillation

    Aug 3, 2026Jianyu Wu, Yizhou Wang, Encheng Su +2On-Policy Self-DistillationLanguage Model Distillation

  12. Explainable Reinforcement Learning via Physics-Aware Policy Distillation

    Jul 27, 2026Shaker Al-Tamari, Waled KadourRL ControlInterpretability in RL

  13. CoDiMAD: Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination

    Jul 10, 2026Jiyue Tao, Shunheng Xin, Tongsheng Shen +2Multi-Agent CoordinationMulti-Robot Coordination

  14. Trust Region Policy Distillation

    Jul 6, 2026Zhengpeng Xie, Li Lyna Zhang, Zeke Xie +1On-Policy DistillationPolicy Learning

  15. Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations

    Jul 3, 2026Van Huyen Dang, Kabilesh Rajendran, Erdi Sayar +1UAV NavigationVision-Language-Action Models

  16. Staged Hybridisation for Visual Quantum Reinforcement Learning via Knowledge Distillation

    Jun 29, 2026Javier Lazaro, Juan-Ignacio Vazquez, Pablo Garcia-BringasHybrid Quantum-Classical MLVariational Quantum Circuits

  17. UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation

    Jun 28, 2026Songjun Tu, Chengdong Xu, Qichao Zhang +6Credit Assignment in RLLLM Agent Skill Learning

  18. HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers

    Jun 4, 2026Lizhi Yang, Junheng Li, Nehar Poddar +5Humanoid Loco-ManipulationRobot Skill Learning

  19. Interpretable Policy Distillation for Power Grid Topology Control

    May 30, 2026Aleksandra Dmitruka, Karlis FreivaldsRL ControlReinforcement Learning

  20. GAPD: Gold-Action Policy Distillation for Agentic Reinforcement Learning in Knowledge Base Question Answering

    May 28, 2026Xin Sun, Jianan Xie, Zhongqi Chen +6Agentic RLKnowledge Graph Question Answering

  21. Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models

    May 14, 2026Senne Deproost, Denis Steckelmacher, Ann NowéReinforcement LearningVector Quantization

  22. Reasoning Compression with Mixed-Policy Distillation

    May 9, 2026Han Yang, Mingyan Wu, Bailan He +4Language Model DistillationEfficient Language Model Inference

  23. Hybrid Policy Distillation for LLMs

    Apr 22, 2026Wenhong Zhu, Ruobing Xie, Rui Wang +1Language Model DistillationOn-Policy Distillation