Efficient On-Policy Distillation

Latest papers 77

All topics
CardsList
  1. Are Full Rollouts Necessary for On-Policy Distillation?

    May 29, 2026Yaocheng Zhang, Jiajun Chai, Yuqian Fu +7Efficient On-Policy DistillationParallel Rollouts

  2. Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models

    May 28, 2026Zizhuo Lin, Quanling Liu, Jinsheng Quan +6Efficient On-Policy DistillationMath Problems

  3. GAPD: Gold-Action Policy Distillation for Agentic Reinforcement Learning in Knowledge Base Question Answering

    May 28, 2026Xin Sun, Jianan Xie, Zhongqi Chen +6Agentic Reinforcement LearningEfficient On-Policy Distillation

  4. ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation

    May 27, 2026Kun Liang, Chenming Tang, Clive Bai +3Efficient On-Policy DistillationAutoregressive Rollout

  5. Less is More: Early Stopping Rollout for On-Policy Distillation

    May 26, 2026Zhou Ziheng, Jiaqi Li, Huacong Tang +2Efficient On-Policy DistillationRollout

  6. Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation

    May 26, 2026Yuanyi Wang, Su Lu, Yanggan Gu +6Efficient On-Policy DistillationToken-Level Supervision

  7. Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

    May 18, 2026Qianhao Yuan, Jie Lou, Xing Yu +4Recent Vision-Language ModelsMultimodal Large Language Models

  8. Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation

    May 13, 2026Kaiyuan Liu, Ziyuan Zhuang, Yang Bai +3Efficient On-Policy DistillationFeedback

  9. Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning

    May 8, 2026Zhicheng Yang, Zhijiang Guo, Yifan Song +5Efficient On-Policy DistillationUni-Opd

  10. Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

    May 7, 2026Nan Jia, Haojin Yang, Xing Ma +6Efficient On-Policy DistillationPolicy Gradient

  11. Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

    Apr 30, 2026Sudong Wang, Weiquan Huang, Xiaomin Yu +9Multimodal ReasoningEfficient On-Policy Distillation

  12. TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents

    Apr 27, 2026Jiaqi Wang, Wenhao Zhang, Weijie Shi +2Efficient On-Policy DistillationCurriculum

  13. DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation

    Date pendingYuchen Xia, Qianguo Sun, Chao Song +3Efficient On-Policy DistillationUni-Opd