Efficient On-Policy Distillation

Latest papers 77

All topics
CardsList
  1. ReTaCo: Residual-Target Control for On-Policy Distillation

    Sep 30, 2026Zixiang Ni, Zhuo Hu, Renjie Cao +8Efficient On-Policy DistillationOn-Policy

  2. On the Off-Policy Teacher in On-Policy Distillation

    Sep 29, 2026Langlin Huang, Hao Liu, Mononito Goswami +5Efficient On-Policy DistillationTeacher

  3. Dr. OPD: Learning What to Follow for Optimal On-Policy Distillation of Large Language Models

    Sep 29, 2026Zhenyu Wang, Tianze Wang, Linjun Zhang +1Efficient On-Policy DistillationMean

  4. Solving Without Stopping: On-Policy Distillation at Small Scale

    Sep 29, 2026Hongyang Li, Yiming Zhu, Xiao Li +3Efficient On-Policy DistillationTeacher

  5. Interactive-Policy Distillation with Bidirectional Propose-and-Verify

    Sep 29, 2026Shutong Wu, Xiwen Chen, Brendan Rappazzo +4Efficient On-Policy DistillationTeacher

  6. Teacher-Student Gaps Are Not Enough: Outcome-Guided On-Policy Distillation for Multi-Turn Autonomous Agents

    Sep 28, 2026Tong Zhang, Zhou Liu, Yihao Liu +8Efficient On-Policy DistillationTeacher

  7. Understanding On-Policy Distillation: A Mechanistic Interpretability Perspective via Sparse Crosscoders

    Sep 28, 2026Zichao Yu, Qianshuo Ye, Xu Wang +1Efficient On-Policy DistillationOnline-Policy Distillation

  8. DivOPD: Spread Wide, Look Close for Asynchronous On-Policy Distillation of Multi-turn Agents

    Sep 28, 2026Hanyang Wang, Zeyuan Liu, Zhengyu Chen +7Efficient On-Policy Distillation

  9. Unbiased Top-kk Estimation for On-Policy Distillation

    Sep 28, 2026Linjian Meng, Siyuan Gan, YuHan Li +5Efficient On-Policy DistillationKullback-Leibler Divergence

  10. USA: Update-aware SAM for Cross-domain On-Policy Disitllation of Language Agents

    Sep 28, 2026Qiyong Zhong, Mao Zheng, Mingyang Song +6Efficient On-Policy DistillationAgentic Reasoning

  11. UOPD: Uncertainty-Aware Intervention for On-Policy Distillation of Multi-Turn Agents

    Sep 27, 2026Wenbo Zhang, Pengcheng Xu, Weizhi Du +2Efficient On-Policy DistillationRp-Opsd

  12. ChemOPD: Multi-Teacher On-Policy Distillation for Multi-Task Chemical Reasoning

    Sep 27, 2026Yaoyao Xu, Xinjian Zhao, Xiaozhuang Song +2Efficient On-Policy DistillationChemical Structures

  13. Dense Is Not Enough: Hierarchical Supervision Allocation for Long-Horizon On-Policy Distillation

    Sep 27, 2026Yuhao Sun, Binrui Wu, Zhuoer Xu +5Efficient On-Policy DistillationTeacher

  14. Hesitation-Aware On-Policy Distillation for Diffusion Language Models

    Sep 27, 2026Jianguo Huang, Lipeng Wan, Yanchen Deng +1Efficient On-Policy DistillationDiffusion Language Models

  15. Teach Yourself Where to Look: On-Policy Attention Self-Distillation for Reasoning

    Sep 27, 2026Safaeid Hossain Arib, Rabeya Akter, Ismam Nur Swapnil +3Unsupervised On-Policy Self-DistillationEfficient On-Policy Distillation

  16. TS-OPD: Reconciling ASR and QA in Speech Language Models via Task-Specific On-Policy Distillation

    Sep 24, 2026Yujie Guo, Hongjie Chen, Jian Kang +3Speech Language ModelsAutomatic Speech Recognition

  17. Not Every Token Is Worth Distilling: Selective Supervision for Direct-OPD

    Sep 24, 2026Yibo Zhao, Zixuan Yang, Yunshi Lan +1Efficient On-Policy DistillationProcess-Level Supervision

  18. Tool-Augmented On-Policy Distillation for LLM Domain Adaptation in Sequence-Based Omics Tasks

    Sep 20, 2026Jie Ying, Zhefan Wang, Zihong Chen +11Multi-Omic IntegrationReasoning Benchmark

  19. Reducing the Output-Mode Gap in Speech Language Models via Joint-Output On-Policy Distillation

    Sep 14, 2026Daxin Tan, Dehua Tao, Chengxi Deng +2Speech Language ModelsAutoregressive Generation

  20. KuaiRP Series Role-playing Models Technical Report

    Sep 12, 2026Yipeng Wang, Ziwei Zhang, Jiahui Zhang +2Role-Playing AgentsMixture-Of-Agents

  21. Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation

    Sep 8, 2026Youngrok Park, Sangmin Bae, Hojung Jung +6Efficient On-Policy DistillationPost-Training

  22. Rethinking On-Policy Distillation of Large Language Models II: One Training Example

    Sep 3, 2026Zixuan Fu, Bingxiang He, Yuxin Zuo +10Efficient On-Policy DistillationEfficient Large Language Model

  23. WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training

    Aug 10, 2026Zehao Chen, Gongxun Li, Tianxiang Ai +9Efficient On-Policy DistillationUni-Opd

  24. Coupled Graph--Policy Distillation for Personalized Medication Safety in Older Adults with Multimorbidity

    Aug 10, 2026Zihan Wang, Anglin Liu, Rongyi Wang +6Medication LeafletMultimorbidity

  25. FlowErase-OPD: Multi-Concept Erasure via Anchored On-Policy Distillation in Flow Matching Models

    Aug 7, 2026Yi Sun, Yimin Zhou, Xinhao Zhong +3Concept ErasureText-To-Image Diffusion Models

  26. SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

    Aug 5, 2026Zikun Qu, Min Zhang, Mingze Kong +4Efficient On-Policy Distillation

  27. When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

    Aug 4, 2026Yinuo Jiang, Yongjie Ye, Zhou Tao +4Efficient On-Policy DistillationOnline-Policy Distillation

  28. Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation

    Aug 3, 2026Chishui Chen, Yaoyou Fan, Te Sun +11Efficient On-Policy DistillationTeacher

  29. Adaptive FastOPD: Progress-Aware Rollout Horizon Expansion for Efficient On-Policy Distillation

    Jul 31, 2026Qian Tan, Huaifei Liang, Xuanyu Zhu +2Efficient On-Policy DistillationAutoregressive Rollout

  30. Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

    Jul 29, 2026Hao Tan, Jun Lan, Zichang Tan +7Ai-Generated Image DetectionVisual Evidence

  31. Weak-to-Strong On-Policy Distillation

    Jul 28, 2026Fangxu Yu, Weijia Xu, Michael Xu +2Efficient On-Policy Distillation

  32. SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

    Jul 22, 2026Xinyu Zhang, Zishuo Wang, Ling XiaoVision-Language NavigationRobot Navigation

  33. SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

    Jul 16, 2026Jinyang Wu, Shuo Yang, Zhengxi Lu +8Agentic Reinforcement LearningUnsupervised On-Policy Self-Distillation

  34. EasyOPD: An Easy-to-use On-Policy Distillation Framework for Large Language Models

    Jul 13, 2026Jie Sun, Mao Zheng, Mingyang Song +7Efficient On-Policy DistillationRp-Opsd

  35. Multi-Turn On-Policy Distillation with Prefix Replay

    Jul 6, 2026Baohao Liao, Hanze Dong, Christof Monz +3Efficient On-Policy DistillationTeacher

  36. UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning

    Jul 5, 2026Niu Lian, Alan Chen, Zhehao Yu +8Graphical User Interface AgentsMultimodal Agents

  37. DOPD: Dual On-policy Distillation

    Jun 29, 2026Xinlei Yu, Gen Li, Qingyi Si +13Efficient On-Policy DistillationPrivileged Context

  38. ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents

    Jun 26, 2026Qitai Tan, Zefang Zong, Yang Li +1Efficient On-Policy Distillation

  39. AsyncOPD: How Stale Can On-Policy Distillation Be?

    Jun 23, 2026Wonjun Kang, Kevin Galim, Seunghyuk Oh +9Efficient On-Policy DistillationAsynchronous Execution

  40. On the Position Bias of On-Policy Distillation

    Jun 21, 2026Yan Xie, Sijie Zhu, Tiansheng Wen +2Efficient On-Policy DistillationToken-Level Entropy

  41. Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

    Jun 17, 2026Pengyu Li, Zhitao Gao, Lingling Zhang +5Multimodal ReasoningMultimodal Model

  42. PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation

    Jun 15, 2026Anhao Zhao, Junlong Tong, Yingqi Fan +3Efficient On-Policy DistillationRp-Opsd

  43. SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling

    Jun 8, 2026Haoran Xu, Hongyu Wang, Yifei Gao +3Efficient On-Policy DistillationTeacher

  44. When Should the Teacher Move? Temporal Coupling and Stability in Self On-Policy Distillation

    Jun 2, 2026Haowei Guo, Baolong Bi, Ruicheng Zhang +2Efficient On-Policy DistillationTeacher

  45. SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

    Jun 1, 2026Hao Li, Jingkun An, Zijun Song +8Safety AlignmentLarge Language Model Alignment

  46. Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding

    May 30, 2026Hee Suk Yoon, Eunseop Yoon, Jaehyun Jang +6Efficient On-Policy DistillationMultimodal Benchmarks

  47. Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

    May 29, 2026Can Jin, Jiakang Li, Rui Wu +2Efficient On-Policy DistillationScalable Oversight