Online-Policy Distillation

Latest papers 22

All topics
CardsList
  1. Understanding On-Policy Distillation: A Mechanistic Interpretability Perspective via Sparse Crosscoders

    Sep 28, 2026Zichao Yu, Qianshuo Ye, Xu Wang +1Efficient On-Policy DistillationOnline-Policy Distillation

  2. Instruct, Not Answer: Using Instruction Privileges in On-Policy Context Distillation

    Sep 26, 2026Hantao Yu, Xiaoxue Han, Udaya Ghai +4Online-Policy DistillationInstruction

  3. Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement

    Aug 31, 2026Yi Ding, Ruqi ZhangOnline-Policy DistillationTeacher

  4. When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

    Aug 4, 2026Yinuo Jiang, Yongjie Ye, Zhou Tao +4Efficient On-Policy DistillationOnline-Policy Distillation

  5. SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

    Aug 4, 2026Wen Wang, Jiahua Bao, Tu Yongsiqi +8Reward-Only Policy Optimization VariantsOnline-Policy Distillation

  6. OPOD: On-Policy Omni Distillation

    Jul 23, 2026Tong Zhao, Yuyang Hu, Yutao Zhu +5Online-Policy DistillationOmni-Modal

  7. Trace-Based On-Policy Distillation for Masked Diffusion Language Models

    Jul 18, 2026Haolin Ren, Ziyang Huang, Chenhao Yuan +2Diffusion Language ModelsMasked Diffusion Language Models

  8. Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

    Jun 28, 2026Chao Wang, Hongtao Tian, Tao Yang +3Process Reward ModelLLM Reasoning Strategies

  9. MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

    Jun 16, 2026Lichen Bai, Tianhao Zhang, Shitong Shao +14Video World ModelsVideo Generation

  10. Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

    Jun 14, 2026Yu Li, Shu Hong, Tian LanUnsupervised On-Policy Self-DistillationOnline-Policy Distillation

  11. Trust Region On-Policy Distillation

    May 31, 2026Xingrun Xing, Haoqing Wang, Boyan Gao +2Online-Policy DistillationToken-Level Supervision

  12. StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning

    May 26, 2026Yanfei Zhang, Xu Lin, Chenglin WuOnline-Policy DistillationRp-Opsd

  13. OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning

    May 21, 2026Yu Li, Rui Miao, Tian Lan +1LLM Reasoning StrategiesFrictive Policy Optimization

  14. GRAFT: Graph-Tokenized LLMs for Tool Planning

    May 12, 2026Xinyi Gao, Xinyu Ren, Junliang Yu +3Large Language Model PlanningLarge Language Model Workflows

  15. On-Policy Distillation with Best-of-N Teacher Rollout Selection

    May 10, 2026Ke Zhang, Yunjie Tian, Dongdi Zhao +4Online-Policy DistillationToken-Level Supervision

  16. OVD: On-policy Verbal Distillation

    Jan 29, 2026Jing Xiong, Hui Shen, Shansan Gong +7Online-Policy DistillationStudent-Generated Trajectories