On-Policy Self-Distillation

Momentum

30 papers in the last four weeks, up 233% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 108

All topics
CardsList
  1. MIMESIS: Learning User Simulators as Training Environments for Interactive Agents

    Oct 7, 2026Hoang Phan, Dat Huynh, Andrey Zhmoginov +7User SimulationLLM Agent Training

  2. MeSD: Multi-Evidence Self-Distillation for VideoLLM

    Oct 5, 2026Weijie Zhu, Han Fang, Hanyu Fu +13On-Policy Self-DistillationVideo-Language Models

  3. Learning without Overwriting: A Theory of Self-Distillation and Supervised Fine-Tuning in Continual Reasoning

    Oct 4, 2026Shinichi Uemura, Taiji SuzukiSupervised Fine-TuningContinual Learning for LLMs

  4. Outcome-Guided On-Policy Self-Distillation

    Oct 4, 2026ZheXu Wang, Mao-Lin Luo, Yankun Hong +6On-Policy Self-DistillationUncertainty-Aware Knowledge Distillation

  5. E2^2-OPSD: Taming Entropy Overshoot in On-Policy Self-Distillation

    Oct 4, 2026Yifei Liu, Minghao Fang, Xinyu Gu +6On-Policy Self-DistillationMathematical Reasoning

  6. Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation

    Sep 30, 2026Xincheng Wei, Yifan Ding, Yoshua Li +6On-Policy Self-DistillationMathematical Reasoning

  7. Disentangling Self-Distillation: Measuring and Modeling Acquisition and Retention

    Sep 30, 2026Luis Zuin, Alexis Huet, Dario Rossi +1On-Policy Self-DistillationSelf-Distillation

  8. OmniReasoning: Pushing the Limits of Audio-Visual Joint Reasoning

    Sep 30, 2026Junming Lin, Yuxuan Wang, Zhenxin Lei +11On-Policy Self-DistillationMultimodal Reasoning

  9. ReSAIL: Mitigating Collapse in Iterative Agent Self-Distillation

    Sep 30, 2026Shengjie Jin, Hengbo Xu, Zelong Sun +2On-Policy Self-DistillationLLM Agent Self-Improvement

  10. UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement

    Sep 30, 2026Fang Wu, Da Xing, Yanjie Huang +16Unified Multimodal ModelsOn-Policy Self-Distillation

  11. Activation-Conditioned Self-Distillation

    Sep 29, 2026Zhexi Lu, Subhajit Chaudhury, Tejaswini Pedapati +2Numerical Reasoning in Language ModelsOn-Policy Self-Distillation

  12. RS-OPSD: Reliable Privileged On-Policy-Self-Distillation for Ultra-High-Resolution Remote Sensing VQA

    Sep 29, 2026Chengjie Jiang, Yunqi Zhou, Jiafeng Yan +3Remote Sensing Image UnderstandingVisual Question Answering

  13. Overcoming Scaling Limits in On-Policy Self-Distillation for LLM Reasoning

    Sep 29, 2026Md. Ismail Hossain, Humaira Kousar, Isidora Chara TourniOn-Policy Self-DistillationMathematical Reasoning

  14. Can Vision-Language Models Stay Helpful When Facing Implicit Risks? Intent-Privilege OPSD for Efficient Safety-Helpfulness Alignment

    Sep 29, 2026Haotian Deng, Wenbin Xing, Gang Xu +5VLM RobustnessVision-Language Models

  15. Train Ahead, Distill Back: Bootstrapping On-Policy Self-Distillation for Large Language Models

    Sep 29, 2026Zheng Zhang, Xinyue Tan, Lufei Li +3On-Policy Self-DistillationLanguage Model Distillation

  16. Know Thyself, Teach Thyself: Internal Information Flow for Selective Self-Distillation

    Sep 29, 2026Rui Wang, Ruijie Wang, Bo Chen +2On-Policy Self-DistillationSelective Knowledge Distillation

  17. PE-OPSD: Internalizing Prompt Enhancement into Flow-matching Models via On-Policy Self-Distillation

    Sep 29, 2026Mingfeng Lin, Chengfei Cai, Lin Xu +3On-Policy Self-DistillationT2I Generation

  18. PIVOT: Pivot-Aware On Policy Self Distillation for Multi-Turn VLM Agents

    Sep 28, 2026Jiazhou Zhou, Hu Zhou, Yucheng Chen +3On-Policy Self-DistillationReinforcement Learning with Verifiable Rewards

  19. Rubric-Aware On-Policy Self-Distillation for LLM Personalization

    Sep 28, 2026Yilun Qiu, Xiaoyan Zhao, Chengbing Wang +6LLM PersonalizationOn-Policy Self-Distillation

  20. Evidence-Aligned Multimodal On-Policy Self-Distillation for Fine-Grained Visual Understanding

    Sep 28, 2026Nanxing Hu, Qiwei Yan, Jinchao Zhang +1On-Policy Self-DistillationVLM Distillation

  21. EOPSA: Efficient On-Policy Self-Distilled Safety Alignment

    Sep 28, 2026Qirui Liu, Yichen Sun, Yan Wang +5On-Policy Self-DistillationSelective Knowledge Distillation

  22. SCOPD: Sparse-Context On-Policy Self-Distillation for Efficient Vision-Language Models

    Sep 28, 2026Ahmadreza Jeddi, Enming Zhang, Jasper Gerigk +12Efficient VLM InferenceOn-Policy Self-Distillation

  23. Fisher-Informed Recalibration for Feedback-Based On-Policy Self-Distillation of LLMs

    Sep 27, 2026Seohyun Lee, Dong-Jun Han, Seyyedali Hosseinalipour +1On-Policy Self-DistillationKnowledge Distillation