Rp-Opsd

Momentum

4 papers in the last four weeks, level with the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 22

All topics
CardsList
  1. RS-OPSD: Reliable Privileged On-Policy-Self-Distillation for Ultra-High-Resolution Remote Sensing VQA

    Sep 29, 2026Chengjie Jiang, Yunqi Zhou, Jiafeng Yan +3TextvqaRemote Sensing

  2. On-Policy Self-Distillation for Multi-Turn Image Editing

    Sep 28, 2026Liangbing Zhao, Le Zhuo, Mohamed ElhoseinyImage EditingPrecise Editing

  3. OSPD: On-Policy Self-Distillation for Persona-Consistent Dialogue

    Sep 28, 2026Rui Xu, Yikai Zhang, Aili Chen +3Role-Playing AgentsPersona Consistency

  4. UOPD: Uncertainty-Aware Intervention for On-Policy Distillation of Multi-Turn Agents

    Sep 27, 2026Wenbo Zhang, Pengcheng Xu, Weizhi Du +2Efficient On-Policy DistillationRp-Opsd

  5. SCOPE-OPSD: Fisher-Conditioned Privileged Subspaces for On-Policy Self-Distillation

    Sep 14, 2026Yunmeng Chen (Chongqing Ant Consumer Finance Co., Ltd), Kunyu Wang (Alibaba Cloud Computing Co. +18Unsupervised On-Policy Self-DistillationRp-Opsd

  6. Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding

    Aug 26, 2026Kaishen Wang, Dongdi Zhao, Yijun Liang +4Video UnderstandingUnsupervised On-Policy Self-Distillation

  7. RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer

    Aug 6, 2026Xinye Wang, Junxiao Liu, Shujian HuangLLM Reasoning StrategiesUnsupervised On-Policy Self-Distillation

  8. AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

    Aug 6, 2026Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao +10Agentic Reinforcement LearningUnsupervised On-Policy Self-Distillation

  9. ββ-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

    Jul 30, 2026Jiawei Xu, Minghui Liu, Juzheng Zhang +2Unsupervised On-Policy Self-DistillationRp-Opsd

  10. RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models

    Jul 27, 2026Qihui Zhu, Yuchen Wang, Zijian Wen +7Rp-OpsdMultimodal Large Language Models

  11. EasyOPD: An Easy-to-use On-Policy Distillation Framework for Large Language Models

    Jul 13, 2026Jie Sun, Mao Zheng, Mingyang Song +7Efficient On-Policy DistillationRp-Opsd

  12. PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation

    Jun 15, 2026Anhao Zhao, Junlong Tong, Yingqi Fan +3Efficient On-Policy DistillationRp-Opsd

  13. Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation

    Jun 11, 2026Guo Yu, Wenlin Liu, Yulan Hu +3Rp-OpsdSparsity

  14. StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning

    May 26, 2026Yanfei Zhang, Xu Lin, Chenglin WuOnline-Policy DistillationRp-Opsd

  15. f\boldsymbol{f}-OPD: Stabilizing Long-Horizon On-Policy Distillation with Freshness-Aware Control

    May 18, 2026Xianwei Chen, Shimin Zhang, Jibin WuRp-OpsdGradient Staleness

  16. ProteinOPD: Towards Effective and Efficient Preference Alignment for Protein Design

    May 11, 2026Yulin Zhang, He Cao, Zihao Jiang +6Protein DesignPreference Alignment

  17. D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models

    May 6, 2026Dengyang Jiang, Xin Jin, Dongyang Liu +9Diffusion ModelsSupervised Finetuning