Teacher

Momentum

51 papers in the last four weeks, up 219% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 203

All topics
CardsList
  1. From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation

    Oct 1, 2026Siqi Zhu, Suozhi Huang, Kaixuan Zhang +4Aware Heterogeneous Multi-Teacher Multimodal On-Policy DistillationTeacher

  2. SALD: Self-Referenced Advantage Learning for Diffusion Models

    Oct 1, 2026Aryan Das, Surjo Dey, Koushik Biswas +4Diffusion ModelsLarge Language Model Adaptation

  3. Reason in Style: Discovering and Controlling Style in Language Models

    Sep 30, 2026Ioana Marinescu, Eric Karl Oermann, Kyunghyun ChoStylistic FidelityStyle

  4. Awakening of the Buddha: Subspace Learning During Population-Loss Plateaus

    Sep 30, 2026Akash KumarAnisotropic Loss LandscapesSingular Learning Theory

  5. K2P: Label-Free Knowledge to Prompt Distillation

    Sep 30, 2026Yingchuan Zhang, Haoran Lu, Wenxuan Zhong +1Knowledge DistillationTeacher

  6. On the Off-Policy Teacher in On-Policy Distillation

    Sep 29, 2026Langlin Huang, Hao Liu, Mononito Goswami +5Efficient On-Policy DistillationTeacher

  7. Pretraining Latent Information Feedback Transformers with Teacher Supervision

    Sep 29, 2026Dor Tirosh, Ido Amos, Mor GevaTransformer ArchitecturesPretraining

  8. From Dissonance to Orchestration: Teacher Intervention in On-Policy Distillation

    Sep 29, 2026Yuhao Wang, Ruiyang Ren, Yinan Zhang +3TeacherMathematical Reasoning Benchmarks

  9. Beyond Prompt Count: How Data Shapes Transfer in On-Policy Distillation

    Sep 29, 2026Jiaxuan Wang, Jiafei Lyu, Yuchen Cai +8TeacherCounting

  10. Solving Without Stopping: On-Policy Distillation at Small Scale

    Sep 29, 2026Hongyang Li, Yiming Zhu, Xiao Li +3Efficient On-Policy DistillationTeacher

  11. Codebook-Guided Cross-Modal Knowledge Distillation for Structurally Heterogeneous Features

    Sep 29, 2026Dae Ung Jo, Jongin Lim, YoungJoon Yoo +1Cross-Modal DistillationCross-Modal

  12. Train Ahead, Distill Back: Bootstrapping On-Policy Self-Distillation for Large Language Models

    Sep 29, 2026Zheng Zhang, Xinyue Tan, Lufei Li +3Unsupervised On-Policy Self-DistillationTeacher

  13. Distilling Agentic Systems: A Roadmap across Models, Artifacts, and Harnesses

    Sep 29, 2026Ziluowen Luo, Senzhang Wang, Chaozhuo Li +9Knowledge DistillationProduction Agentic Systems

  14. SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation

    Sep 29, 2026Miteto Wei, Xiaohan Wang, Zehao Chen +7TeacherToken-Level Supervision

  15. Interactive-Policy Distillation with Bidirectional Propose-and-Verify

    Sep 29, 2026Shutong Wu, Xiwen Chen, Brendan Rappazzo +4Efficient On-Policy DistillationTeacher

  16. What Makes High-Magnification Knowledge Transferable? A Study of Cross-Resolution Distillation in Whole-Slide Imaging

    Sep 29, 2026Zhiyuan Yang, Jiahao Cheng, Mahdi S. HosseiniWhole-Slide ImagesCross-Task Knowledge Transfer

  17. Learning from Teacher Continuations at Student States

    Sep 28, 2026Haojin Wang, Dylan Zhang, Huaibo Chen +8TeacherContinuation

  18. Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation

    Sep 28, 2026Xin Li, Hao Jiang, Xin Gao +6Aware Heterogeneous Multi-Teacher Multimodal On-Policy DistillationTeacher

  19. Teacher-Student Gaps Are Not Enough: Outcome-Guided On-Policy Distillation for Multi-Turn Autonomous Agents

    Sep 28, 2026Tong Zhang, Zhou Liu, Yihao Liu +8Efficient On-Policy DistillationTeacher

  20. Understanding On-Policy Distillation: A Mechanistic Interpretability Perspective via Sparse Crosscoders

    Sep 28, 2026Zichao Yu, Qianshuo Ye, Xu Wang +1Efficient On-Policy DistillationOnline-Policy Distillation

  21. TIDE: Teacher-Student Transition via Informative Distillation and Exploration for Agentic RL

    Sep 28, 2026Yibin Huang, Xinming Xu, Conghui ZhuAgentic Reinforcement LearningTeacher

  22. Can We Trust the Teacher? Decoupled Credit Direction-Magnitude for Self-Distillation

    Sep 28, 2026Yugu Li, Zehong Cao, Peizhen Li +3Credit AssignmentTeacher

  23. Beyond Token Alignment: Event Completion for Cross-Tokenizer On-Policy Distillation

    Sep 28, 2026Jiacheng Liu, Jingwei Song, Qituan Zhang +2TeacherProcess-Level Supervision

  24. What Visual Generators Need from Teachers: Rethinking Representation Alignment

    Sep 28, 2026Yongcong Wang, Hingchin Chen, Mingyu Fan +6Diffusion AlignmentDiffusion Transformers

  25. When Less Data Favors Smaller Teachers: Rethinking Teacher Capacity and Data Selection for Knowledge Distillation

    Sep 28, 2026Minjae Park, Taesun Yeom, Jaeho LeeKnowledge DistillationTeacher

  26. A Statistical Perspective on Knowledge Distillation: Foundations, Classical Methods, and Large Language Model Extensions

    Sep 27, 2026Luyang Fang, Haoran Lu, Jiazhang Cai +4Knowledge DistillationResidual Distillation

  27. TeacherGRPO: Closing the Capacity Gap in Reasoning Distillation via Teacher Alignment

    Sep 27, 2026Zhenyu Lei, Zihan Chen, Yaochen Zhu +5Teacher-Student DistillationTeacher

  28. Dense Is Not Enough: Hierarchical Supervision Allocation for Long-Horizon On-Policy Distillation

    Sep 27, 2026Yuhao Sun, Binrui Wu, Zhuoer Xu +5Efficient On-Policy DistillationTeacher

  29. MOPD-Router: Rethinking Teacher Routing in Multi-Teacher On-Policy Distillation

    Sep 25, 2026Tianze Xu, Yanzhao Zheng, Zhentao Zhang +10Aware Heterogeneous Multi-Teacher Multimodal On-Policy DistillationTeacher

  30. LastOPD: Taming Collapse in Latent On-Policy Distillation

    Sep 23, 2026Jie Yang, Zhengyu Fang, Zelin Xu +7Uni-OpdTeacher

  31. The Fellowship of the Query: Learning Retrieval Actions

    Sep 23, 2026Mohammed Al-Maamari, Saber Zerhoudi, Michael Granitzer +1Fine-Grained ActionsModel Fine-Tuning

  32. BAS-OPD: Budget-Aware Selective On-Policy Self-Distillation for Fine-Grained Multimodal Perception

    Sep 22, 2026Zihan Chen, Hengguang Zhou, Yuan Kang +5Unsupervised On-Policy Self-DistillationRecent Vision-Language Models

  33. What Should a Self-Teacher See? Privileged Context Design for On-Policy Self-Distillation

    Sep 22, 2026Kanghui Tian, Siyuan Liu, Tianxiang Jiang +8Self-TeacherTeacher

  34. iSDFT: Information-Proximal Self-Distillation for Continual Learning in LLMs

    Sep 21, 2026Ahmed Khaled Khamis, Xiaotong Ji, Hassan Jaber +4Self-Distillation FrameworkSelf-Teacher

  35. Distill What You Trust: Reliability-Aware Multi-Teacher On-Policy Distillation

    Sep 20, 2026Jie Sun, Mao Zheng, Mingyang Song +8Aware Heterogeneous Multi-Teacher Multimodal On-Policy DistillationTeacher

  36. OPTED: On-Policy Fine-Tuning for End-to-End Driving using a Render-Free Teacher

    Sep 17, 2026Damiano Da Col, Maximilian Igl, Peter Karkus +5Autonomous DrivingReinforcement Learning Post-Training

  37. Enhanced Knowledge Distillation for Detection Transformer via Teacher Prediction Refinement

    Sep 17, 2026Yitong Xing, Yuhao Cheng, Yanping Li +1Rt-DetrDetection Transformer

  38. OPD-Aha: From Linguistic Momentum to Visual Reflection in Multimodal On-Policy Distillation

    Sep 15, 2026Chenhao Qiu, Dawei Li, Yechao Zhang +2Multimodal ReasoningTeacher

  39. Discrete Beckmann Transport Models for One-Step Language Modeling and Reasoning

    Sep 14, 2026Sophia Tang, Shiyi WangDiffusion Language ModelsAutoregressive Language Models

  40. Reproducing and Evaluating the Generalizability of Subliminal Learning in Open-Weight Models

    Sep 14, 2026Daan van der Weijden, Nathan Brack, Selene Baez SantamariaModel WeightsTeacher

  41. Teacher Geometry Shapes Learnability in Teacher-Student Networks

    Sep 10, 2026Kai J. Sandbrink, Flavio Martinelli, Alexander van Meegen +2Two-Layer Neural NetworksTeacher

  42. Compression Beyond the Uncompressed: A Two-Stage Training Recipe for Soft Context Compression in RAG

    Sep 4, 2026Shuyu Guo, Shuo Zhang, Zhaochun RenSearch-Augmented ReasoningData Compression Methods

  43. Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall

    Sep 1, 2026Jacqueline He, Howard Yen, Shuyue Stella Li +9Knowledge DistillationTeacher

  44. Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement

    Aug 31, 2026Yi Ding, Ruqi ZhangOnline-Policy DistillationTeacher

  45. CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations

    Aug 31, 2026Gabriel Meseguer-Brocal, Yuexuan Kong, Romain HennequinJoint-Embedding Predictive ArchitecturesContrastive Learning

  46. Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation

    Aug 30, 2026Run Yang, Runpeng Dai, Jie Sun +5TeacherDiversity Collapse

  47. Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

    Aug 27, 2026Shiyi Zhang, Mushui Liu, Yunze Tong +8Uni-OpdTeacher