Teacher-Student Learning

Momentum

7 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 162

All topics
CardsList
  1. GeoDial: A Multimodal Conversational Tutoring Dataset for Geometry Problem-Solving with Visual Tutor Turns

    May 8, 2026Sankalan Pal Chowdhury, Junling Wang, Donya Rooein +2Multimodal GroundingIntelligent Tutoring Systems

  2. Rubric-based On-policy Distillation

    May 8, 2026Junfeng Fang, Zhepei Hong, Mao Zheng +7LLM AlignmentLanguage Model Distillation

  3. Attention Transfer Is Not Universally Effective for Vision Transformers

    May 8, 2026Huaiyuan Qin, Muli Yang, Gabriel James Goenawan +4Self-AttentionVision Transformer

  4. Structural Rationale Distillation via Reasoning Space Compression

    May 8, 2026Jialin Yang, Jiankun Wang, Jiajun Wu +3CoT DistillationStructured Reasoning

  5. Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

    May 7, 2026Nan Jia, Haojin Yang, Xing Ma +6RL for Language Model ReasoningLanguage Model Distillation

  6. Weak-to-Strong Generalization is Nearly Inevitable (in Linear Models)

    May 7, 2026Scott Geng, Dutch Hansen, Jerry LiLogistic RegressionWeak-to-Strong Generalization

  7. Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization

    May 6, 2026Xin Yu, Liuchen Liao, Yiwen Zhang +3On-Policy Self-DistillationLanguage Model Distillation

  8. Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe

    May 5, 2026Wenjin Hou, Shangpin Peng, Weinong Wang +13Language Model DistillationMulti-Teacher Knowledge Distillation

  9. Private Speech Classification without Collapse: Stabilized DP Training and Offline Distillation

    May 4, 2026Yadi Wen, Tianxin Li, Enji Liang +2Differentially Private Stochastic Gradient DescentLearning Using Privileged Information

  10. MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate

    May 2, 2026Jianze Wang, Ying Liu, Jinlong Chen +7Multi-Agent DebateMulti-Teacher Knowledge Distillation

  11. LEAP: Layer-wise Exit-Aware Pretraining for Efficient Transformer Inference

    May 1, 2026Shashank Kapadia, Deep Naryan Mishra, Sujal Reddy Alugubelli +4Efficient Transformer InferenceDynamic Neural Networks

  12. GaitKD: A Universal Decoupled Distillation Framework for Efficient Gait Recognition

    Apr 29, 2026Yuqi Li, Qian Zhou, Huiran Duan +5Gait AnalysisGait Recognition

  13. Knowledge Distillation Must Account for What It Loses

    Apr 28, 2026Wenshuo WangTeacher-Student LearningKnowledge Distillation

  14. TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents

    Apr 27, 2026Jiaqi Wang, Wenhao Zhang, Weijie Shi +2Language Model DistillationLLM Agents

  15. Hiding in Plain Sight: Detectability-Aware Antidistillation of Reasoning Models

    Apr 25, 2026Max Hartman, Vidhata Jayaraman, Moulik Choraria +2CoT DistillationTeacher-Student Learning

  16. Industrial Surface Defect Detection via Diffusion Generation and Asymmetric Student-Teacher Network

    Apr 21, 2026Shuo Feng, Runlin Zhou, Yuyang Li +1Industrial Anomaly DetectionSynthetic Anomaly Generation

  17. Distillation Traps and Guards: A Calibration Knob for LLM Distillability

    Apr 21, 2026Weixiao Zhan, Yongcheng Jing, Leszek Rutkowski +1Language Model CalibrationLanguage Model Distillation

  18. Random Matrix Theory of Early-Stopped Gradient Flow: A Transient BBP Scenario

    Apr 20, 2026Florentin Coeurdoux, Grégoire Ferré, Jean-Philippe BouchaudRandom Matrix TheoryEarly Stopping

  19. Subliminal Transfer of Unsafe Behaviors in AI Agent Distillation

    Apr 16, 2026Jacob Dang, Brian Y. Xie, Omar G. YounisSubliminal LearningLanguage Model Distillation

  20. Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation

    Apr 13, 2026Lester James V. Miranda, Ivan Vulić, Anna KorhonenSupervised Fine-TuningMultilingual Language Models

  21. Revisiting the Capacity Gap in Chain-of-Thought Distillation from a Practical Perspective

    Apr 10, 2026Tokio Kajitsuka, Ukyo Honda, Sho TakaseCoT DistillationReasoning Distillation

  22. Effective Distillation to Hybrid xLSTM Architectures

    Mar 16, 2026Lukas Hauzenberger, Niklas Schmidinger, Thomas Schmied +7LLM CompressionLanguage Model Distillation

  23. TabKD: Tabular Knowledge Distillation through Interaction Diversity of Learned Feature Bins

    Mar 16, 2026Shovon Niverd Pereira, Krishna Khadka, Yu LeiFeature Interaction ModelingData-Free Knowledge Distillation

  24. TTSR: Test-Time Self-Evolving via Reflection

    Feb 6, 2026Haoyang He, Zihua Rong, Yunjia Zhao +3LLM Self-RefinementTest-Time Optimization

  25. BRIDGE: Bridging Reasoning In Distillation Gap Elimination via Structure-Aware Masking

    Feb 5, 2026Bowen Yu, Sheng Zhang, Binhao Wang +8CoT DistillationMathematical Reasoning