Teacher-Student Learning

Momentum

7 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 162

All topics
CardsList
  1. CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO

    May 29, 2026Yang Li, Gongle Xue, Yijia Guo +3RL for Language Model ReasoningGroup Relative Policy Optimization

  2. Trust-Region Behavior Blending for On-Policy Distillation

    May 29, 2026Daniil Plyusov, Alexey Gorbatovski, Alexey Malakhov +4Language Model DistillationTrust-Region Optimization

  3. Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation

    May 29, 2026Yanjiang Liu, Jie Lou, Xinyan Guan +7CoT DistillationLanguage Model Distillation

  4. LARK: Learnability-Grounded Trajectory Selection for Efficient Reasoning Distillation

    May 28, 2026Tianrun Yu, Kaixiang Zhao, Chih-Chun Chen +5CoT DistillationLanguage Model Distillation

  5. Bounded Behavioral Indistinguishability for Black-Box LLM Distillation

    May 28, 2026Munawar HasanLLM EvaluationLanguage Model Distillation

  6. Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models

    May 28, 2026Zizhuo Lin, Quanling Liu, Jinsheng Quan +6LLM GroundingReasoning Consistency in Language Models

  7. AgentSchool: An LLM-Powered Multi-Agent Simulation for Education

    May 28, 2026Yulei Ye, Wenhao Li, Zhong Wen +23Multi-Agent LLM SystemsHuman Behavior Simulation

  8. Surfacing Isolated Learners with Outcome-Independent Mediation of Feedback between Teachers and Students Using AI

    May 28, 2026Junsoo Park, Youssef Medhat, Htet Phyo Wai +2Explainable Artificial IntelligenceAI in Education

  9. Skill-Conditioned Gated Self-Distillation for LLM Reasoning

    May 27, 2026Jiazhen Huang, Xiao Chen, Xiao Luo +3Mathematical ReasoningSelf-Distillation

  10. ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation

    May 27, 2026Kun Liang, Chenming Tang, Clive Bai +3Language Model DistillationOn-Policy Distillation

  11. Teacher-Student Representational Alignment for Reinforcement Learning-Driven Imitation Learning

    May 27, 2026Meraj Mammadov, Pedro Zuidberg Dos Martires, Johannes Andreas StorkImitation LearningRobot Imitation Learning

  12. Better Accuracies, Worse Reasoning: A Step-Level Audit of Medical Chain-of-Thought Distillation

    May 27, 2026Zhaoyang Jiang, Xuanqi Peng, Fei Teng +5CoT DistillationCoT Evaluation

  13. Less is More: Early Stopping Rollout for On-Policy Distillation

    May 26, 2026Zhou Ziheng, Jiaqi Li, Huacong Tang +2Language Model DistillationOn-Policy Distillation

  14. When the Strongest Teacher Is Not the Best Teacher: Student-Centric Answer Selection

    May 26, 2026Zhengyu Hu, Zheyuan Xiao, Linxin Song +10Language Model DistillationLLM Post-Training

  15. Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation

    May 26, 2026Yuanyi Wang, Su Lu, Yanggan Gu +6Selective Knowledge DistillationLanguage Model Distillation

  16. On-Policy Adversarial Flow Distillation for Autoregressive Video Generation

    May 25, 2026Yang Luo, Shengju Qian, Xiaohang Tang +4Autoregressive Video GenerationOn-Policy Distillation

  17. Learning Through Noise: Why Subliminal Learning Works and When It Fails

    May 22, 2026Vincent C. Brockers, Roman D. Ventzke, Valentin Neuhaus +2Subliminal LearningCross-Architecture Knowledge Distillation

  18. Coupled Training with Privileged Information and Unlabeled Data

    May 22, 2026Jiahao Shi, Omar Hagrass, Jason M. KlusowskiLearning Using Privileged InformationSemi-Supervised Learning

  19. A Boundary-Layer Mechanism for One-Third Scaling in Online Softmax Classification

    May 21, 2026Marcel Kühn, Yoon Thelge, Bernd RosenowStatistical Physics of LearningMulticlass Classification

  20. Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning

    May 21, 2026Hongbin Zhang, Chaozheng Wang, Kehai Chen +4On-Policy Self-DistillationMathematical Reasoning

  21. Toward Understanding Adversarial Distillation: Why Robust Teachers Fail

    May 21, 2026Hongsin Lee, Hye Won ChungAdversarial TrainingNeural Network Robustness

  22. Visual-Advantage On-Policy Distillation for Vision-Language Models

    May 21, 2026Ruiqi Liu, Xiaolei Lv, Gengsheng Li +8Vision-Language ModelsVLM Distillation

  23. X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation

    May 20, 2026Sharath Turuvekere Sreenivas, Adithyakrishna Venkatesh Hanasoge, Mingyu Yang +4Cross-Tokenizer Knowledge DistillationLanguage Model Distillation

  24. When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning

    May 20, 2026Xiaogeng Liu, Xinyan Wang, Yingzi Ma +2CoT DistillationOn-Policy Self-Distillation

  25. AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals

    May 20, 2026Duy Nguyen, Hanqi Xiao, Archiki Prasad +7On-Policy Self-DistillationLanguage Model Distillation

  26. Consistently Informative Soft-Label Temperature for Knowledge Distillation

    May 19, 2026Hoang-Chau Luong, Nghia Van Vo, Kaiqi Zhao +1Teacher-Student LearningKnowledge Distillation

  27. LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models

    May 19, 2026Hyunsoo Han, Sangyeop Yeo, Jaejun YooModel CompressionDiffusion Model Distillation

  28. Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation

    May 16, 2026Anhao Zhao, Haoran Xin, Yingqi Fan +3Reasoning DistillationOn-Policy Distillation

  29. PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play

    May 16, 2026Roger Creus Castanyer, Geoffrey Bradway, Lorenz Wolf +3Self-Play RLRL for Language Model Reasoning

  30. How to Choose Your Teacher for Fine Grained Image Recognition

    May 15, 2026Oswin Gosal, Edwin Arkel Rios, Augusto Christian Surya +3Fine-Grained Image ClassificationTeacher-Student Learning

  31. DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation

    May 15, 2026Jaehun Jung, Hyunwoo Kim, Brandon Cui +4VLM DistillationVLM Reasoning

  32. Distribution Corrected Offline Data Distillation for Large Language Models

    May 13, 2026Yumeng Zhang, Zhengbang Yang, Yevin Nikhel Goonatilake +1CoT DistillationEfficient Language Model Reasoning

  33. Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation

    May 13, 2026Kaiyuan Liu, Ziyuan Zhuang, Yang Bai +3Selective Knowledge DistillationLanguage Model Distillation

  34. Teaching and Learning under Deductive Errors

    May 13, 2026Jan Arne Telle, Brigt Håvardstun, Jose Hernandez-OralloParameterized ComplexityPAC Learning

  35. On the Generalization of Knowledge Distillation: An Information-Theoretic View

    May 13, 2026Bingying Li, Haiyun HeInformation-Theoretic Generalization BoundsStatistical Learning Theory

  36. Multi-Rollout On-Policy Distillation via Peer Successes and Failures

    May 12, 2026Weichen Yu, Xiaomin Li, Yizhou Zhao +8RL for Language Model ReasoningLanguage Model Distillation

  37. Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

    May 12, 2026Guobin Shen, Xiang Cheng, Chenxiao Zhao +4On-Policy Self-DistillationRL for Language Model Reasoning

  38. Physics-Informed Teacher-Student Ensemble Learning for Traffic State Estimation with a Varying Speed Limit Scenario

    May 11, 2026Archie J. Huang, Dongdong Wang, Shaurya Agarwal +3Ensemble LearningTraffic Flow Estimation

  39. The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes

    May 11, 2026Siqi Zhu, Xuyan Ye, Hongyu Lu +2On-Policy Self-DistillationOn-Policy Distillation

  40. SplitFed-CL: A Split Federated Co-Learning Framework for Medical Image Segmentation with Inaccurate Labels

    May 11, 2026Zahra Hafezi Kafshgari, Hadi Hadizadeh, Parvaneh SaeediSplit Federated LearningNoisy-Label Learning

  41. STEPS: Selective On-Policy Self-Distillation for Reasoning

    May 11, 2026Jiaxuan Wang, Xuan Ouyang, Zhiyu Chen +2On-Policy Self-DistillationRL for Language Model Reasoning

  42. On-Policy Distillation with Best-of-N Teacher Rollout Selection

    May 10, 2026Ke Zhang, Yunjie Tian, Dongdi Zhao +4CoT DistillationBest-of-N Sampling

  43. Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation

    May 10, 2026Yuxuan Jiang, Runchao Li, Shubhashis Roy Dipta +2Language Model DistillationOn-Policy Distillation

  44. Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation

    May 8, 2026Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade +3Flow MatchingDiffusion Language Model Inference

  45. KL for a KL: On-Policy Distillation with Control Variate Baseline

    May 8, 2026Minjae Oh, Sangjun Song, Gyubin Choi +2Language Model DistillationPolicy Gradient Methods

  46. Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning

    May 8, 2026Zhicheng Yang, Zhijiang Guo, Yifan Song +5RL for Language Model ReasoningLanguage Model Distillation

  47. SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation

    May 8, 2026Jie Sun, Mao Zheng, Mingyang Song +6Cross-Tokenizer Knowledge DistillationLanguage Model Distillation