Teacher-Student Learning

Momentum

7 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 162

All topics
CardsList
  1. CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO

    May 29, 2026Yang Li, Gongle Xue, Yijia Guo +3RL for Language Model ReasoningGroup Relative Policy Optimization

  2. Trust-Region Behavior Blending for On-Policy Distillation

    May 29, 2026Daniil Plyusov, Alexey Gorbatovski, Alexey Malakhov +4Language Model DistillationTrust-Region Optimization

  3. Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation

    May 29, 2026Yanjiang Liu, Jie Lou, Xinyan Guan +7CoT DistillationLanguage Model Distillation

  4. LARK: Learnability-Grounded Trajectory Selection for Efficient Reasoning Distillation

    May 28, 2026Tianrun Yu, Kaixiang Zhao, Chih-Chun Chen +5CoT DistillationLanguage Model Distillation

  5. Bounded Behavioral Indistinguishability for Black-Box LLM Distillation

    May 28, 2026Munawar HasanLLM EvaluationLanguage Model Distillation

  6. Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models

    May 28, 2026Zizhuo Lin, Quanling Liu, Jinsheng Quan +6LLM GroundingReasoning Consistency in Language Models

  7. AgentSchool: An LLM-Powered Multi-Agent Simulation for Education

    May 28, 2026Yulei Ye, Wenhao Li, Zhong Wen +23Multi-Agent LLM SystemsHuman Behavior Simulation

  8. Surfacing Isolated Learners with Outcome-Independent Mediation of Feedback between Teachers and Students Using AI

    May 28, 2026Junsoo Park, Youssef Medhat, Htet Phyo Wai +2Explainable Artificial IntelligenceAI in Education

  9. Skill-Conditioned Gated Self-Distillation for LLM Reasoning

    May 27, 2026Jiazhen Huang, Xiao Chen, Xiao Luo +3Mathematical ReasoningSelf-Distillation

  10. ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation

    May 27, 2026Kun Liang, Chenming Tang, Clive Bai +3Language Model DistillationOn-Policy Distillation

  11. Teacher-Student Representational Alignment for Reinforcement Learning-Driven Imitation Learning

    May 27, 2026Meraj Mammadov, Pedro Zuidberg Dos Martires, Johannes Andreas StorkImitation LearningRobot Imitation Learning

  12. Better Accuracies, Worse Reasoning: A Step-Level Audit of Medical Chain-of-Thought Distillation

    May 27, 2026Zhaoyang Jiang, Xuanqi Peng, Fei Teng +5CoT DistillationCoT Evaluation

  13. Less is More: Early Stopping Rollout for On-Policy Distillation

    May 26, 2026Zhou Ziheng, Jiaqi Li, Huacong Tang +2Language Model DistillationOn-Policy Distillation

  14. When the Strongest Teacher Is Not the Best Teacher: Student-Centric Answer Selection

    May 26, 2026Zhengyu Hu, Zheyuan Xiao, Linxin Song +10Language Model DistillationLLM Post-Training

  15. Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation

    May 26, 2026Yuanyi Wang, Su Lu, Yanggan Gu +6Selective Knowledge DistillationLanguage Model Distillation

  16. On-Policy Adversarial Flow Distillation for Autoregressive Video Generation

    May 25, 2026Yang Luo, Shengju Qian, Xiaohang Tang +4Autoregressive Video GenerationOn-Policy Distillation

  17. Learning Through Noise: Why Subliminal Learning Works and When It Fails

    May 22, 2026Vincent C. Brockers, Roman D. Ventzke, Valentin Neuhaus +2Subliminal LearningCross-Architecture Knowledge Distillation

  18. Coupled Training with Privileged Information and Unlabeled Data

    May 22, 2026Jiahao Shi, Omar Hagrass, Jason M. KlusowskiLearning Using Privileged InformationSemi-Supervised Learning

  19. A Boundary-Layer Mechanism for One-Third Scaling in Online Softmax Classification

    May 21, 2026Marcel Kühn, Yoon Thelge, Bernd RosenowStatistical Physics of LearningMulticlass Classification

  20. Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning

    May 21, 2026Hongbin Zhang, Chaozheng Wang, Kehai Chen +4On-Policy Self-DistillationMathematical Reasoning

  21. Toward Understanding Adversarial Distillation: Why Robust Teachers Fail

    May 21, 2026Hongsin Lee, Hye Won ChungAdversarial TrainingNeural Network Robustness

  22. Visual-Advantage On-Policy Distillation for Vision-Language Models

    May 21, 2026Ruiqi Liu, Xiaolei Lv, Gengsheng Li +8Vision-Language ModelsVLM Distillation

  23. X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation

    May 20, 2026Sharath Turuvekere Sreenivas, Adithyakrishna Venkatesh Hanasoge, Mingyu Yang +4Cross-Tokenizer Knowledge DistillationLanguage Model Distillation

  24. When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning

    May 20, 2026Xiaogeng Liu, Xinyan Wang, Yingzi Ma +2CoT DistillationOn-Policy Self-Distillation

  25. AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals

    May 20, 2026Duy Nguyen, Hanqi Xiao, Archiki Prasad +7On-Policy Self-DistillationLanguage Model Distillation