Weak-to-Strong Generalization

Latest papers 15

All topics
CardsList
  1. An Active-Bottleneck Mechanism for Weak-to-Strong Generalization

    Sep 27, 2026Mohammad Zeinalpour, Amir NajafiWeak-to-Strong GeneralizationPseudo-Labeling

  2. Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation

    Sep 8, 2026Youngrok Park, Sangmin Bae, Hojung Jung +6Policy GradientWeak-to-Strong Generalization

  3. Weak-to-Strong Learning in Decision Making

    Jul 20, 2026Jingwei Ji, Renyuan XuStochastic OptimizationDecision-Focused Learning

  4. Weak-to-Strong Generalization via Direct On-Policy Distillation

    Jul 6, 2026Shiyuan Feng, Huan-ang Gao, Haohan Chi +7RL for Language Model ReasoningWeak-to-Strong Generalization

  5. What Makes a Strong Model? A Unified Spectral Analysis of Knowledge Transfer over High-dimensional Linear Regression

    May 31, 2026Wendao Wu, Fangqing Zhang, Haihan Zhang +1Weak-to-Strong GeneralizationTeacher-Student Learning

  6. Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher

    May 31, 2026Arda Uzunoglu, Alvin Zhang, Daniel KhashabiData SelectionTraining Data Selection

  7. Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

    May 29, 2026Can Jin, Jiakang Li, Rui Wu +2Scalable OversightWeak-to-Strong Generalization

  8. When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift

    May 25, 2026Khoi Le, Tri Cao, Phong Nguyen +5Pairwise Preference LearningReward Modeling

  9. The Mechanism of Weak-to-Strong Generalization: Feature Elicitation from Latent Knowledge

    May 13, 2026Ryoya Awano, Taiji SuzukiNeural Network GeneralizationRepresentation Learning

  10. Weak-to-Strong Generalization is Nearly Inevitable (in Linear Models)

    May 7, 2026Scott Geng, Dutch Hansen, Jerry LiLogistic RegressionWeak-to-Strong Generalization

  11. On the Blessing of Pre-training in Weak-to-Strong Generalization

    May 7, 2026Wei Yao, Wang Zhaoyang, Gengze Xu +5Language Model PretrainingNeural Network Generalization

  12. Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective

    Apr 28, 2026Hamid Osooli, Kareema Batool, Rick Gentry +3LLM Safety AlignmentWeak-to-Strong Generalization