Kullback-Leibler Divergence

Momentum

27 papers in the last four weeks, up 238% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 138

All topics
CardsList
  1. FERPO: Forward Entropy-Regularized Policy Optimization

    Oct 1, 2026Sebastian Sanokowski, Alireza Sarmadi, Majid KhadivEntropy Regularized Reinforcement LearningOffline Reinforcement Learning

  2. How Divergence Becomes Decision Flips in Compressed Language Models

    Sep 30, 2026Beatriz Almeida FelicioKullback-Leibler DivergenceLarge Language Model Decoding

  3. Probabilistic Adversarial Training

    Sep 30, 2026Andi Zhang, Xingyu Zhao, Siddartha KhastgirAdversarial TrainingKullback-Leibler Divergence

  4. Learning Beyond Full Imitation: Task-Preserving Knowledge Distillation

    Sep 30, 2026Qianfeng Yuan, Wenbing TaoKnowledge DistillationKullback-Leibler Divergence

  5. ReTaCo: Residual-Target Control for On-Policy Distillation

    Sep 30, 2026Zixiang Ni, Zhuo Hu, Renjie Cao +8Efficient On-Policy DistillationOn-Policy

  6. Understanding Off- vs On-Policy Distillation: A Tale of Distinct Training Objectives

    Sep 29, 2026Qiwei Di, Xuheng Li, Kaixuan Ji +3Kullback-Leibler DivergenceFeedback

  7. Unifying Distributional Training for One-Step Visual Generation

    Sep 28, 2026Chi Zhang, Shi Haoyang, Yueyi Liu +9Generative Flow NetworksVisual Generation

  8. An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning

    Sep 28, 2026Shangzhe Li, Yuxiao Yang, Tianrun Yu +4LLM Reasoning StrategiesOffline Reinforcement Learning

  9. On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

    Sep 28, 2026Julianna Piskorz, Antonin Berthon, Mihaela van der SchaarOff-Policy LearningOn-Policy

  10. Unbiased Top-kk Estimation for On-Policy Distillation

    Sep 28, 2026Linjian Meng, Siyuan Gan, YuHan Li +5Efficient On-Policy DistillationKullback-Leibler Divergence

  11. Do We Really Need KL Divergence for On-Policy Distillation of Large Language Models?

    Sep 27, 2026Wenze Lin, Jiyuan Long, Jiale Zhao +11Kullback-Leibler DivergenceResidual Distillation

  12. Non-Adaptive Learning of Sparse Erdős--Rényi Graphs via Affine Splitting

    Sep 27, 2026Hoang TaO(\Bar{K}\Log N)$Inhomogeneous Random Graphs

  13. The cost of useful natural gradient updates

    Sep 27, 2026Subhransu S. Bhattacharjee, Dylan Campbell, Rahul ShomeFisher Information MatrixGradient

  14. Minimally Invasive Steering of Language Models

    Sep 24, 2026Taha Entesari, Jingyu Zhang, Daniel Khashabi +1SteeringFrozen Language Model

  15. Not Every Token Is Worth Distilling: Selective Supervision for Direct-OPD

    Sep 24, 2026Yibo Zhao, Zixuan Yang, Yunshi Lan +1Efficient On-Policy DistillationProcess-Level Supervision

  16. Variational objectives for amortized Bayesian inference in inverse problems: The role of posterior conditioning

    Sep 21, 2026Abhishek Srivastava, Arijit Hazra, Rajesh DubbakuVariationalBayesian Inference

  17. Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation

    Sep 15, 2026Shiqi Liu, Zeyu He, Letian Tao +9Credit AssignmentKullback-Leibler Divergence

  18. Local Robustness Quantification for Naive Bayes Classifiers and Generative Forests: a General Approach

    Sep 11, 2026Adrián Detavernier, Jasper De BockRobustness VerificationRandom Forest

  19. How Wrong Can a Good Predictor Be? Diverging Updates with Vanishing Predictive KL

    Sep 11, 2026Qifu Wen, Shuaijun Liu, Zihan Zhou +2Posterior Predictive DistributionKullback-Leibler Divergence

  20. Dynamical Non-compensatory Multidimensional IRT Model Using Variational Approximation

    Sep 9, 2026Hiroshi Tamano, Daichi MochihashiItem Response TheoryKullback-Leibler Divergence

  21. FlowCPO: A Unified Divergence View of Preference Alignment for Flow Models

    Sep 9, 2026Yansen Han, Shengyi Liao, Peng Sun +4Flow ModelsPreference Alignment

  22. Mode Coverage in Normalizing Flow Boltzmann Generators via Log-Ratio Variation

    Sep 8, 2026Qi Feng, Rongjie Lai, Di Qi +1Normalizing FlowsKullback-Leibler Divergence

  23. Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall

    Sep 1, 2026Jacqueline He, Howard Yen, Shuyue Stella Li +9Knowledge DistillationTeacher

  24. Language-Statistical Analysis of Neural Audio Codec Tokens Across Architectures, Corpora, and Noise Conditions

    Aug 31, 2026Joonyong Park, Shinnosuke Takamichi, David M. Chan +3Neural Audio CodecsResidual Vector Quantization

  25. WARP: Wasserstein-Aligned RAG for Population Opinions

    Aug 24, 2026Aman Singh Thakur, Aditya Agrawal, Alwarappan Nakkiran +1Top-KPopulations

  26. SoftWater: Class-Aware Rate Allocation for Softmax Quantization

    Aug 12, 2026Joao V. Cavalcanti, Ashia C. WilsonGumbel-Softmax RelaxationKullback-Leibler Divergence

  27. A Local Sinkhorn Framework for Conditional Distribution Reconstruction of Multidimensional Random Fields

    Aug 12, 2026Mingtao Xia, Qijing ShenFused Sinkhorn-Localized SimilarityConditional Distribution

  28. PAC-Bayes Beyond Parameter Space: Behavioral Equivalence, Z-Information, and Exact Complexity Decomposition

    Aug 11, 2026Vasant G. Honavar, Satish Kumar Keshri, Neil Ashtekar +1Pac-Bayesian TheoryKullback-Leibler Divergence

  29. SR-OPSD: Self-Referenced On-Policy Self-Distillation

    Aug 10, 2026Zhuo Sun, Entong Li, Yanlong Zhao +9Unsupervised On-Policy Self-DistillationSelf-Teacher

  30. Causal State-Space Model for Causal Inference: Estimating Longitudinal Individual Treatment Effects

    Aug 8, 2026Abisoye Abidakun, Mingjun Zhong, Georgios LeontidisCausal InferencesHeterogeneous Treatment Effects

  31. Finite Constant Frontiers and Auditable Regret Certificates for Average-Reward Reinforcement Learning

    Aug 7, 2026Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus SwaqeebOptimal LearnerMarkov Decision Processes

  32. Flux-OPD: On-Policy Distillation with Evolving Contexts

    Jul 30, 2026Yuran Wang, Zekun Wang, Bohan Zeng +10Self-TeacherUni-Opd

  33. Trajectory-Regularized Stochastic Optimal Control via KL Divergence

    Jul 24, 2026Mintae Kim, Koushil SreenathStochastic Optimal ControlStochastic Optimization

  34. Total Variation Distance Estimation in Autoregressive Models

    Jul 21, 2026Eric Price, Kevin Tian, Zhiyang Xun +1Autoregressive Language ModelsKullback-Leibler Divergence

  35. Distilled Reinforcement Learning for LLM Post-training

    Jul 19, 2026Chen Wang, Zhaochun Li, Jionghao Bai +4Post-TrainingOffline Reinforcement Learning

  36. Approximate Relative Entropy Constraints for Nonlinear Covariance Steering Under Distribution Ambiguity

    Jul 18, 2026Trevor N. Wolf, Jay W. McMahonIntent-Aligned Autonomous Spacecraft GuidanceCovariance

  37. An Efficient Newton Algorithm for Nonnegative Matrix Factorization with the Kullback-Leibler Divergence

    Jul 15, 2026Damien Lesens, Jérémy E. Cohen, Bora UçarNonnegative Matrix FactorizationKullback-Leibler Divergence

  38. Can a Language Model Learn Facts Continually in Its Weights?

    Jul 13, 2026Charles O'Neill, Max Kirkby, Jonathon Liu +1Large Language Model MemoryFacts

  39. A Convex Approximation Framework for Neural Likelihood-Based Bayesian Inverse Problems

    Jul 7, 2026Fabian Schneider, Tapio Helin, Leila TaghizadehBayesian Inverse ProblemsNeural Approximations

  40. Lean-Quantum: Toward AI-Assisted Formalization of Quantum Information

    Jul 6, 2026Kazumi Kasaura, Kei Tsukamoto, Kento Mori +6FormalizationKullback-Leibler Divergence

  41. What Does a Discrete Diffusion Model Learn?

    Jul 6, 2026Rodrigo Casado Noguerales, Bernhard Schölkopf, Thomas Hofmann +1Diffusion ModelsKullback-Leibler Divergence

  42. Tightening the Score Matching Gap for Diffusion Models

    Jul 5, 2026Benjamin Dupuis, Tyler Farghly, Maxime Haddouche +2Score-Based Diffusion ModelKullback-Leibler Divergence

  43. CouCE: A Unified Causal Framework for Debiased Deep Metric Learning

    Jun 29, 2026Xin Yuan, Zhenyang Niu, Meiqi Wan +3Uncoupled LearningAdversarial Training

  44. ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation

    Jun 29, 2026Zilong Liu, Xuewen Zhang, Jinrui Xing +3Probe-Logit DistillationKullback-Leibler Divergence

  45. KbSD: Knowledge Boundary aware Self-Distillation for Behavioral Calibration in Agentic Search

    Jun 29, 2026Tao Feng, Xinke Jiang, Chao WuAgentic Reinforcement LearningAgentic Search

  46. A Diagnostic Framework and Multi-Evaluator Audit of Evaluator-Driven Preference Dynamics in Self-Adapting LLM Agents

    Jun 29, 2026Liu ZewenSelf-EvaluationLarge Language Model Agents

  47. Beyond Global Divergences: A Local-Mass Perspective on Bayesian Inference

    Jun 25, 2026Hanli Xu, Fengxiang He, Sarat MokaBayesian InferenceKullback-Leibler Divergence

  48. AsyncOPD: How Stale Can On-Policy Distillation Be?

    Jun 23, 2026Wonjun Kang, Kevin Galim, Seunghyuk Oh +9Efficient On-Policy DistillationAsynchronous Execution

  49. KLip-PPO: A per-sample KL perspective on PPO-Clip

    Jun 22, 2026Riccardo Colletti, Robin HolzingerProximal Policy OptimizationKullback-Leibler Divergence

  50. StreamKL: Fast and Memory-Efficient KL Divergence for Boosting Attention Distillation

    Jun 18, 2026Guangda Liu, Yiquan Wang, Chengwei Li +6Dataset DistillationKullback-Leibler Divergence

  51. QMaxCal: Path-Space Regularization for Open Quantum Control via Girsanov's Theorem

    Jun 18, 2026Merijn Moody, Zier Mensch, Miranda C. N. Cheng +2Kullback-Leibler RegularizationKullback-Leibler Divergence