LLM Compression

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 92% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 178

All topics
CardsList
  1. Joint Structural Pruning and Mixed-Precision Quantization for LLM Compression

    Jun 5, 2026Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi +1Mixed-Precision QuantizationLLM Quantization

  2. SigmaScale: LLM Compression with SVD-based Low-Rank Decomposition and Learned Scaling Matrices

    Jun 5, 2026Ernests Lavrinovics, Marco Letizia, Roy Janco +3Model CompressionLLM Compression

  3. LLMCodec: Adapting Video Codecs for Efficient Weight Compression of Large Language Models

    Jun 4, 2026Rui Wang, Yan Zhao, Li Song +1Model CompressionLLM Quantization

  4. Learned Subspace Compression for Communication-Efficient Pipeline Parallelism

    Jun 3, 2026Paul Janson, Edouard Oyallon, Eugene BelilovskyLLM CompressionCommunication-Efficient Distributed Training

  5. TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-Experts

    Jun 3, 2026Jiangyang He, Shaolin Zhu, Deyi XiongMixture-of-Experts PruningLLM Pruning

  6. Entropy Gate: Entropy Quenching for Near-Lossless Token Compression in LLM Pipelines

    Jun 2, 2026Justice Owusu Agyemang, Jerry John Kponyo, Kwame Opuni-Boachie Obour Agyekum +3LLM CompressionToken Pruning

  7. LLM Compression with Jointly Optimizing Architectural and Quantization choices

    Jun 2, 2026Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi +1Mixed-Precision QuantizationLLM Quantization

  8. Rethinking the Role of Tensor Decompositions in Post-Training LLM Compression

    Jun 2, 2026Artur Zagitov, Alexander Miasnikov, Maxim Krutikov +5LLM CompressionTensor Decomposition

  9. LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection

    Jun 2, 2026Liulu He, XuanAng Liu, Juntao Liu +8LLM QuantizationLLM Compression

  10. From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

    Jun 1, 2026Elia Cunegatti, Marcus Vukojevic, Erik Nielsen +1LLM PruningLLM Compression

  11. Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction

    Jun 1, 2026Yujia Tong, Yuxi Wang, Yunyang Wan +3LLM QuantizationLLM Evaluation

  12. LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning

    May 31, 2026Mengmeng Ji, Ravi Shanker Raju, Jonathan Lingjie Li +1LLM CompressionLLM Fine-Tuning

  13. Reasoning-preserved Efficient Distillation of Large Language Models via Activation-aware Initialization

    May 28, 2026Junlin He, Yihong Tang, Tong Nie +5LLM PruningLLM Compression

  14. Apertus LLM Family Expansion via Distillation and Quantization

    May 27, 2026Andrei Panferov, Davit Melikidze, Martin Jaggi +1LLM QuantizationLLM Compression

  15. Knowledge Offloading: Decomposing LLMs into Sparse Backbones and Memory Modules

    May 27, 2026Karim Galliamov, Rochelle Choenni, Ivan TitovLLM PruningLLM Compression

  16. Thinking as Compression: Your Reasoning Model is Secretly a Context Compressor

    May 27, 2026Guoxin Ma, Yibing Liu, Chengzhengxu Li +7LLM CompressionLong-Context Inference

  17. Pruning and Distilling Mixture-of-Experts into Dense Language Models

    May 27, 2026Junhyuck Kim, Jihun Yun, Haechan Kim +3Mixture-of-Experts PruningLLM Pruning

  18. ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay

    May 27, 2026Zhexin Hu, Li Wang, Xiaohan Wang +4LLM CompressionReinforcement Learning with Verifiable Rewards

  19. Extracting Small Translation Specialists from LLMs by Aggressively Pruning Experts

    May 27, 2026Liu O. Martin, Lucas Bandarkar, Nanyun PengMixture-of-Experts PruningLLM Pruning

  20. Locality-Aware Redundancy Pruning for LLM Depth Compression

    May 27, 2026Vincent-Daniel Yun, Youngrae Kim, Woosang Lim +3LLM PruningLLM Compression

  21. Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

    May 26, 2026Wenhui Tan, Minghao Li, Xiaoqian Ma +5Multi-Token PredictionLLM Compression

  22. AGORA: Adapter-Grounded Observation-Action Retention for Inference-Free Prompt Compression in LLM Agents

    May 26, 2026Haoran Zhang, Zhaohua SunLLM CompressionLLM Agents

  23. Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling

    May 26, 2026Fengfa Li, Hongjin Ji, Yifeng Ding +2Mixture-of-Experts PruningLLM Pruning

  24. The Bridge-Garden Dilemma in LLM Distillation: Why Mixing Hard and Soft Labels Works

    May 25, 2026Guanghui Wang, Kaiwen Lv Kacuila, Zhiyong Yang +5LLM CompressionLanguage Model Distillation