LLM Compression

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 92% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 178

All topics
CardsList
  1. FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression

    Apr 22, 2026Ye Qiao, Yian Wang, Zhiheng Chen +2LLM CompressionGPU Acceleration

  2. GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models

    Apr 21, 2026Ziyang Wang, Jiangfeng Xiao, Chuan Xiao +3LLM PruningLLM Compression

  3. Modular Representation Compression: Adapting LLMs for Efficient and Effective Recommendations

    Apr 20, 2026Yunjia Xi, Menghui Zhu, Jianghao Lin +4LLM CompressionEmbedding Compression

  4. Predicting LLM Compression Degradation from Spectral Statistics

    Apr 20, 2026Mingxue XuLLM CompressionLow-Rank Matrix Decomposition

  5. Neural Garbage Collection: Learning to Forget while Learning to Reason

    Apr 20, 2026Michael Y. Li, Jubayer Ibn Hamid, Emily B. Fox +1LLM CompressionMemory-Efficient Optimization

  6. CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning

    Apr 19, 2026Yangsong Lan, Hongliang Dai, Piji LiLLM PruningLLM Compression

  7. D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation

    Apr 18, 2026Junlin Li, Shuangyong Song, Guodong Du +6LLM QuantizationLLM Compression

  8. Optimizing Korean-Centric LLMs via Token Pruning

    Apr 17, 2026Hoyeol Kim, Hyeonwoo KimMultilingual Language Model EvaluationLLM Pruning

  9. Compressing Sequences in the Latent Embedding Space: KK-Token Merging for Large Language Models

    Apr 16, 2026Zihao Xu, John Harvill, Ziwei Fan +3Token MergingLLM Compression

  10. When Less Latent Leads to Better Relay: Information-Preserving Compression for Latent Multi-Agent LLM Collaboration

    Apr 14, 2026Yiping Li, Zhiyu An, Wan DuLLM CompressionKV Caching

  11. Effective Distillation to Hybrid xLSTM Architectures

    Mar 16, 2026Lukas Hauzenberger, Niklas Schmidinger, Thomas Schmied +7LLM CompressionLanguage Model Distillation

  12. Leech Lattice Vector Quantization for Efficient LLM Compression

    Mar 11, 2026Tycho F. A. van der Ouderaa, Mart van Baalen, Paul Whatmough +1LLM QuantizationLLM Compression

  13. Curvature-Weighted Capacity Allocation: A Minimum Description Length Framework for Layer-Adaptive Large Language Model Optimization

    Mar 1, 2026Theophilus Amaefuna, Hitesh Vaidya, Anshuman Chhabra +1LLM PruningLLM Compression

  14. QTALE: Quantization-Robust Token-Adaptive Layer Execution for LLMs

    Feb 11, 2026Kanghyun Noh, Jinheon Choi, Yulhwa KimLLM QuantizationLLM Compression

  15. Data-Free Pruning of Self-Attention Layers in LLMs

    Dec 3, 2025Dhananjay Saikumar, Blesson VargheseLLM PruningLLM Compression

  16. BudgetMem: Training-Free Selective Memory for Cost-Efficient Long-Context Processing in Language Models

    Nov 7, 2025Chandra Vamsi Krishna Alla, Harish Naidu Gaddam, Manohar Kommi +1LLM CompressionLong-Context Language Model Inference

  17. PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference

    Nov 6, 2025Yushu Zhao, Zheng Wang, Minjia ZhangLLM CompressionMixture-of-Experts Models

  18. Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM

    Oct 7, 2025Ryan Solgi, Parsa Madinei, Jiayi Tian +4Model CompressionLLM Compression

  19. PATCH: Learnable Tile-level Hybrid Sparsity for LLMs

    Sep 27, 2025Younes Hourri, Mohammad Mozaffari, Maryam Mehri DehnaviLLM PruningLLM Compression

  20. CompLLM: Compression for Long Context Q&A

    Sep 23, 2025Gabriele Berton, Jayakrishnan Unnikrishnan, Son Tran +1LLM CompressionLong-Context Language Model Inference

  21. GeLaCo: An Evolutionary Approach to Layer Compression

    Jul 14, 2025David Ponce, Thierry Etchegoyhen, Javier Del SerModel CompressionLLM Compression

  22. Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models

    May 23, 2025Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva +2Model CompressionLLM Compression

  23. A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone

    May 19, 2025Jitai Hao, Qiang Huang, Hao Liu +3Language Model PretrainingLLM Pruning

  24. A Survey of Transformer-based Language Models with Focus on Efficiency

    May 15, 2024Wazib Ansar, Saptarsi Goswami, Amlan ChakrabartiLLM CompressionEnergy-Efficient ML

  25. LLM Compression by Block Removal with Constrained Binary Optimization

    Date pendingDavid Jansen, Roman Rausch, Ali Hashemi +2LLM PruningLLM Compression