Large Language Model Compression

Latest papers 134

All topics
CardsList
  1. The Functional Structure of Post-Compression Recovery in Low-Rank LLMs

    Oct 4, 2026Zishan Shao, Liang Tian, Georgiy Zemlevskiy +10Large Language Model CompressionLow-Rank Structure

  2. MWOP: Modality-aware Width-wise Operation Pruning for Efficient MLLMs

    Oct 1, 2026Xudong Wang, Hao Wu, Haozhe Hu +5Visual Token PruningLarge Language Model Compression

  3. Sequential Functional Structured Tucker Compression for Large Language Model Attentions

    Sep 30, 2026Jiangfeng Chen, Xinyu Wang, Tianshuo Yan +4Large Language Model CompressionTask-Aware Compression

  4. Learning Functional Subspaces for Neural Network Compression

    Sep 30, 2026Massimo Bini, Anders Christensen, Stephan Alaniz +5Large Language Model CompressionSubspace

  5. IrekoGPT: Turning Structured Pruning into Post-Hoc Slimmable LLMs

    Sep 30, 2026Pietro Moriello, Pietro Buzzega, Angelo Porrello +1Large Language Model CompressionStructured Pruning

  6. PatchKV: Weight-Space Compensation of KV Cache

    Sep 30, 2026Chanryeol Lee, Chanhyuk Lee, Yeonwoo Choi +2Key-Value Cache CompressionKey-Value Cache

  7. GleanVID: Complementary Token Selection for Efficient Video Large Language Models

    Sep 29, 2026Shuo Yang, Changbai Li, Rui Tang +3Video-Language ModelsLong Videos

  8. Output-aware Residual Stream Pruning for Large Language Models

    Sep 28, 2026Chayne Thrash, Kevin Chen, Soheil KolouriLarge Language Model CompressionUnstructured Pruning

  9. GroupMask: Layer-Adaptive Group-wise Sparsity for Semi-Structured LLM Pruning

    Sep 27, 2026Zhengao Li, Shuoqiu Li, Xiaofang Zhang +7Unstructured PruningLarge Language Model Compression

  10. Layer-wise Curriculum Learning for Efficient LLM Compression

    Sep 16, 2026Donggeon Lee, Dooyeon Na, Seungmin Oh +1Large Language Model CompressionAdaptive Curriculum

  11. Per-Matrix Optimality Is Not Enough: Three-Level Optimization for Low-Rank LLM Compression

    Sep 14, 2026Huicheng Zhang, Xiyao Feng, Ze-Tong Li +6Large Language Model CompressionSingular Value Decomposition

  12. ESTS at WMT26: Routing-Informed Expert Pruning for Model Compression

    Sep 14, 2026Liu O. Martin, Lucas Bandarkar, Nanyun PengLarge Language Model CompressionData Compression Methods

  13. LILA: Calibration-Free Structured Pruning of Large Language Models via Latent Spectral Geometry

    Sep 11, 2026Sankar Behera, Dhruv Singh, Anshika Agnihotri +3Large Language Model CompressionUnstructured Pruning

  14. Forward-Free LLM Depth Pruning via Weight Redundancy

    Sep 9, 2026Vincent-Daniel Yun, Woosang LimUnstructured PruningLarge Language Model Compression

  15. LatentPress: Context Compression Beyond Text and Vision

    Sep 1, 2026Zhengze Zhou, Hejian SangEfficient Long-Context InferenceLarge Language Model Compression

  16. Residual Sparsification via Output Importance for Compressing Mixture-of-Experts LLMs

    Sep 1, 2026Seungwoo Jung, Dohyeok Kwon, Seungmin Cha +4Large Language Model CompressionImportance

  17. Tensor Methods for Language Models: From Token Representation to Training, Adaptation, Inference, Compression, and Interpretability

    Aug 31, 2026Matvei Tarasov, Salman Ahmadi-Asl, Andre L. F. de Almeida +1Large Language Model CompressionTensor Networks

  18. Unifying Depth and Width Pruning for LLMs via Binary Knapsack Optimization

    Aug 13, 2026Palaash Goel, Ayan Sengupta, Akshay Nambi +1Large Language Model CompressionStructured Pruning

  19. LegoLM: Structured Weight Sharing for Large Language Models

    Aug 9, 2026Joseph BinghamLarge Language Model CompressionModel Weights

  20. Shape Mutating Expert Compression:LorExperts and BTExperts

    Aug 7, 2026Inesh Chakrabarti, Sourjya Roy, Bowen Bao +3Mixture-Of-Experts Large Language ModelsExperts

  21. Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

    Aug 7, 2026Minseok Kang, Hyunwoo Kim, Chanyoung Kim +3Visual Token PruningLarge Language Model Compression

  22. Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving

    Aug 4, 2026Xiang Li, Pengcheng Wang, Huazheng Wang +1Low-Rank Adaptation AdaptersHip-Lora

  23. Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression

    Aug 4, 2026Angelo Nardone, Paolo FerraginaLarge Language Model CompressionData Compression Methods

  24. AnchorKV: Anchor-Residual KV Cache Compression

    Aug 3, 2026Malik Khalaf, Yara Shamshoum, Nitzan Hodos +2Key-Value Cache CompressionKey-Value Cache

  25. Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

    Aug 3, 2026Long Qian, Jiaqi Wei, Bingke Zhu +2Large Language Model CompressionLearned Image Compression

  26. S4^4R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching

    Aug 1, 2026Jialong Han, You Wu, Kewei TuKey-Value Cache CompressionKey-Value Cache

  27. Lost in Compaction: Evaluating Side-Constraint Loss under Context Compaction

    Jul 31, 2026Zhiqi Wang, Yichi Zhang, Dongwon Lee +1CompactionLarge Language Model Compression

  28. LLM-based Source Code Compression via Thresholded Symbol Ranking

    Jul 27, 2026Angelo Nardone, Paolo FerraginaLarge Language Model CompressionTask-Aware Compression

  29. CoCurve: Cross-Module Co-Pruning Curvature for Training-Free Structured LLM Pruning

    Jul 20, 2026Zhiren Gong, Zihao Zeng, Zijie Wang +3Structured PruningLarge Language Model Compression

  30. A JoLT for the KV cache: Near-Lossless KV Cache Compression via Joint Rank-bit Allocation

    Jul 14, 2026Rahul Krishnan, Volker SchulzKey-Value Cache CompressionKey-Value Cache

  31. CARE-LoRA: Compressed Activation REconstruction for Memory-Efficient LoRA

    Jul 11, 2026Gengyu Zhang, Haiyin Ran, Zhengbao He +4Low-Rank Adaptation FrameworkLarge Language Model Compression

  32. BiSCo-LLM: Lookup-Free Binary Spherical Coding for Extreme Low-Bit Large Language Model Compression

    Jul 9, 2026Yuantian Shao, Peisong Wang, Zhilei Liu +6Large Language Model Compression

  33. Prompt Compression via Activation Aggregation

    Jul 9, 2026Thibaud Ardoin, Semira Einsele, Evis Bregu +1Large Language Model CompressionInstruction-Tuned Models

  34. LUMI: Tokenizer-Agnostic LLM-Based Lossless Image Compression

    Jul 9, 2026Chris Xing Tian, Chengkai Wu, Ziyu Wang +6Learned Image CompressionLarge Language Model Compression

  35. What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents

    Jul 9, 2026Ashwin Gerard Colaco, Nada LahjoujiCompactionLarge Language Model Memory

  36. LACE-SVD: Loss-Aware SVD with Cumulative Error Correction for LLM Compression

    Jul 3, 2026Zhuowen Liu, Longkun Hao, Shiyu Feng +3Large Language Model CompressionSingular Value Decomposition

  37. MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression

    Jul 1, 2026Sheng Qiang, Ruiwei Chen, Yinpeng Wu +5Key-Value Cache CompressionLarge Language Model Compression

  38. CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield

    Jun 30, 2026Dohyeon Kwon, Youngjin ParkLarge Language Model CompressionLoss Function

  39. SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

    Jun 25, 2026Haoqian Meng, Yilun Luo, Yafei Zhao +4Large Language Model QuantizationLarge Language Model Compression

  40. SVD-Surgeon: Optimal Singular-Value Surgery for Large Language Model Compression

    Jun 22, 2026Mahmoud Safari, Frank HutterLarge Language Model CompressionSingular Value Decomposition

  41. UniRank: Unified Rank Allocation for Low-Rank LLM Compression

    Jun 20, 2026Chao Han, Yongjie Du, Junjie Tan +1Large Language Model CompressionTask-Aware Compression