LLM Compression

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 92% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 170

All topics
CardsList
  1. OrBIT: Structure-Guided Embedding Compression

    Oct 7, 2026Yunied Puig, Amit Kumar JaiswalEmbedding CompressionLLM Compression

  2. Activation-Aware Weight Tensorization: A Calibration-Time Preconditioner for Tensor-Network LLM Compression

    Oct 7, 2026Alessandro Beatini, Marco Maronese, Emanuele RodolàLLM CompressionTensor Networks

  3. Shared Low-rank Basis Factorization for Data-free Mixture-of-Experts Compression

    Oct 7, 2026Tianxiao Cao, Jiahe Shao, Yuning Qiu +3LLM CompressionMixture-of-Experts Language Models

  4. A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention

    Oct 6, 2026Davis Wertheimer, Haochen Shen, Ahan Gupta +6KV-Cache CompressionTransformer Attention

  5. The Optimization Landscape of Learning Compacted Context Models

    Oct 5, 2026Thomas Villeneuve, Alex Sandomirsky, Charles O'Neill +2LLM CompressionKV-Cache Compression

  6. The Functional Structure of Post-Compression Recovery in Low-Rank LLMs

    Oct 4, 2026Zishan Shao, Liang Tian, Georgiy Zemlevskiy +10LLM CompressionLow-Rank Compression

  7. ITC-MoE: Importance-guided Token-aware Compression for MoE Diffusion Language Models

    Oct 1, 2026Lianjun Liu, Shipeng Li, You Huang +5Mixture-of-Experts Language ModelsLLM Compression

  8. Sequential Functional Structured Tucker Compression for Large Language Model Attentions

    Sep 30, 2026Jiangfeng Chen, Xinyu Wang, Tianshuo Yan +4LLM CompressionDecoder-Only Language Models

  9. How Divergence Becomes Decision Flips in Compressed Language Models

    Sep 30, 2026Beatriz Almeida FelicioLLM EvaluationLLM Compression

  10. Learning Functional Subspaces for Neural Network Compression

    Sep 30, 2026Massimo Bini, Anders Christensen, Stephan Alaniz +5LLM CompressionLow-Rank Matrix Decomposition

  11. IrekoGPT: Turning Structured Pruning into Post-Hoc Slimmable LLMs

    Sep 30, 2026Pietro Moriello, Pietro Buzzega, Angelo Porrello +1LLM CompressionLLM Inference Acceleration

  12. MoRA: MoE Pruning via Router Bias Learning and Expert Approximation

    Sep 30, 2026Yushuai Sun, Zikun Zhou, Lin Gao +2Mixture-of-Experts PruningLLM Compression

  13. Security-Enhanced Seed-Based Weight Quantization for Large Language Models

    Sep 29, 2026Qiuyu Ren, Sudipta Paria, Aritra Dasgupta +1LLM QuantizationLLM Compression

  14. Output-aware Residual Stream Pruning for Large Language Models

    Sep 28, 2026Chayne Thrash, Kevin Chen, Soheil KolouriLLM PruningLLM Compression

  15. GroupMask: Layer-Adaptive Group-wise Sparsity for Semi-Structured LLM Pruning

    Sep 27, 2026Zhengao Li, Shuoqiu Li, Xiaofang Zhang +7LLM PruningLLM Compression

  16. RAZOR: Pruning Replaceable Experts in LLMs

    Sep 24, 2026Mingyang Song, Mao ZhengMixture-of-Experts PruningLLM Pruning

  17. Distilling Sequential Computation in Transformer Language Models

    Sep 23, 2026Zixuan Lan, Jessica Yang, Yanhong Li +2LLM CompressionLong-Context Language Model Inference

  18. Higher-order pruning of experts in mixture-of-experts language models

    Sep 16, 2026Alex M. Tseng, Prannay Kaul, Luca Zancato +2Mixture-of-Experts PruningMixture-of-Experts Language Models

  19. Layer-wise Curriculum Learning for Efficient LLM Compression

    Sep 16, 2026Donggeon Lee, Dooyeon Na, Seungmin Oh +1LLM CompressionCurriculum Learning

  20. Breaking the 1.58-bit Barrier for Ternary LLMs

    Sep 14, 2026Evangelos Georganas, Alexander Heinecke, Pradeep DubeyTernary QuantizationLLM Compression

  21. Per-Matrix Optimality Is Not Enough: Three-Level Optimization for Low-Rank LLM Compression

    Sep 14, 2026Huicheng Zhang, Xiyao Feng, Ze-Tong Li +6Model CompressionLLM Compression

  22. To Each Language Its Tokenizer: Modular Tokenizers for Efficient Multilingual LLMs

    Sep 14, 2026Franck Signe, Hippolyte Pilchen, François Yvon +1Multilingual Language ModelsLLM Compression

  23. Dynamic Semantic Compression for Efficient Latent-Space Inference in Large Language Models

    Sep 14, 2026Peipei Li, Dongsen Zhang, Yuchen Liu +1LLM CompressionLLM Inference

  24. LILA: Calibration-Free Structured Pruning of Large Language Models via Latent Spectral Geometry

    Sep 11, 2026Sankar Behera, Dhruv Singh, Anshika Agnihotri +3LLM PruningLLM Compression

  25. Train What You Deploy: Closing the MLP Reachability Gap in Low-Rank Clone Distillation

    Sep 2, 2026Wenhui Chen, Zhifeng Li, Jie Zhou +5LLM CompressionLanguage Model Distillation

  26. Residual Sparsification via Output Importance for Compressing Mixture-of-Experts LLMs

    Sep 1, 2026Seungwoo Jung, Dohyeok Kwon, Seungmin Cha +4Mixture-of-Experts Language ModelsLLM Compression

  27. TopoCompress: Long Context Compression via Graph-Wired Semantic Trajectories

    Aug 31, 2026Daniel Agyei Asante, Yang LiLLM CompressionLong-Context QA

  28. Tensor Methods for Language Models: From Token Representation to Training, Adaptation, Inference, Compression, and Interpretability

    Aug 31, 2026Matvei Tarasov, Salman Ahmadi-Asl, Andre L. F. de Almeida +1LLM CompressionLLM Inference Acceleration

  29. LaMoC: Loss-Aware Modular Compression for LLMs

    Aug 31, 2026Mohanad Odema, Jacob SongModel CompressionLLM Compression

  30. Benchmarking Trustworthiness of SLMs: Pre-trained vs. Compressed

    Aug 12, 2026Haokun Lin, Kaijie Zhu, Haobo Xu +4LLM QuantizationLLM Pruning

  31. Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging

    Aug 11, 2026Linh Dieu Le, Tong Chen, Shazia Sadiq +3LLM CompressionLarge Language Model-Based Recommendation

  32. LegoLM: Structured Weight Sharing for Large Language Models

    Aug 9, 2026Joseph BinghamLLM QuantizationLLM Compression

  33. Relevant but Incomplete: Referential Dangling as a Paradigm-Level Failure Mode in Hard Prompt Compression

    Aug 5, 2026Zhengpei Hu, Kai Li, Dapeng Fu +5LLM CompressionLong-Context Inference

  34. ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

    Aug 3, 2026Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali YukselLLM QuantizationLLM Compression

  35. Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

    Jul 24, 2026Hao Wang, Kun Yuan, Wenlin Zhong +4Cross-Tokenizer Knowledge DistillationLLM Compression

  36. Progressive Cramming: Reliable Token Compression and What It Reveals

    Jul 23, 2026Dmitrii Tarasov, Timofei Lashukov, Elizaveta Goncharova +1LLM CompressionEmbedding Compression

  37. CoCurve: Cross-Module Co-Pruning Curvature for Training-Free Structured LLM Pruning

    Jul 20, 2026Zhiren Gong, Zihao Zeng, Zijie Wang +3LLM PruningLLM Compression

  38. SALT: Salience-Aware Lexical Trie for Long-Context Compression

    Jul 20, 2026Oteo Mamo, Hyunjin Yi, Joydhriti Choudhury +2LLM CompressionLong-Context Language Model Inference

  39. A Survey on the Green Development of Large Models: From Resource-Efficient Architectures to Hardware-Software Co-Design

    Jul 10, 2026Linhui Xiao, Guiping Cao, Mingyue Guo +6LLM CompressionEnergy-Efficient ML

  40. SLORR: Simple and Efficient In-Training Low-Rank Regularization

    Jul 9, 2026David González-Martínez, Shiwei LiuLLM CompressionLow-Rank Matrix Decomposition

  41. BiSCo-LLM: Lookup-Free Binary Spherical Coding for Extreme Low-Bit Large Language Model Compression

    Jul 9, 2026Yuantian Shao, Peisong Wang, Zhilei Liu +6LLM CompressionWeight-Only Quantization

  42. It Takes a MAESTRO To Prune Bad Experts

    Jul 9, 2026Palaash Goel, Ayush Maheshwari, Tanmoy ChakrabortyMixture-of-Experts PruningLLM Pruning

  43. Structured Pruning of Large Language Models via Power Transformation and Sign-Preserving Score Aggregation with Adaptive Feature Retention

    Jul 9, 2026Ryota Kobayashi, Tsubasa Hirakawa, Takayoshi Yamashita +4LLM PruningLLM Compression