LLM Compression

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 92% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 178

All topics
CardsList
  1. PALS: Percentile-Aware Layerwise Sparsity for LLM Pruning

    Jul 8, 2026Yazdan Jamshidi, Alexey ShvetsLLM PruningLLM Compression

  2. Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs

    Jul 5, 2026Akhiad Bercovich, Talor Abramovich, Daniel Afrimi +67Mixture-of-Experts PruningLLM Pruning

  3. LACE-SVD: Loss-Aware SVD with Cumulative Error Correction for LLM Compression

    Jul 3, 2026Zhuowen Liu, Longkun Hao, Shiyu Feng +3Model CompressionLLM Compression

  4. Parameter Golf: What Really Works?

    Jul 1, 2026Prashanna Mani Paudel, Shivanand Venkanna SheshappanavarLLM EvaluationLLM Compression

  5. GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache

    Jul 1, 2026Soosung Kim, Minjae Park, Eui-Young Chung +1LLM CompressionResidual VQ

  6. CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield

    Jun 30, 2026Dohyeon Kwon, Youngjin ParkMixture-of-Experts Language ModelsLLM Compression

  7. When Summaries Distort Decisions: Information Fidelity in LLM-Compressed Financial Analysis

    Jun 28, 2026Hoyoung Lee, Suhwan Park, Seunghan Lee +15LLM CompressionLLM Auditing

  8. DLR: Zero-Inference-Cost Latent Residuals for Low-Rank Pre-Training

    Jun 27, 2026Dong Wang, Wenwu Tang, Yun Cheng +1Language Model PretrainingLLM Compression

  9. MultiHashFormer: Hash-based Generative Language Models

    Jun 26, 2026Huiyin Xue, Atsuki Yamaguchi, Nikolaos AletrasLLM CompressionDecoder-Only Language Models

  10. FlexMoE: One-for-All Nested Intra-Expert Pruning for MoE Language Models

    Jun 26, 2026Fan Mo, Yuxuan Han, Geng Zhang +2Mixture-of-Experts PruningLLM Pruning

  11. CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs

    Jun 25, 2026Shigeng Wang, Chao Li, Yangyuxuan Kang +2LLM QuantizationTernary Quantization

  12. Scaling Laws for Task-Specific LLM Distillation

    Jun 23, 2026Lavinia Ghita, Dhruv Desai, Ioana BoierLLM PruningLLM Compression

  13. CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

    Jun 23, 2026Morayo Danielle Adeyemi, Ryan A. Rossi, Franck DernoncourtLLM EvaluationLLM Compression

  14. SVD-Surgeon: Optimal Singular-Value Surgery for Large Language Model Compression

    Jun 22, 2026Mahmoud Safari, Frank HutterLLM PruningLLM Compression

  15. TALAS: Teacher-Anchored Layer Alignment with Adaptive Sharpness-Aware Minimization for Embedding Distillation

    Jun 20, 2026Quoc Phong Dao, Hoang Son Nguyen, Pham Khanh Chi +4LLM CompressionLanguage Model Distillation

  16. UniRank: Unified Rank Allocation for Low-Rank LLM Compression

    Jun 20, 2026Chao Han, Yongjie Du, Junjie Tan +1LLM CompressionLow-Rank Matrix Decomposition

  17. Activation- and Influence-Aware Ranks (AIR): Function-Preserving SVD Compression for LLMs

    Jun 18, 2026Nico Harder, Daniel Becking, Karsten Mueller +1LLM CompressionLow-Rank Matrix Decomposition

  18. Dual Dimensionality for Local and Global Attention

    Jun 17, 2026Zhiyuan Wang, Xuan Luo, Sirui Zeng +1LLM CompressionDecoder-Only Language Models

  19. Ternary Mamba: Grouped Quantization-Aware Training of W1.58A16 State Space Models

    Jun 16, 2026Ramprasath Ganesaraja, Sahil Dilip Panse, Swathika NLLM QuantizationTernary Quantization

  20. The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

    Jun 16, 2026Rui Wen, Lu Sun, Jiayang Liu +3Open-Ended GenerationLLM Evaluation

  21. Persona-Pruner: Sculpting Lightweight Models for Role-Playing

    Jun 12, 2026Jinsu Kim, Jihoon Tack, Noah Lee +1LLM PruningLarge Language Model-Based Role-Play Simulation

  22. Adaptive Multi-Resolution Procedural Knowledge Compression for Large Language Models

    Jun 10, 2026Changyue Wang, Weihang Su, Qingyao Ai +5LLM CompressionEfficient Language Model Inference

  23. Continual LLM Upcycling: A Predictor-Gated Bank-Wise Sparsity Training Recipe for Dense-to-Sparse LLMs

    Jun 9, 2026Ruixuan Huang, Jinyuan Shi, Hantao Huang +5Continual Learning for LLMsLLM Compression

  24. End-to-End Context Compression at Scale

    Jun 8, 2026Ang Li, Sean McLeish, Haozhe Chen +12LLM CompressionLong-Context Language Model Inference

  25. EinSort: Sorting is All We Need for Tensorizing LLM

    Jun 7, 2026Toshiaki Koike-Akino, Jing Liu, Ye WangTensor NetworksLLM Compression

  26. Tensorizing Engram: Sharing Latents Across N-Gram Embeddings is Beneficial in LLMs

    Jun 6, 2026Wuyang Zhou, Yuxuan Gu, Giorgos Iacovides +3Text EmbeddingsLLM Compression