LLM Pruning

LLM: Large Language Model

Momentum

12 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 113

All topics
CardsList
  1. Revisiting the Effectiveness of LLM Pruning for Test-Time Scaling

    Apr 28, 2026Ocean Monjur, Shahriar Kabir Nahin, Anshuman ChhabraLLM PruningTest-Time Scaling

  2. Rethinking Layer Redundancy: Calibration Matters More Than Search in LLM Depth Pruning

    Apr 27, 2026Minkyu Kim, Vincent-Daniel Yun, Youngrae Kim +3LLM PruningLLM Inference Acceleration

  3. DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference

    Apr 27, 2026Zahra Dehghanighobadi, Asja FischerLLM PruningKV Caching

  4. Pruning via Causal Attribution Preserves Reasoning Performance in Large Language Models

    Apr 27, 2026Amogh Sheth, Biruk Assefa, Yi Wen Huang +2LLM PruningSelf-Attention

  5. Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers

    Apr 26, 2026Audrey Cherilyn, Houman SafaaiTransformer InterpretabilityLLM Pruning

  6. GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models

    Apr 21, 2026Ziyang Wang, Jiangfeng Xiao, Chuan Xiao +3LLM PruningLLM Compression

  7. CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning

    Apr 19, 2026Yangsong Lan, Hongliang Dai, Piji LiLLM PruningLLM Compression

  8. Optimizing Korean-Centric LLMs via Token Pruning

    Apr 17, 2026Hoyeol Kim, Hyeonwoo KimMultilingual Language Model EvaluationLLM Pruning

  9. Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs

    Apr 17, 2026Wai Man Si, Mingjie Li, Michael Backes +1LLM PruningLLM Safety Alignment

  10. MOONSHOT : A Framework for Multi-Objective Pruning of Vision and Large Language Models

    Apr 14, 2026Gabriel Afriat, Xiang Meng, Shibal Ibrahim +2LLM PruningNeural Network Pruning

  11. Measuring the Redundancy of Decoder Layers in SpeechLLMs

    Mar 5, 2026Adel Moumen, Guangzhi Sun, Philip C WoodlandLLM PruningTransformer

  12. Curvature-Weighted Capacity Allocation: A Minimum Description Length Framework for Layer-Adaptive Large Language Model Optimization

    Mar 1, 2026Theophilus Amaefuna, Hitesh Vaidya, Anshuman Chhabra +1LLM PruningLLM Compression

  13. Garbage Attention in Large Language Models: BOS Sink Heads and Sink-aware Pruning

    Jan 11, 2026Jaewon Sok, Jewon Yeom, Seonghyeon Park +2LLM PruningAttention Head Analysis

  14. Data-Free Pruning of Self-Attention Layers in LLMs

    Dec 3, 2025Dhananjay Saikumar, Blesson VargheseLLM PruningLLM Compression

  15. PATCH: Learnable Tile-level Hybrid Sparsity for LLMs

    Sep 27, 2025Younes Hourri, Mohammad Mozaffari, Maryam Mehri DehnaviLLM PruningLLM Compression

  16. A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone

    May 19, 2025Jitai Hao, Qiang Huang, Hao Liu +3Language Model PretrainingLLM Pruning

  17. Adaptive GoGI-Skip: Coupling Goal-Gradient Importance with Dynamic Uncertainty for Efficient Reasoning

    May 13, 2025Ren ZhuangGradient-Based AttributionLLM Pruning

  18. DarwinLM: Evolutionary Structured Pruning of Large Language Models

    Feb 11, 2025Shengkun Tang, Oliver Sieberling, Eldar Kurtic +2LLM PruningStructured Pruning

  19. LLM Compression by Block Removal with Constrained Binary Optimization

    Date pendingDavid Jansen, Roman Rausch, Ali Hashemi +2LLM PruningLLM Compression