LLM Compression

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 92% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 178

All topics
CardsList
  1. A general tensor-structured compression scheme for efficient large language models

    May 25, 2026Ying Lu, Peng-Fei Zhou, Qi-Xuan Fang +3LLM Inference EfficiencyLLM Compression

  2. Skill Weaving: Efficient LLM Improvement via Modular Skillpacks

    May 21, 2026Zhuo Li, Guodong Du, Zesheng Shi +5LLM CompressionLLM Inference Acceleration

  3. Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA

    May 18, 2026Sterling Huang, Abigayle Brown, Jiyoo Noh +4LLM EvaluationLLM Compression

  4. IO-SVD: Input-Output Whitened SVD for Adaptive-Rank LLM Compression

    May 15, 2026Ali Abbasi, Chayne Thrash, Haoran Qin +2LLM CompressionLow-Rank Matrix Decomposition

  5. Ghosted Layers: Unconstrained Activation Alignment for Recovering Layer-Pruned LLMs

    May 15, 2026Vincent-Daniel Yun, Junhyuk Jo, Sai Praneeth Karimireddy +1LLM PruningLLM Compression

  6. From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction

    May 12, 2026Mingcheng Zhu, Zhiyao Luo, Yu Liu +1LLM CompressionClinical Prediction

  7. Efficient LLM-based Advertising via Model Compression and Parallel Verification

    May 12, 2026Wenxin Dong, Chang Gao, Guanghui Yu +9LLM QuantizationLLM Compression

  8. ReAD: Reinforcement-Guided Capability Distillation for Large Language Models

    May 11, 2026Xueqi Cheng, Xugui Zhou, Tyler Derr +1LLM CompressionLanguage Model Distillation

  9. SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding

    May 11, 2026Anton Plaksin, Sergei Krutikov, Sergei Skvortsov +1LLM CompressionSpeculative Decoding

  10. Beyond Position Bias: Shifting Context Compression from Position-Driven to Semantic-Driven

    May 10, 2026Jiwei Tang, Zhijing Huang, Xinyu Zhang +5LLM CompressionPosition Bias

  11. RuPLaR : Efficient Latent Compression of LLM Reasoning Chains with Rule-Based Priors From Multi-Step to One-Step

    May 10, 2026Xiaocheng Luo, Kang Wang, Zaifu Zhan +2LLM CompressionCoT Compression

  12. Different Prompts, Different Ranks: Prompt-aware Dynamic Rank Selection for SVD-based LLM Compression

    May 9, 2026Hengyi Zhu, Zhendong Mi, Grace Li Zhang +1LLM CompressionLow-Rank Matrix Decomposition

  13. FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast

    May 8, 2026Wenhao Wu, Zishan Shao, Kangning Cui +5Efficient Transformer InferenceLLM Compression

  14. Star Elastic: Many-in-One Reasoning LLMs with Efficient Budget Control

    May 8, 2026Ali Taghibakhshi, Ruisi Cai, Saurav Muralidharan +17LLM CompressionLLM Post-Training

  15. Layer Collapse in Diffusion Language Models

    May 7, 2026Alexander Conzelmann, Albert Catalan-Tatjer, Shiwei LiuLLM CompressionDiffusion Language Models

  16. HCInfer: An Efficient Inference System via Error Compensation for Resource-Constrained Devices

    May 7, 2026Shen Xu, Xiangwen Zhuge, Zhe Xu +3LLM CompressionMemory-Efficient Inference

  17. Telegraph English: Semantic Prompt Compression via Structured Symbolic Rewriting

    May 6, 2026Mikhail L. Arbuzov, Sisong Bei, Ziwei Dong +2LLM CompressionPrompt Compression

  18. Budgeted LoRA: Distillation as Structured Compute Allocation for Efficient Inference

    May 5, 2026Mohammed Sabry, Anya BelzLLM CompressionLow-Rank Adaptation

  19. Complexity Horizons of Compressed Models in Analog Circuit Analysis

    May 4, 2026Pacome Simon MbonimpaLLM EvaluationLLM Compression

  20. EGAD: Entropy-Guided Adaptive Distillation for Token-Level Knowledge Transfer

    May 3, 2026Hao Zhang, Zhibin Zhang, Guangxin Wu +3LLM CompressionLanguage Model Distillation

  21. Importance-Guided Basis Selection for Low-Rank Decomposition of Large Language Models

    May 2, 2026Daniel Agyei Asante, Ernie Chang, Yang LiLLM PruningLLM Compression

  22. Activation Compression in LLMs: Theoretical Analysis and Efficient Algorithm

    May 2, 2026Wen-Da Wei, Han-Bin Fang, Yang-Di Liu +3LLM CompressionGradient Compression

  23. Carbon-Taxed Transformers: A Green Compression Pipeline for Overgrown Language Models

    Apr 28, 2026Ajmain Inqiad Alam, Palash Roy, Chanchal K. Roy +2Software EngineeringLLM Compression

  24. From Similarity to Structure: Training-free LLM Context Compression with Hybrid Graph Priors

    Apr 25, 2026Yitian Zhou, Chaoning Zhang, Jiaquan Zhang +6LLM CompressionLong-Context Language Model Inference

  25. Hyperloop Transformers

    Apr 23, 2026Abbas Zeitoun, Lucas Torroba-Hennigen, Yoon KimLLM CompressionHyper-Connections