LLM Compression

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 92% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 178

All topics
CardsList
  1. Train What You Deploy: Closing the MLP Reachability Gap in Low-Rank Clone Distillation

    Sep 2, 2026Wenhui Chen, Zhifeng Li, Jie Zhou +5LLM CompressionLanguage Model Distillation

  2. Residual Sparsification via Output Importance for Compressing Mixture-of-Experts LLMs

    Sep 1, 2026Seungwoo Jung, Dohyeok Kwon, Seungmin Cha +4Mixture-of-Experts Language ModelsLLM Compression

  3. TopoCompress: Long Context Compression via Graph-Wired Semantic Trajectories

    Aug 31, 2026Daniel Agyei Asante, Yang LiLLM CompressionLong-Context QA

  4. Tensor Methods for Language Models: From Token Representation to Training, Adaptation, Inference, Compression, and Interpretability

    Aug 31, 2026Matvei Tarasov, Salman Ahmadi-Asl, Andre L. F. de Almeida +1LLM CompressionLLM Inference Acceleration

  5. LaMoC: Loss-Aware Modular Compression for LLMs

    Aug 31, 2026Mohanad Odema, Jacob SongModel CompressionLLM Compression

  6. Benchmarking Trustworthiness of SLMs: Pre-trained vs. Compressed

    Aug 12, 2026Haokun Lin, Kaijie Zhu, Haobo Xu +4LLM QuantizationLLM Pruning

  7. Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging

    Aug 11, 2026Linh Dieu Le, Tong Chen, Shazia Sadiq +3LLM CompressionLarge Language Model-Based Recommendation

  8. LegoLM: Structured Weight Sharing for Large Language Models

    Aug 9, 2026Joseph BinghamLLM QuantizationLLM Compression

  9. Relevant but Incomplete: Referential Dangling as a Paradigm-Level Failure Mode in Hard Prompt Compression

    Aug 5, 2026Zhengpei Hu, Kai Li, Dapeng Fu +5LLM CompressionLong-Context Inference

  10. ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

    Aug 3, 2026Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali YukselLLM QuantizationLLM Compression

  11. Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

    Jul 24, 2026Hao Wang, Kun Yuan, Wenlin Zhong +4Cross-Tokenizer Knowledge DistillationLLM Compression

  12. Progressive Cramming: Reliable Token Compression and What It Reveals

    Jul 23, 2026Dmitrii Tarasov, Timofei Lashukov, Elizaveta Goncharova +1LLM CompressionEmbedding Compression

  13. CoCurve: Cross-Module Co-Pruning Curvature for Training-Free Structured LLM Pruning

    Jul 20, 2026Zhiren Gong, Zihao Zeng, Zijie Wang +3LLM PruningLLM Compression

  14. SALT: Salience-Aware Lexical Trie for Long-Context Compression

    Jul 20, 2026Oteo Mamo, Hyunjin Yi, Joydhriti Choudhury +2LLM CompressionLong-Context Language Model Inference

  15. A Survey on the Green Development of Large Models: From Resource-Efficient Architectures to Hardware-Software Co-Design

    Jul 10, 2026Linhui Xiao, Guiping Cao, Mingyue Guo +6LLM CompressionEnergy-Efficient ML

  16. SLORR: Simple and Efficient In-Training Low-Rank Regularization

    Jul 9, 2026David González-Martínez, Shiwei LiuLLM CompressionLow-Rank Matrix Decomposition

  17. BiSCo-LLM: Lookup-Free Binary Spherical Coding for Extreme Low-Bit Large Language Model Compression

    Jul 9, 2026Yuantian Shao, Peisong Wang, Zhilei Liu +6LLM CompressionWeight-Only Quantization

  18. It Takes a MAESTRO To Prune Bad Experts

    Jul 9, 2026Palaash Goel, Ayush Maheshwari, Tanmoy ChakrabortyMixture-of-Experts PruningLLM Pruning

  19. Structured Pruning of Large Language Models via Power Transformation and Sign-Preserving Score Aggregation with Adaptive Feature Retention

    Jul 9, 2026Ryota Kobayashi, Tsubasa Hirakawa, Takayoshi Yamashita +4LLM PruningLLM Compression