Model Compression

Momentum

9 papers in the last four weeks, up 80% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 79

All topics
CardsList
  1. CrossGMN: Graph Metanetworks for Cross-Architecture Weight-Space Transformations

    Oct 1, 2026Adir Dayan, Yam Eitan, Haggai MaronModel CompressionHypernetworks

  2. Toward Elastic Speech Inference: Training-Free Wake-Word Detection from Pretrained ASR

    Oct 1, 2026Hwayeon Kim, Youngwon Choi, Hyeonyu KimModel CompressionSpeech Processing

  3. GeoPair: Geometry-Preserving Cross-Layer Factorization for Training-Free Transformer Compression

    Sep 22, 2026Baher Mohammad, Ammar Ali, Stamatios LefkimmiatisModel CompressionLow-Rank Compression

  4. Artificial Structure Function Search: Preserving Artificial Functional Connectivity for Structured Pruning

    Sep 21, 2026Mindula Illeperuma, Rafael Pina, Charuka Herath +2Model CompressionFunctional Connectivity

  5. FairCompressAgent: An Agentic Framework for Fairness-Aware Model Compression for FPGA Deployment

    Sep 15, 2026Yuanbo Guo, Yiyu ShiModel CompressionAlgorithmic Fairness

  6. Per-Matrix Optimality Is Not Enough: Three-Level Optimization for Low-Rank LLM Compression

    Sep 14, 2026Huicheng Zhang, Xiyao Feng, Ze-Tong Li +6Model CompressionLLM Compression

  7. ESTS at WMT26: Routing-Informed Expert Pruning for Model Compression

    Sep 14, 2026Liu O. Martin, Lucas Bandarkar, Nanyun PengModel CompressionMixture-of-Experts Pruning

  8. Understanding the Impact of Model Pruning on Long-Tail Forgetting and Explanation Reliability in Medical Imaging

    Sep 7, 2026Nazish Khalid, Tausifa Jan Saleem, Amal Saqib +2Model CompressionExplainable Medical Image Analysis

  9. On the Interaction Between Model Compression and Test-Time Adaptation

    Sep 3, 2026Francesco Corti, Dong Wang, Young D. Kwon +2Model CompressionTest-Time Adaptation

  10. Debias-SparseGPT: Bias-Aware Pruning for Large Language Models

    Sep 2, 2026Irina Proskurina, Guillaume Metzler, Antoine Gourru +1LLM PruningNeural Network Pruning

  11. LaMoC: Loss-Aware Modular Compression for LLMs

    Aug 31, 2026Mohanad Odema, Jacob SongModel CompressionLLM Compression

  12. TACTICL: Task-Aware Compression of Tabular ICL Models

    Aug 11, 2026Mykhailo Koshil, Matthias Feurer, Katharina EggenspergerModel CompressionTabular Foundation Models

  13. Tevatron-Elastic: A Unified Abstraction for Training Elastic Retrievers and Rerankers

    Aug 9, 2026Yu Wang, Shengyao Zhuang, Xueguang Ma +4Model CompressionDynamic Neural Networks

  14. APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning

    Aug 6, 2026Sadegh Jafari, Mohiuddin Bilwal, Fan Zhou +2Model CompressionMixed-Precision Quantization

  15. Lossless Tensor Compression as Program Synthesis

    Aug 3, 2026Jieke Shi, Junda He, Wenjia Jiang +11Model CompressionProgram Synthesis

  16. Progressive2^2: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression

    Jul 31, 2026Tiancong Cheng, Ying Zhang, Zhiwen Yu +2Model CompressionKnowledge Distillation

  17. Memory Efficient Tabular Foundation Models

    Jul 30, 2026Shuting Luo, Monika Mikhail Kanaan, Cameron Gordon +2Model CompressionTabular Foundation Models

  18. VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment

    Jul 28, 2026Stephen Bauer, Sheila Seidel, Shanza Iftikhar +2Model CompressionSpeech Processing

  19. Post-Training in Time Series Foundation Models: A Unifying Framework

    Jul 22, 2026Shifeng Xie, Ambroise Odonnat, Zehao Xiao +7Model CompressionTime-Series Foundation Models

  20. Decoder-Preserving Sparse Autoencoders: Which Readouts Survive Sparse Compression?

    Jul 19, 2026Aniket DeshpandeModel CompressionActivation Sparsity

  21. MIS-HCC: Hierarchical Channel Clustering for Efficient Medical Image Segmentation

    Jul 19, 2026Bo Zhao, Haoran Yu, Lifei Liu +5Model CompressionClustering

  22. Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data

    Jul 13, 2026Shikai Qiu, Marc Finzi, Yujia Zheng +2Model CompressionNeural Network Generalization

  23. Displacement Preserving Relational Distillation for Robust Medical Segmentation

    Jul 6, 2026Zhicheng Ding, Xinyu Chu, Jung Im Choi +5Model CompressionRelational Knowledge Distillation

  24. LACE-SVD: Loss-Aware SVD with Cumulative Error Correction for LLM Compression

    Jul 3, 2026Zhuowen Liu, Longkun Hao, Shiyu Feng +3Model CompressionLLM Compression

  25. SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models

    Jul 2, 2026Qi Lyu, Jiahua Dong, Baichen Liu +7Model CompressionVision-Language Models

  26. Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

    Jul 1, 2026Jaeah Lee, Hyunjin Kim, Jaewoong Cho +1Model CompressionDiffusion Transformer

  27. Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

    Jun 26, 2026Guoheng Sun, Kaixi Feng, Shwai He +8Model CompressionEfficient VLA Models

  28. What Survives When You Compress a Recursive Reasoner for the Edge?

    Jun 25, 2026Pearse Jim, Steven Kolawole, Opegbemi Matthias Busoye +2Model CompressionEfficient Neural Network Inference

  29. Agentic evolution of physically constrained foundation models

    Jun 24, 2026Jiangwei Zhang, Wen Sun, Chong Wang +7Model CompressionLLM Quantization

  30. Hybrid Compression: Integrating Pruning and Quantization for Optimized Neural Networks

    Jun 22, 2026Minh-Loi Nguyen, Long-Bao Nguyen, Van-Hieu Huynh +2Model CompressionEfficient Neural Network Inference

  31. Scaling Audio Models Efficiently: Joint Optimization of Scale, Resolution, Adaptation, Precision, and Sparsity

    Jun 22, 2026Vyom Agarwal, Mokshda Gangrade, Siddharth Pal +1Model CompressionStructured Sparsity

  32. When Compression Helps and When It Hurts: Condition-Aware Analysis of Chain-of-Thought Distillation

    Jun 19, 2026Siyang Lyu, Xinghao Chen, Zhijing Sun +3Model CompressionCoT Distillation

  33. Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think

    Jun 18, 2026Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha +18Model CompressionEfficient VLA Model Inference

  34. Complementary Attention Head Pruning for Efficient Transformers

    Jun 17, 2026Yaniv Livertovsky, Shahar Somin, Gonen SingerModel CompressionTransformer Attention

  35. Efficiency-Performance Trade-offs in Neural Speaker Diarization via Structured Pruning and Low-Bit Quantization

    Jun 12, 2026Rishit Chatterjee, Tahiya ChowdhuryModel CompressionSpeaker Diarization

  36. SigmaScale: LLM Compression with SVD-based Low-Rank Decomposition and Learned Scaling Matrices

    Jun 5, 2026Ernests Lavrinovics, Marco Letizia, Roy Janco +3Model CompressionLLM Compression

  37. LLMCodec: Adapting Video Codecs for Efficient Weight Compression of Large Language Models

    Jun 4, 2026Rui Wang, Yan Zhao, Li Song +1Model CompressionLLM Quantization

  38. Spatially Distributed Task-Oriented Compression for Multi-Emitter Localization and Characterization with Spectral Overlap

    May 31, 2026H. Nazim Bicer, J. Nicholas LanemanModel CompressionWireless Communications

  39. DASH: Dual-Branch Score Distillation for Guidance-Calibrated Compact Diffusion Models

    May 30, 2026Abdullah Al Shafi, Kazi Saeed Alam, Sk Imran Hossain +1Model CompressionClassifier-Free Guidance

  40. Smaller and Faster 3DGS via Post-Training Dictionary Learning

    May 28, 2026Jiarong Gong, Jonas Unger, Ehsan Miandji3DGS CompressionModel Compression

  41. LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models

    May 19, 2026Hyunsoo Han, Sangyeop Yeo, Jaejun YooModel CompressionDiffusion Model Distillation

  42. SAFE-SVD: Sensitivity-Aware Fidelity-Enforcing SVD for Physics Foundation Models

    May 18, 2026Chengjie Hong, Feixiang He, Yiheng Zeng +2Model CompressionLow-Rank Compression

  43. MedCore: Boundary-Preserving Medical Core Pruning for MedSAM

    May 13, 2026Cenwei Zhang, Suncheng Xiang, Lei YouModel CompressionImage Segmentation

  44. Robust Basis Spline Decoupling for the Compression of Transformer Models

    May 11, 2026Joppe De Jonghe, Van Tien Pham, Mariya IshtevaModel CompressionTensor Decomposition

  45. XTinyU-Net: Training-Free U-Net Scaling via Initialization-Time Sensitivity

    May 10, 2026Alvin Kimbowa, Moein Heidari, David Liu +1Model CompressionU-Net

  46. PACE: Prune-And-Compress Ensemble Models

    May 7, 2026Fabian Akkerman, Julien Ferry, Théo Guyard +1Model CompressionEnsemble Learning

  47. Compress Then Adapt? No, Do It Together via Task-aware Union of Subspaces

    May 4, 2026Jingze Ge, Yun Liu, Xue Geng +4Model CompressionAdapter Tuning