Neural Network Pruning

Momentum

22 papers in the last four weeks, up 83% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 161

All topics
CardsList
  1. Efficient Text-to-Audio Generation via Pruning

    Jul 14, 2026Arshdeep Singh, Yi Yuan, Yun Chen +2Text-to-Audio GenerationLatent Diffusion Models

  2. Towards Efficient Convolutional Neural Network for Embedded Hardware via Multi-Dimensional Pruning

    Jul 13, 2026Hao Kong, Di Liu, Xiangzhong Luo +5Efficient Neural Network InferenceConvolutional Neural Networks

  3. WaveNet-Style Guitar Amplifier Model Pruning for Real-Time iOS Deployment

    Jul 11, 2026Ryota Sato, Eli SilversteinEfficient Neural Network InferenceOn-Device Inference

  4. PALS: Percentile-Aware Layerwise Sparsity for LLM Pruning

    Jul 8, 2026Yazdan Jamshidi, Alexey ShvetsLLM PruningLLM Compression

  5. Hardware-aware Graph Neural Networks prunning for embedded event-based vision

    Jul 7, 2026Piotr Wzorek, Kamil Jeziorek, Tomasz KryjakEvent-Based VisionGraph Neural Networks

  6. Dynamic-in-Few-Step: Unifying Dynamic Computation and Few-Step Distillation for Efficient Video Generation

    Jul 7, 2026Yu Cheng, Siyue Yao, Zhongang Qi +3Video Diffusion ModelsDiffusion Model Distillation

  7. Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective

    Jul 4, 2026Zhenfeng Su, Kang Zhao, Han Bao +4Vision TransformerEfficient ViTs

  8. When Token Compression Breaks: Structural Pruning vs. Token Reduction for Robust ViT Segmentation under High Compression

    Jul 2, 2026Tien-Phat Nguyen, Ngai-Man CheungDistribution Shift RobustnessVision Transformer

  9. On the Utility and Factual Reliability of Pruned Mixture-of-Experts Models in the Biomedical Domain

    Jul 1, 2026Atsuki Yamaguchi, Szymon Palucha, Léo Bijar +2Mixture-of-Experts PruningLLM Reliability

  10. Post-Training Pruning for Diffusion Transformers

    Jul 1, 2026Chengzhi Hu, Xuewen Liu, Jing Zhang +3Diffusion TransformerDiffusion-Based Image Generation

  11. Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

    Jun 30, 2026Fengnian Zhang, Tao Huang, Siyu Xu +2VLM AdaptationVision-Language-Action Models

  12. Co-Optimization of Analog Kolmogorov-Arnold Networks for Low-Power Function Approximation in Flexible Electronics

    Jun 26, 2026Paula Carolina Lozano Duarte, Georgios Zervakis, Mehdi Tahoori +1Energy-Efficient MLKolmogorov-Arnold Networks

  13. What Survives When You Compress a Recursive Reasoner for the Edge?

    Jun 25, 2026Pearse Jim, Steven Kolawole, Opegbemi Matthias Busoye +2Model CompressionEfficient Neural Network Inference

  14. Hierarchical Reinforcement Learning for Neural Network Compression (HiReLC): Pruning and Quantization

    Jun 24, 2026Kamar Hibatallah Baghdadi, Kawther Guoual Belhamidi, Sara Belhadj +2Hierarchical RLNeural Network Quantization

  15. Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding

    Jun 23, 2026Qitong Wang, Fan Du, Pranav Maneriker +2Efficient VLM InferenceEgocentric Vision

  16. Don't Go Breaking My LLM: The Impact of Pruning Attention Layers on Explanation Faithfulness and Confidence Calibration

    Jun 23, 2026Pietro Tropeano, Maria Maistro, Tuukka Ruotsalo +1LLM PruningLLM Interpretability

  17. SVD-Surgeon: Optimal Singular-Value Surgery for Large Language Model Compression

    Jun 22, 2026Mahmoud Safari, Frank HutterLLM PruningLLM Compression

  18. Efficient Network Inference via Hardware-Aware Architecture Search, Model Pruning & Quantization

    Jun 22, 2026Lucas Heublein, Mark Deutel, Axel Plinge +1Efficient Neural Network InferenceHardware-Aware NAS

  19. PeLAP-A: Adaptive Latent Pruning for Lightweight Latent Diffusion Models

    Jun 22, 2026Kissa Zahra, Zaib Un NisaLatent Diffusion ModelsNeural Network Pruning

  20. Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think

    Jun 18, 2026Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha +18Model CompressionEfficient VLA Model Inference

  21. Complementary Attention Head Pruning for Efficient Transformers

    Jun 17, 2026Yaniv Livertovsky, Shahar Somin, Gonen SingerModel CompressionTransformer Attention