Visual Token Pruning

Momentum

28 papers in the last four weeks, up 133% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 172

All topics
CardsList
  1. Understanding and Mitigating Token-Pruning-Induced Vulnerabilities in VLMs

    Oct 7, 2026Shuailong Wang, Xinyu Lyu, Shengming Yuan +3Visual Token PruningVLM Robustness

  2. Adaptive Visual Token Reduction for Accelerated Image Understanding

    Oct 7, 2026Seyoung Jeong, Jong Pil Yun, Sang Jun LeeEfficient VLM InferenceVisual Token Pruning

  3. DIPrune: Task-Aware Token Pruning with Dual Importance for Efficient Multimodal Language Models

    Oct 6, 2026Shuo Yang, Changbai Li, Linlin Yang +6Multimodal Large Language ModelsToken Pruning

  4. Foveated Compression: Selective High-Resolution Preservation for Token-Efficient VLMs

    Oct 6, 2026Donghyun Han, Jangho Park, Yuseok BaeEfficient VLM InferenceVisual Token Pruning

  5. When Masking Helps or Hurts Robustness in Compressed CLIP: A Pre-Deployment Diagnostic

    Sep 30, 2026Muhammad Zawish, Steven DavyVLM RobustnessEfficient VLM Inference

  6. TReVS: Integrating Textual Relevance and Visual Saliency for Efficient Vision-Language Model Token Pruning

    Sep 29, 2026Jing Wang, Zhiping Wu, Dongdong Ren +3Efficient VLM InferenceLarge Vision-Language Models

  7. Beyond Token Importance: Preserving Spatial Scaffolds for Efficient Vision-Language-Action Inference

    Sep 29, 2026Jiayu Chen, Shuyong Gao, Jingkai Jia +6Efficient VLA Model InferenceVLMs for Robotics

  8. Representation Dynamics Reveal Semantic Saliency and Similarity for Visual Token Pruning in MLLMs

    Sep 29, 2026Weixuan Li, Zikun Zhou, Xinyi Zhuang +4Efficient VLM InferenceVisual Token Pruning

  9. Decoding Affective Nuances: Enhancing MLLMs via Hierarchical Emotion Reasoning and Contrastive Discriminative Pruning

    Sep 29, 2026Cheng Ye, Weidong Chen, Zhaobo Qi +2Multimodal Large Language ModelsMultimodal Emotion Recognition

  10. SPIDER: Multi-Layer Semantic Token Pruning and Adaptive Sub-Layer Skipping in Multimodal Large Language Models

    Sep 28, 2026Tianxiang Chen, Zhentao Tan, Zi Ye +9Efficient Multimodal InferenceTransformer

  11. P4Q: Co-designing Token Pruning and Quantization for Vision-Language Model Acceleration

    Sep 28, 2026Haizhao Jing, Zhenhao Shang, Haokui Zhang +2VLM QuantizationEfficient VLM Inference

  12. When Text Matters: Design Principles for Visual Token Pruning in Vision-Language Model

    Sep 28, 2026Minchan Kang, Kyeonghye Park, Seoyoung Cho +2Efficient VLM InferenceVisual Token Pruning

  13. ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs

    Sep 28, 2026Xu Li, Yuxuan Liang, Yi Zheng +6Efficient VLM InferenceLarge Vision-Language Models

  14. MiCo: Mutual Information Coverage Optimization through Semantic Erasure Modeling for Efficient MLLM Inference

    Sep 28, 2026Tinghao Wang, Yichen Guo, Qizhe Zhang +11Efficient Multimodal InferenceMultimodal Large Language Models

  15. DORA: Dynamic Online Reinforcement Agent for Token Pruning in Vision Transformers

    Sep 28, 2026Kaixuan He, Song Chen, Yi KangVision TransformerEfficient ViTs

  16. SCOPD: Sparse-Context On-Policy Self-Distillation for Efficient Vision-Language Models

    Sep 28, 2026Ahmadreza Jeddi, Enming Zhang, Jasper Gerigk +12Efficient VLM InferenceOn-Policy Self-Distillation

  17. SLICEChat: Progressive In-Encoder Token Pruning for Whole-Slide Pathology Language Models

    Sep 21, 2026Ali Kerem Bozkurt, Baris Cem Bakay, Ibrahim Kulac +3Efficient Multimodal InferenceMultimodal Large Language Models

  18. VPRune: Efficient Training-free Pre-LLM Visual Token Pruning

    Sep 21, 2026Guangchuan Lv, Dianxing Shi, Dingjie FuEfficient VLM InferenceLarge Vision-Language Models

  19. Layer-Aware Position Embeddings for Visual Token Pruning in Multimodal Large Language Models

    Sep 20, 2026Yahong Wang, Zhangkai Ni, Juncheng Wu +3Efficient Multimodal InferenceMultimodal Large Language Models

  20. QCPruner: Query-Conditioned Population Coverage for Visual Token Pruning

    Sep 17, 2026Shengli He, Yongchao Liang, Roumeng He +4Multimodal Large Language ModelsVisual Token Pruning

  21. Region-Level Policy Optimization for Fine-grained MLLM Perception

    Sep 17, 2026Yuheng Shi, Xiaohuan Pei, Minjing Dong +1Efficient VLM InferenceLarge Vision-Language Models

  22. Don't Send What You Don't Need: Question-Guided Token Pruning as a Privacy Defense for Vision-Language Models

    Sep 14, 2026Md Khalid Syfullah, Alvi Ataur KhalilVisual Question AnsweringPrivacy Protection in VLMs

  23. Beyond One-Size-Fits-All: Sample-Adaptive Strategy Routing for Vision Token Pruning in MLLMs

    Sep 9, 2026Haiji Liang, Pengfei Zhou, Zhenglin Wan +3Efficient VLM InferenceLarge Vision-Language Models

  24. TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents

    Sep 9, 2026Yuhao Wang, Mu Qiao, Xindong Zhang +3KV-Cache CompressionVisual Token Pruning

  25. CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs

    Sep 8, 2026Nhat-Tan Bui, Varshini Elangovan, Arun Reddy Anugu +73D Spatial ReasoningVisual Token Pruning

  26. ComVLA: Communication-Aware Split Inference for VLA Models in 6G-Connected Robotics

    Sep 7, 2026Boliang Liu, Wint Yi Poe, Jingyun Di +2Efficient VLA Model InferenceEfficient VLA Models

  27. Query-Aware Token Budgeting for Efficient Late-Interaction Visual Document Retrieval

    Sep 7, 2026PS Rishi, Rajeev Ranjan Dwivedi, Vinod K KurmiLate Interaction RetrievalToken Pruning

  28. TAP-Path: Task-Adaptive Structural and Token Pruning for Efficient and Trustworthy Pathology Foundation Models

    Sep 3, 2026Mehedi Hasan, Ashfak Yeafi, Md Khairul IslamComputational PathologyPathology Foundation Models

  29. Who Speaks for the Pruned? Visual Token Pruning as Coverage Optimization

    Sep 2, 2026Qingchan Zhu, Weihang You, Hanqi Jiang +3Efficient VLM InferenceVisual Token Pruning

  30. S2^2Prune: Spatially Structured Visual Token Pruning for Multimodal Large Language Models

    Sep 1, 2026Yuanyuan Jia, Shunpu Tang, Qianqian YangEfficient VLM InferenceMultimodal Large Language Models

  31. SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models

    Sep 1, 2026Shiyu Li, Zi-Yuan Hu, Shijia Huang +3Efficient VLM InferenceMultimodal Large Language Models

  32. From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers

    Sep 1, 2026Siyi Liu, Hanjun Yang, Chenchen Zhang +7Efficient VLM InferenceMultimodal Reranking

  33. PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

    Aug 27, 2026Junjie Liu, Shengyuan Ye, Xu ChenEfficient VLM InferenceVisual Token Pruning

  34. Multi-Image Visual Token Pruning in Large Visual Language Models

    Aug 27, 2026Rongyang Zhang, Chengqiang Lu, Cong Li +9Efficient VLM InferenceLarge Vision-Language Models

  35. Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

    Aug 21, 2026Zhuoyuan Li, Rui Zhao, Jin Wang +5Vision-Language-Action ModelsVisual Token Pruning

  36. CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

    Aug 13, 2026Peng Ling, Yingda Yin, Lingting Zhu +53D Spatial ReasoningVisual Token Pruning

  37. Putting Registers to Work: Task Registers for Token Pruning in Vision Transformers

    Aug 11, 2026Hongsen Cao, Mona Jaber, Shanxin Yuan +1Token PruningEfficient ViTs

  38. When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

    Aug 11, 2026Congyang Ou, Ruike Song, Yang Zhou +3Efficient VLM InferenceLarge Vision-Language Models

  39. Sparse Attention to Emotion: Efficient Facial Emotion Recognition via Token Reduction

    Aug 9, 2026Aya Manel Zitouni, Aicha Zenakhri, Karim Haroun +1Efficient ViTsFacial Expression Recognition

  40. Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

    Aug 9, 2026Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim +1Efficient Multimodal InferenceAudio Token Compression

  41. An AI4AI Framework for Visual Token Pruning

    Aug 7, 2026Zhen Liu, Wenli Huang, Wei Song +3Automated Algorithm DiscoveryEfficient VLM Inference

  42. RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

    Aug 7, 2026Qiyanhui Lu, Han Wu, Rongjian Xu +6Efficient VLM InferenceLarge Vision-Language Models

  43. HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

    Aug 5, 2026Jiuhe Qu, Yingping Liang, Ying Fu3D Spatial ReasoningVisual Token Pruning

  44. DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models

    Aug 5, 2026Chen Zhong, Xiao An, Zijie Wang +3Efficient VLM InferenceVisual Token Pruning

  45. RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

    Aug 4, 2026Jian Zou, Xiaoyu Xu, Zhihua Wang +3Efficient VLM InferenceVisual Token Pruning

  46. Keep the Needle, Prune the Haystack: Defect-Preserving Token Pruning for Efficient Zero-Shot Anomaly Detection

    Aug 4, 2026Yanning Hou, Jingyuan Zhang, Xiaoyun Wang +3Medical Image Anomaly DetectionIndustrial Anomaly Detection

  47. Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Pruning

    Aug 4, 2026Yuyao Sun, Tao Deng, Shuang Li +3Visual AttentionEfficient VLM Inference

  48. GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

    Aug 4, 2026Mengjie Zhang, Qihui Zhu, Tao Zhang +10Efficient VLM InferenceVideo-Language Models