Efficient VLM Inference

VLM: Vision-Language Model

Latest papers 322

All topics
CardsList
  1. V-CoLA: Vision Token Compression with Linear Attention

    Oct 8, 2026Hao Jiang, Yiru Mao, Tianpeng Bu +9Visual Token CompressionEfficient VLM Inference

  2. Adaptive Visual Token Reduction for Accelerated Image Understanding

    Oct 7, 2026Seyoung Jeong, Jong Pil Yun, Sang Jun LeeEfficient VLM InferenceVisual Token Pruning

  3. Foveated Compression: Selective High-Resolution Preservation for Token-Efficient VLMs

    Oct 6, 2026Donghyun Han, Jangho Park, Yuseok BaeEfficient VLM InferenceVisual Token Pruning

  4. CASE: Cost-Aware Stopping for Efficient Long-Video Agents

    Oct 4, 2026Yiming Du, Chenghao Liu, Zhiyuan Liu +4Efficient VLM InferenceVideo Reasoning

  5. VETO: Video Efficient Token Optimization for Vision Language Models

    Oct 1, 2026Gueter Josmy Faure, Hao Ping Wang, Min-Hung Chen +1Efficient VLM InferenceLarge Vision-Language Models

  6. Not All Error Yields to Scale: Where Scaling Stops in Vision-Language Inference

    Oct 1, 2026Xinye Zhao, Yunkai Dang, Yunchen Wu +1Vision-Language ModelsEfficient VLM Inference

  7. MWOP: Modality-aware Width-wise Operation Pruning for Efficient MLLMs

    Oct 1, 2026Xudong Wang, Hao Wu, Haozhe Hu +5LLM PruningEfficient VLM Inference

  8. CoVisco: Codec-Native Vision Encoder with Native Token Compression for Unified Image-Video Understanding

    Sep 30, 2026Yulong Liu, Xiaotian Han, Junyuan Shang +6Video UnderstandingEfficient VLM Inference

  9. When Masking Helps or Hurts Robustness in Compressed CLIP: A Pre-Deployment Diagnostic

    Sep 30, 2026Muhammad Zawish, Steven DavyVLM RobustnessEfficient VLM Inference

  10. GroundAnything: Reconciling Parallel Decoding with Precise Visual Grounding at Flash Speed

    Sep 30, 2026Qize Yu, Lianrui Fan, Bowen Ping +19Efficient VLM InferenceVision-Language Grounding

  11. TReVS: Integrating Textual Relevance and Visual Saliency for Efficient Vision-Language Model Token Pruning

    Sep 29, 2026Jing Wang, Zhiping Wu, Dongdong Ren +3Efficient VLM InferenceLarge Vision-Language Models

  12. LazySloth: Bounded LLM-based Lazy Tree Search for Fast Long Video Comprehension

    Sep 29, 2026Arka Mukherjee, Kaleen Shrestha, Larissa Zhu +1Efficient VLM InferenceLong-Video Understanding

  13. Beyond Attention Imbalance: Mitigating Hallucinations via Spectral Surgery

    Sep 29, 2026Siqi Lu, Suo Wei, Yongbin Zheng +3Vision-Language ModelsEfficient VLM Inference

  14. GleanVID: Complementary Token Selection for Efficient Video Large Language Models

    Sep 29, 2026Shuo Yang, Changbai Li, Rui Tang +3Efficient VLM InferenceVideo-Language Models

  15. Representation Dynamics Reveal Semantic Saliency and Similarity for Visual Token Pruning in MLLMs

    Sep 29, 2026Weixuan Li, Zikun Zhou, Xinyi Zhuang +4Efficient VLM InferenceVisual Token Pruning

  16. FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution

    Sep 29, 2026FangZhi Zhong, Xuerui Qiu, Yuqi Pan +4Efficient VLM InferenceVLM Reasoning

  17. NavJev: Efficient Vision-Language Navigation via Action-Centric Visual Compression and Discriminative Action-Semantic Memory

    Sep 28, 2026Kai Sheng, Liuyi Wang, Jinlong Li +3Efficient VLM InferenceVision-Language Navigation

  18. P4Q: Co-designing Token Pruning and Quantization for Vision-Language Model Acceleration

    Sep 28, 2026Haizhao Jing, Zhenhao Shang, Haokui Zhang +2VLM QuantizationEfficient VLM Inference

  19. When Text Matters: Design Principles for Visual Token Pruning in Vision-Language Model

    Sep 28, 2026Minchan Kang, Kyeonghye Park, Seoyoung Cho +2Efficient VLM InferenceVisual Token Pruning

  20. From Perception to Integration: Revisiting the Internal Dynamics of Reasoning in Vision-Language Models

    Sep 28, 2026Rong Yu Xu, Prayag Tiwari, Shaolei ZhangEfficient VLM InferenceVLM Interpretability

  21. ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs

    Sep 28, 2026Xu Li, Yuxuan Liang, Yi Zheng +6Efficient VLM InferenceLarge Vision-Language Models

  22. SCOPD: Sparse-Context On-Policy Self-Distillation for Efficient Vision-Language Models

    Sep 28, 2026Ahmadreza Jeddi, Enming Zhang, Jasper Gerigk +12Efficient VLM InferenceOn-Policy Self-Distillation

  23. CoViST: Visual Token Compression via Composable States

    Sep 27, 2026Qi Zhang, Xiandong Meng, Ronggang Wang +1Vision-Language ModelsEfficient VLM Inference

  24. Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction

    Sep 26, 2026Junxian Li, Ruixuan Yang, Tianao Zhang +3Efficient VLM InferenceVLM Distillation