Efficient VLM Inference

VLM: Vision-Language Model

Latest papers 322

All topics
CardsList
  1. RTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR Inference

    May 1, 2026Ben Wan, Yan Feng, Zihan Tang +4Efficient VLM InferenceOptical Character Recognition

  2. EdgeFM: Efficient Edge Inference for Vision-Language Models

    Apr 30, 2026Mengling Deng, Yuanpeng Chen, Sheng Yang +12Efficient VLM InferenceEdge Inference

  3. Progressive Semantic Communication for Efficient Edge-Cloud Vision-Language Models

    Apr 29, 2026Cyril Shih-Huan Hsu, Wig Yuan-Cheng Cheng, Chrysa PapagianniEfficient VLM InferenceEdge Computing

  4. Efficient, VRAM-Constrained xLM Inference on Clients

    Apr 29, 2026Aditya Ukarande, Deep Shekhar, Marc Blackstein +1GPU AccelerationEfficient VLM Inference

  5. FreqCache: Accelerating Embodied VLN Models with Adaptive Frequency-Guided Token Caching

    Apr 27, 2026Zihao Zheng, Xingyue Zhou, Zhihao Mao +7Efficient VLM InferenceVision-Language Navigation

  6. Don't Pause! Every prediction matters in a streaming video

    Apr 27, 2026Dibyadip Chatterjee, Zhanzhong Pang, Fadime Sener +2Streaming Video UnderstandingEfficient VLM Inference

  7. GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction

    Apr 27, 2026Hongxin Li, Yuntao Chen, Zhaoxiang ZhangEfficient VLM InferenceTraining Data Curation

  8. Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference

    Apr 26, 2026Xiaowei Mao, Bowen Sui, Weijie Zhang +7Efficient VLM InferenceAnomaly Localization

  9. DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning

    Apr 24, 2026Joonmyung Choi, Sanghyeok Lee, Jongha Kim +4Efficient VLM InferenceDocument QA

  10. Prototype-Based Test-Time Adaptation of Vision-Language Models

    Apr 23, 2026Zhaohong Huang, Yuxin Zhang, Wenjing Liu +2Test-Time AdaptationVLM Adaptation

  11. Sub-Token Routing for KV Cache Compression

    Apr 23, 2026Wei Jiang, Wei WangLLM Inference EfficiencyKV Caching

  12. Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models

    Apr 22, 2026Juhong Min, Lazar Valkov, Vitali Petsiuk +2Visual AttentionEfficient VLM Inference

  13. Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs

    Apr 22, 2026Kibum Kim, Jiwan Kim, Kyle Min +4Efficient VLM InferenceAttention Sinks

  14. FOCAL: Filtered On-device Continuous Activity Logging for Efficient Personal Desktop Summarization

    Apr 21, 2026Haoran Yin, Zhiyuan Wen, Jiannong Cao +2Efficient VLM InferenceText Summarization

  15. ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving

    Apr 21, 2026Lin Sha, Haiyun Guo, Tao Wang +4VLMs for Autonomous DrivingEfficient VLM Inference

  16. Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions

    Apr 20, 2026Kecheng Zhang, Zongxin Yang, Mingfei Han +6Streaming Video UnderstandingEfficient VLM Inference

  17. Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling

    Apr 20, 2026Yujie Chen, Tailai Chen, Yifeng Gao +4Self-AttentionLong-Context Language Model Inference

  18. Towards Joint Quantization and Token Pruning of Vision-Language Models

    Apr 19, 2026Xinqing Li, Xin He, Xindong Zhang +3Vision-Language ModelsVLM Quantization

  19. SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models

    Apr 18, 2026Junnan Liu, Xinyan Liu, Peifeng Gao +4GPU AccelerationSelf-Attention

  20. VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models

    Apr 16, 2026Huawei Ji, Yuanhao Sun, Yuan Jin +4Vision-Language ModelsEfficient VLM Inference

  21. Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

    Apr 16, 2026Yixu Huang, Tinghui Zhu, Muhao ChenEfficient VLM InferenceVisual Reasoning

  22. BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation

    Apr 15, 2026Baoyou Chen, Hanchen Xia, Peng Tu +5Vision-Language ModelsVLM Adaptation

  23. Confidence under Visual Token Pruning: Removed Evidence and Risk-Controlled Token Budgets for MLLMs

    Apr 13, 2026Kaizhen Tan, Yang Feng, Heqing Du +3VLM EvaluationConfidence Estimation in Language Models

  24. Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models

    Apr 13, 2026Yvon Apedo, Martyna Poreba, Michal Szczepanski +1Vision-Language ModelsEfficient VLM Inference

  25. SMART: When is it Actually Worth Expanding a Speculative Tree?

    Apr 9, 2026Lifu Wang, Pan ZhouInference-Time OptimizationGPU Acceleration

  26. CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference

    Apr 7, 2026Yulin Zou, Wenyan Chen, Yan Chen +6Efficient VLM InferenceVLM Inference