Efficient VLM Inference

VLM: Vision-Language Model

Latest papers 322

All topics
CardsList
  1. A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi

    Jul 16, 2026A. C. Opus, J. Q. LuEfficient Transformer InferenceGPU Kernel Optimization

  2. Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models

    Jul 15, 2026Xuanyi Hao, Zuoyuan Zhang, Zhibo Wang +4Vision-Language ModelsEfficient VLM Inference

  3. VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

    Jul 14, 2026Yupeng Zheng, Kai Zou, Bin Liu +1Efficient VLM InferenceLarge Vision-Language Models

  4. TIGER: Text-Conditioned Visual Gated Routing with Acceptance Alignment for Multimodal Speculative Decoding

    Jul 13, 2026Quynh Vo, Cong-Duy Nguyen, Ponhvoan Srey +2Efficient VLM InferenceSpeculative Decoding

  5. Spectral Heat Flow for Conservative Token Condensation in Vision-Language Models

    Jul 12, 2026Zhaoyang Li, Yanjun Li, Wangkai Li +2Efficient VLM InferenceVisual Token Pruning

  6. Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference

    Jul 10, 2026Junfei Zhan, Haoxun Shen, Mingang Guo +2Efficient VLM InferenceEdge Inference

  7. SigLIP-HD by Fine-to-Coarse Supervision

    Jul 10, 2026Lihe Yang, Zhen Zhao, Hengshuang ZhaoEfficient VLM InferenceLarge Vision-Language Models

  8. GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models

    Jul 10, 2026Guohuan Xie, Mengqi Lei, Chuan Shi +3Efficient VLM InferenceVideo-Language Models

  9. AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring

    Jul 7, 2026Younggun Kim, Taeheon Kim, Youngseo Kim +1VLM RobustnessEfficient VLM Inference

  10. HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

    Jul 6, 2026Gengluo Li, Xingyu Wan, Shangpin Peng +20Vision-Language ModelsEfficient VLM Inference

  11. TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models

    Jul 6, 2026Riccardo Renzulli, Gabriele Spadaro, Shruthi Gowda +2Efficient VLM InferenceVisual Token Pruning

  12. CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

    Jul 5, 2026Zhaohong Liu, Hao Ye, Xianlin Zhang +1VLMs for Autonomous DrivingEfficient VLM Inference

  13. Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

    Jul 5, 2026Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu +2Efficient VLM InferenceMultimodal QA

  14. Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning

    Jul 2, 2026Xuehui Wang, Xuankun Yang, Wei ShenEfficient VLM InferenceMultimodal Token Compression

  15. ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

    Jul 2, 2026Minkuk Kim, Suyong Yun, Young Tae Kim +3Efficient VLM InferenceVideo QA

  16. Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing

    Jun 30, 2026Luca Barsellotti, Martin Sundermeyer, Mattia Segu +5Video Object SegmentationInstance Segmentation

  17. ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

    Jun 30, 2026Yuhao Wang, Mu Qiao, Haiwen Diao +5Efficient VLM InferenceMultimodal Large Language Models

  18. Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference

    Jun 30, 2026Zhaoyang Luo, Runmin Dong, Miao Yang +4Efficient VLM InferenceMultimodal Large Language Models

  19. Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving

    Jun 30, 2026Anh Dung Dinh, Simon Khan, Flora SalimEfficient VLM InferenceSpeculative Decoding

  20. VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context

    Jun 29, 2026Xiaoqian Shen, Mohamed ElhoseinyEfficient VLM InferenceAttention Sinks

  21. Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs

    Jun 28, 2026Junzhou Chen, Jindong Wang, Gang ZhouEfficient VLM InferenceVision-Language-Action Models

  22. LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

    Jun 26, 2026Nicolas Baumann, Liam Boyle, Pu Deng +5Efficient VLM InferenceVLM Distillation

  23. MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving

    Jun 26, 2026Nan Yang, Zhanwen Liu, Linfeng Zhang +4Vision-Language ModelsVLMs for Autonomous Driving

  24. TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

    Jun 25, 2026Tinghao Wang, Yichen Guo, Rui Huang +11Efficient VLM InferenceMultimodal Large Language Models

  25. GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models

    Jun 24, 2026Chaoxiang Cai, Minghe Weng, Jie Li +4Efficient VLM InferenceLarge Vision-Language Models