Efficient VLM Inference

VLM: Vision-Language Model

Latest papers 322

All topics
CardsList
  1. VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning

    Mar 26, 2026Zhe Gao, Shiyu Shen, Taifeng Chai +7Tool Use in VLMsEfficient VLM Inference

  2. Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding

    Mar 19, 2026Yikai Zheng, Xin Ding, Yifan Yang +6Streaming Video UnderstandingEfficient VLM Inference

  3. Look Where It Matters: High-Resolution Crops Retrieval for Efficient VLMs

    Mar 14, 2026Nimrod Shabtay, Moshe Kimhi, Artem Spector +5Tool Use in VLMsEfficient VLM Inference

  4. MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models

    Mar 12, 2026Shengyuan Liu, Zanting Ye, Yunrui Lin +6Efficient VLM Inference3D Medical Imaging

  5. History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation

    Mar 6, 2026Qitong Wang, Yijun Liang, Ming Li +2Efficient VLM InferenceToken Pruning

  6. FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering

    Mar 4, 2026Tatiana Zemskova, Solomon Andryushenko, Ilya Obrubov +4Efficient VLM InferenceEgocentric Video QA

  7. Stateful Token Reduction for Long-Video Hybrid VLMs

    Feb 27, 2026Jindong Jiang, Amala Sanjay Deshmukh, Kateryna Chumachenko +7Efficient VLM InferenceVideo-Language Models

  8. HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding

    Feb 13, 2026Wenhui Liao, Hongliang Li, Pengyu Xie +15Efficient VLM InferenceSpeculative Decoding

  9. Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies

    Feb 6, 2026Fangyuan Wang, Peng Zhou, Jiaming Qi +4Efficient VLM InferenceVisuomotor Policy Learning

  10. SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

    Feb 6, 2026Niccolo Avogaro, Nayanika Debnath, Li Mi +6Visual Question AnsweringEfficient VLM Inference

  11. Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs

    Jan 30, 2026Yanlong Chen, Amirhossein Habibian, Luca Benini +1Cross-Modal Knowledge DistillationVision-Language Models

  12. Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

    Dec 11, 2025Duo Zheng, Shijia Huang, Yanyang Li +1KV CachingEfficient VLM Inference

  13. AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference via Dynamical Text Guidance

    Aug 8, 2025Weichen Zhang, Zhui Zhu, Ningbo Li +5Efficient VLM InferenceVisual Token Pruning

  14. SalQ-VLM: Fine-Grained Saliency-Guided Quantization for Vision-Language Models

    Aug 5, 2025Yufei Xue, Yushi Huang, Lunjie Zhu +2Vision-Language ModelsVLM Quantization

  15. StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

    Jul 7, 2025Meng Wei, Chenyang Wan, Xiqian Yu +9Efficient VLM InferenceEfficient VLA Models

  16. ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance

    May 24, 2025Duo Li, Zuhao Yang, Xiaoqin Zhang +2Efficient VLM InferenceLarge Vision-Language Models

  17. LaViDa: A Large Diffusion Language Model for Multimodal Understanding

    May 22, 2025Shufan Li, Konstantinos Kallidromitis, Hritik Bansal +7Vision-Language ModelsEfficient VLM Inference

  18. Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

    Date pendingGuiqiu Liao, Matjaz Jogan, Daniel A. HashimotoImage TokenizationHealthcare