Efficient VLM Inference

VLM: Vision-Language Model

Latest papers 322

All topics
CardsList
  1. VespaSeg: A Resource-Aware Ground-then-Segment Pipeline for Referring Expression Segmentation

    Aug 2, 2026Savindu Dilshan WickramasinghePromptable Image SegmentationEfficient VLM Inference

  2. MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

    Aug 2, 2026Jiang Wu, Sichao Wu, Yinsong Ma +2Vision-Language ModelsEfficient VLM Inference

  3. FreqNav: Stage-Wise Frequency Routing for Object-Oriented Aerial Vision-Language Navigation

    Aug 2, 2026Yin Tang, Jiawei Ma, Jiahao Li +4Efficient VLM InferenceUAV Navigation

  4. Coverage-Driven Adaptive Keyframe Selection for Video Understanding

    Aug 1, 2026Junyang Zhang, Puhan Luo, Chen Tang +2Efficient VLM InferenceLarge Vision-Language Models

  5. LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference

    Jul 30, 2026Feng Yang, Xinrui Ju, Keyang Zhang +6Efficient VLM InferenceVisual Token Pruning

  6. Thinking Once Is Enough: Intermediate-Layer Evidence Routing for High-Resolution VQA

    Jul 30, 2026Zhongkuan Mao, Xianjie Liu, Tianyu Meng +9Visual Question AnsweringEfficient VLM Inference

  7. Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs

    Jul 30, 2026Jiasheng Li, Zhong Ji, Yan Zhang +1VLM RobustnessEfficient VLM Inference

  8. Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference

    Jul 29, 2026Feixiang Liu, Qiang Qiu, Hao Zhang +1VLM EvaluationEfficient VLM Inference

  9. MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models

    Jul 29, 2026Yitao Zhu, Mengjun Liu, Yingji Fu +2Efficient VLM InferenceMedical VLMs

  10. Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

    Jul 27, 2026Senqiao Yang, Kaichen Zhang, Zhaoyang Jia +20Vision-Language ModelsEfficient VLM Inference

  11. CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

    Jul 27, 2026Jinlong Yang, Wenhao Zhang, Kuanwei Lin +1Tool Use in VLMsEfficient VLM Inference

  12. GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models

    Jul 27, 2026Jun Ling, Tao Huang, Junzhuo Liu +2Efficient VLM InferenceLarge Vision-Language Models

  13. PathSelect: Sequential Token Selection for Whole Slide Pathology

    Jul 26, 2026Jingzhi Chen, Landi He, Zehong Chen +2Efficient VLM InferenceMedical VLMs

  14. MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

    Jul 26, 2026Yuqi Liu, Shengju Qian, Tianyuan Qu +5Memory-Augmented VLMsEfficient VLM Inference

  15. UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

    Jul 25, 2026Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati +4Vision-Language ModelsEfficient VLM Inference

  16. WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

    Jul 25, 2026Yuhui Zeng, Wang Chen, Jinfa Huang +5Efficient VLM InferenceVideo Token Compression

  17. Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs

    Jul 25, 2026Jouwon Song, Woohyeong Kim, Kyeongbo KongEfficient VLM InferenceLarge Vision-Language Models

  18. LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR

    Jul 24, 2026Xudong Liu, Bicheng Wan, Yulin JinEfficient VLM InferenceDocument Layout Analysis

  19. Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

    Jul 22, 2026Pengcheng Wang, Zhiquan Wang, Jayoung Lee +5Efficient Multimodal InferenceEfficient VLM Inference

  20. SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

    Jul 22, 2026Xinyu Zhang, Zishuo Wang, Ling XiaoEfficient VLM InferenceVLM Distillation

  21. BLUE: Semantics-Preserving Video Compression for Efficient Vision-Language Surveillance Analytics

    Jul 21, 2026Shubham Baid, Akash James, Sahil Chachra +2Efficient VLM InferenceVideo Compression

  22. Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks

    Jul 21, 2026Lachlan McGinnessVLM EvaluationEducational Assessment

  23. VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

    Jul 16, 2026Xinhao Li, Yuhan Zhu, Xiangyu Zeng +24Video UnderstandingStreaming Video Understanding