Efficient VLM Inference

VLM: Vision-Language Model

Latest papers 322

All topics
CardsList
  1. Visual Jev: Accurate and Efficient Decisions from Shared Visual Context

    Sep 22, 2026Guanxu Yu, Yuhang YaoVisual Question AnsweringEfficient Inference

  2. SPHQuant: Efficient extreme low bit weight quantization for Vision-Language Models

    Sep 21, 2026Kewei Zhang, Zheng Chen, Haotong Qin +1VLM QuantizationEfficient VLM Inference

  3. VPRune: Efficient Training-free Pre-LLM Visual Token Pruning

    Sep 21, 2026Guangchuan Lv, Dianxing Shi, Dingjie FuEfficient VLM InferenceLarge Vision-Language Models

  4. Region-Level Policy Optimization for Fine-grained MLLM Perception

    Sep 17, 2026Yuheng Shi, Xiaohuan Pei, Minjing Dong +1Efficient VLM InferenceLarge Vision-Language Models

  5. MiX: Micro-Inverted-Scaling for End-to-End Low-Bit Vision-Language Model Acceleration

    Sep 17, 2026Yuan Liao, Jae-sun SeoAI Accelerator InferenceVLM Quantization

  6. BrainFocus: EEG-Guided ROI Selection for Efficient Vision-Language Models

    Sep 15, 2026Yihui Peng, Guorui Lu, Qinyu ChenVisual Question AnsweringEfficient VLM Inference

  7. VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs

    Sep 15, 2026Haoyu Guo, Yuan Feng, Junlin Lv +3Efficient VLM InferenceLong-Video Understanding

  8. Efficient Quantization-Aware Distillation with Cross-Modal Alignment for Edge Vision-Language Models

    Sep 15, 2026Jinwoo Jeon, GyuYeop Do, Yubin Lim +4VLM QuantizationEfficient VLM Inference

  9. Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding

    Sep 11, 2026Weitong Cai, Hang Zhang, Yukai Huang +6Memory-Augmented VLMsEfficient VLM Inference

  10. Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

    Sep 9, 2026Killian Steunou, Yannis Tevissen, Mounîm A. El YacoubiAudio-Visual UnderstandingEfficient VLM Inference

  11. Beyond One-Size-Fits-All: Sample-Adaptive Strategy Routing for Vision Token Pruning in MLLMs

    Sep 9, 2026Haiji Liang, Pengfei Zhou, Zhenglin Wan +3Efficient VLM InferenceLarge Vision-Language Models

  12. CoFiE: Coarse-to-Fine Evidence Selection for Efficient Streaming Video Understanding

    Sep 3, 2026Jing Jiang, Yiran Ling, Ruonan Li +2Streaming Video UnderstandingEfficient VLM Inference

  13. Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards

    Sep 2, 2026Alejandro Barón García, Feng Wang, Emilia Garcia Casademont +1Efficient VLM InferenceSpeculative Decoding

  14. Who Speaks for the Pruned? Visual Token Pruning as Coverage Optimization

    Sep 2, 2026Qingchan Zhu, Weihang You, Hanqi Jiang +3Efficient VLM InferenceVisual Token Pruning

  15. S2^2Prune: Spatially Structured Visual Token Pruning for Multimodal Large Language Models

    Sep 1, 2026Yuanyuan Jia, Shunpu Tang, Qianqian YangEfficient VLM InferenceMultimodal Large Language Models

  16. SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models

    Sep 1, 2026Shiyu Li, Zi-Yuan Hu, Shijia Huang +3Efficient VLM InferenceMultimodal Large Language Models

  17. VerNav: Verifier-First Low-Latency Vision-and-Language Navigation

    Sep 1, 2026Zhixin Wang, Chengzheyi Yao, Leyuan Liu +2Efficient VLM InferenceVision-Language Navigation

  18. From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers

    Sep 1, 2026Siyi Liu, Hanjun Yang, Chenchen Zhang +7Efficient VLM InferenceMultimodal Reranking

  19. A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss

    Sep 1, 2026Suryaansh Jain, Rahasya Barkur, Vishal G +8Contrastive LearningImage Captioning

  20. Vision Is Not Overhead: One-Pass Block Drafting for Lossless Speculative Decoding in Vision-Language Models

    Aug 31, 2026Jungseob Lee, Seongtae Hong, Dongyub Jude Lee +4Efficient VLM InferenceSpeculative Decoding

  21. StreamScout: Learning When to Look Deeper for Streaming Video Understanding

    Aug 31, 2026Ce Zhang, Jing Bi, Jinxi He +9Adaptive InferenceStreaming Video Understanding

  22. PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

    Aug 27, 2026Junjie Liu, Shengyuan Ye, Xu ChenEfficient VLM InferenceVisual Token Pruning

  23. Multi-Image Visual Token Pruning in Large Visual Language Models

    Aug 27, 2026Rongyang Zhang, Chengqiang Lu, Cong Li +9Efficient VLM InferenceLarge Vision-Language Models

  24. QV-PIC: Query-Aware Visual Position-Independent Caching for Efficient RAG Serving

    Aug 12, 2026Yilin Liu, Rui Meng, Wangze Ni +5Retrieval-Augmented GenerationKV Caching

  25. StreamFlow: Dynamic Memory Flows for Streaming Video Understanding

    Aug 11, 2026Muxin Fu, Yifan Zhang, Wentao Zhang +5Memory-Augmented VLMsStreaming Video Understanding

  26. Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

    Aug 11, 2026Yuhang Song, Bor-Jiun Lin, Jiaxu Liu +3Memory-Augmented VLMsVision-Language Models

  27. When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

    Aug 11, 2026Congyang Ou, Ruike Song, Yang Zhou +3Efficient VLM InferenceLarge Vision-Language Models