Efficient VLM Inference

VLM: Vision-Language Model

Latest papers 322

All topics
CardsList
  1. Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

    Aug 10, 2026Jiahao Shao, Yuanbo Yang, Yiyi Liao +3Tool Use in VLMsEfficient VLM Inference

  2. Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

    Aug 10, 2026Jingbo Wen, Liang He, Mingyu Cao +4Efficient VLM InferenceVisual Token Compression

  3. VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

    Aug 9, 2026Yuqi Zhang, Cheng Chen, Yuyu Guo +6Vision-Language ModelsEfficient VLM Inference

  4. How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems

    Aug 8, 2026Henri Vanhuynegem, Weitao Xu, Yiran Shen +1VLM EvaluationVisual Question Answering

  5. An AI4AI Framework for Visual Token Pruning

    Aug 7, 2026Zhen Liu, Wenli Huang, Wei Song +3Automated Algorithm DiscoveryEfficient VLM Inference

  6. RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

    Aug 7, 2026Qiyanhui Lu, Han Wu, Rongjian Xu +6Efficient VLM InferenceLarge Vision-Language Models

  7. Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

    Aug 7, 2026Minseok Kang, Hyunwoo Kim, Chanyoung Kim +3Vision-Language ModelsEfficient VLM Inference

  8. Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding

    Aug 6, 2026Bo Zhang, Wenxin Wang, Feng Chen +4Efficient VLM InferenceLong-Video Understanding

  9. DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models

    Aug 5, 2026Chen Zhong, Xiao An, Zijie Wang +3Efficient VLM InferenceVisual Token Pruning

  10. Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

    Aug 5, 2026Pengcheng Pan, Xinfang ZhangVisual Question AnsweringEfficient VLM Inference

  11. TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

    Aug 4, 2026Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman +4Efficient VLM InferenceClustering

  12. RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

    Aug 4, 2026Jian Zou, Xiaoyu Xu, Zhihua Wang +3Efficient VLM InferenceVisual Token Pruning

  13. When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

    Aug 4, 2026Ke Li, Jiayu Chen, Maoliang Li +5Efficient VLM InferenceLarge Vision-Language Models

  14. Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Pruning

    Aug 4, 2026Yuyao Sun, Tao Deng, Shuang Li +3Visual AttentionEfficient VLM Inference

  15. GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

    Aug 4, 2026Mengjie Zhang, Qihui Zhu, Tao Zhang +10Efficient VLM InferenceVideo-Language Models

  16. MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

    Aug 3, 2026Ambarish Govindarajulu Kaliamurthi, Kaikai LiuVLMs for Autonomous DrivingEfficient VLM Inference

  17. EOVSAM: Efficient Open-Vocabulary Segmentation with SAM 3 in One Pass

    Aug 3, 2026Haomin Peng, Yongkang Li, Zhaoxiang Liu +4Efficient VLM InferenceOpen-Vocabulary Semantic Segmentation

  18. Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

    Aug 3, 2026Long Qian, Jiaqi Wei, Bingke Zhu +2Efficient VLM InferenceCoreset Selection

  19. DiffPrune: differentiable information throttling for token pruning in vision-language models

    Aug 3, 2026Landi He, Mingde Yao, Shawn Young +1Vision-Language ModelsEfficient VLM Inference

  20. AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

    Aug 3, 2026Jingqi Tian, Haoji Zhang, Lin Chen +7Efficient VLM InferenceRL for Language Model Reasoning

  21. DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models

    Aug 3, 2026Yongkang Zhou, Xiang Xia, Cheng Yan +2Vision-Language ModelsEfficient VLM Inference

  22. CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

    Aug 3, 2026Yu Chen, Xiaohong Li, Xiaole Wang +3Efficient VLM InferenceLarge Vision-Language Models

  23. Dynamic Resolution Routing for Efficient Egocentric Grounding

    Aug 3, 2026Huixin Sun, Wangbo Zhao, Fanyue Wei +3Efficient VLM InferenceVision-Language Grounding

  24. Linear Multi-Timescale Retention as a Memory-Efficient Vision-Language Bridge

    Aug 3, 2026Ashfak Yeafi, Mehedi Hasan, Md Khairul IslamMemory-Augmented VLMsVision-Language Models

  25. Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

    Aug 2, 2026Jiayang He, Tianling Xu, Diancheng Kang +4Efficient VLM InferenceVideo-Language Models