Efficient VLM Inference

VLM: Vision-Language Model

Latest papers 322

All topics
CardsList
  1. Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

    Jun 3, 2026SooHwan Eom, Jay Shim, Gwanhyeong Koo +4MambaEfficient VLM Inference

  2. Frames2LoRA: Parametric Video Internalization for Vision-Language Models

    Jun 3, 2026Manan Suri, Sarvesh Baskar, Dinesh ManochaVLM AdaptationEfficient VLM Inference

  3. When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics

    Jun 2, 2026Jiahui Wang, Kai Zhang, Mai Han +1Vision-Language ModelsEfficient VLM Inference

  4. TGV-KV: Text-Grounded KV Eviction for Vision-Language Models

    Jun 2, 2026Jizhihui Liu, Ruizi Han, Miao Zhang +4Vision-Language ModelsEfficient VLM Inference

  5. ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents

    Jun 2, 2026Anjie Liu, Yan Song, Zhixun Chen +3Tool Use in VLMsTool-Augmented Language Model Agents

  6. SCOPE: Real-Time Natural Language Camera Agent at the Edge

    Jun 1, 2026Nikolaj Hindsbo, Sina Ehsani, Pragyana MishraEfficient VLM InferenceAI Control

  7. AdaCodec: A Predictive Visual Code for Video MLLMs

    Jun 1, 2026Haowen Hou, Zhen Huang, Zheming Liang +8Predictive CodingEfficient VLM Inference

  8. InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models

    Jun 1, 2026Xinxin Liu, Shiwei Gan, Xiao Liu +3Efficient VLM InferenceVideo-Language Models

  9. MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention

    Jun 1, 2026Pengyu Wang, Chenkun Tan, Shaojun Zhou +18Streaming Video UnderstandingEfficient VLM Inference

  10. EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models

    Jun 1, 2026Hongyu Lu, Feng Zhang, Wenwei Jin +5Efficient VLM InferenceLarge Vision-Language Models

  11. FlowNar: Scalable Streaming Narration for Long-Form Videos

    May 30, 2026Zeyun Zhong, Manuel Martin, Chengzhi Wu +4Streaming Video UnderstandingEfficient VLM Inference

  12. LASER: Loss-Aware Singular-value Decomposition and Rank Allocation for Efficient Low-Precision Vision-Language Models

    May 30, 2026Haiyu Wang, Yutong Wang, Leshu Li +2Vision-Language ModelsEfficient VLM Inference

  13. ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs

    May 30, 2026Yiling Gao, Hongchen Wei, Zhenzhong ChenEfficient VLM InferenceLarge Vision-Language Models

  14. Zamba2-VL Technical Report

    May 29, 2026Hassan Shapourian, Kasra Hejazi, Olabode M. Sule +1Vision-Language ModelsEfficient VLM Inference

  15. Linear Scaling Video VLMs for Long Video Understanding

    May 29, 2026Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos NieblesStreaming Video UnderstandingEfficient VLM Inference

  16. YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models

    May 29, 2026Ting Chen, Geng Li, Guohao Chen +5Efficient VLM InferenceObject Hallucination in VLMs

  17. PEEK: Picking Essential frames via Efficient Knowledge distillation

    May 29, 2026Killian Steunou, Anas Filali Razzouki, Khalil Guetari +2Efficient VLM InferenceVideo Captioning

  18. Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation

    May 29, 2026Zhiyuan Yang, Jiahao Cheng, Vincent Quoc-Huy Trinh +1Computational PathologyMedical Report Generation

  19. PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding

    May 28, 2026Selim Kuzucu, Alessio Tonioni, Vasile Lup +3Image TokenizationEfficient VLM Inference

  20. VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies

    May 28, 2026Mingjian Gao, Wenqiao Zhang, Yuqian Yuan +9Efficient VLM InferenceEfficient VLA Model Inference

  21. EarlyTom: Early Token Compression Completes Fast Video Understanding

    May 28, 2026Hesong Wang, Xin Jin, Lu Lu +4Video UnderstandingEfficient VLM Inference

  22. SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation

    May 28, 2026Shilin Ma, Chubin Zhang, Changyuan Wang +6Efficient VLM InferenceRobotic Manipulation

  23. AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference

    May 28, 2026Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan KandemirLLM PruningVision-Language Models

  24. ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

    May 28, 2026Ye Li, Huanan Liu, Kangye Ji +7Efficient VLM InferenceEfficient VLA Model Inference

  25. Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models

    May 28, 2026Kai Bian, Xucheng Guo, Bin Chen +4Medical ImagingEfficient VLM Inference

  26. CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models

    May 27, 2026Fengze Yang, Bo Yu, Xuewen Luo +2Efficient VLM InferenceKV-Cache Compression

  27. Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models

    May 27, 2026Landi He, Mingde Yao, Shawn Young +1Vision-Language ModelsEfficient VLM Inference