Efficient VLM Inference

VLM: Vision-Language Model

Latest papers 322

All topics
CardsList
  1. Dynamic Execution Commitment of Vision-Language-Action Models

    May 12, 2026Feng Chen, Xianghui Wang, Yuxuan Chen +4VLM RobustnessEfficient VLM Inference

  2. LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs

    May 12, 2026Jingfeng Chen, Jiawen Qian, Wendi Deng +5Efficient VLM InferenceMultimodal Large Language Models

  3. GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs

    May 11, 2026Mohamed Eltahir, Lama Ayash, Ali Habibullah +2Efficient VLM InferenceLong-Video Understanding

  4. LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models

    May 11, 2026Nikolaos Gkalelis, Vasileios MezarisVision-Language ModelsEfficient VLM Inference

  5. EchoPrune: Interpreting Redundancy as Temporal Echoes for Efficient VideoLLMs

    May 11, 2026Jiameng Li, Minye Wu, Jiezhang Cao +2Efficient VLM InferenceToken Pruning

  6. ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning

    May 11, 2026Yuna Lee, Kyoungho Min, Yulhwa KimEfficient VLM InferenceLarge Vision-Language Models

  7. LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models

    May 11, 2026Boyang Shen, Kaixiang Yang, Hao Wang +4Efficient VLM InferenceEfficient VLA Model Inference

  8. Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT

    May 10, 2026Alaa Asfour, Christopher Indris, Leihan Chen +2Cross-Modal Knowledge Distillation3D Spatial Reasoning

  9. Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs

    May 10, 2026Yigui Feng, Qinglin Wang, Yang Liu +1Efficient VLM InferenceVisual Tokenization

  10. LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?

    May 9, 2026Kechen Fang, Yihua Qin, Chongyi Wang +3Efficient VLM InferenceMultimodal Large Language Models

  11. How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A

    May 9, 2026YiJie Huang, Yiqun Zhang, Zhuoyue Jia +7Efficient VLM InferenceLarge Vision-Language Models

  12. DAPE: Dynamic Non-uniform Alignment and Progressive Detail Enhancement Techniques for Improving the Performance of Efficient Visual Language Models

    May 9, 2026Mengyuan Tian, Qiyan Zhao, Yanan Wang +1VLM AdaptationEfficient VLM Inference

  13. Zero-Shot Chinese Character Recognition via Global-Local Dual-Branch Alignment and Hierarchical Inference

    May 9, 2026Wei Cao, Hao Xu, Xiaolei DiaoZero-Shot LearningEfficient VLM Inference

  14. Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding

    May 8, 2026Hang Wu, Sherin Mary Mathews, Yujun Cai +2Streaming Video UnderstandingEfficient VLM Inference

  15. GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs

    May 7, 2026Pranav Mantini, Shishir K. ShahVision-Language ModelsVLM Adaptation

  16. VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading

    May 7, 2026Cheng Xu, Xiaofeng Hou, Jiacheng Liu +1Expert OffloadingVision-Language Models

  17. VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding

    May 7, 2026Kuanwei Lin, Wenhao Zhang, Ge LiEfficient VLM InferenceLong-Video Understanding

  18. Visual Text Compression as Measure Transport

    May 6, 2026Lv Tang, Tianyi Zheng, Yang Liu +2Efficient VLM InferenceVisual Tokenization

  19. ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation

    May 6, 2026Wei Li, Jizhihui Liu, Li Yixing +3Multi-View ConsistencySpatiotemporal Reasoning

  20. VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models

    May 5, 2026JF Bastien, Sam D'AmicoEfficient VLM InferenceVideo-Language Models

  21. Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference

    May 4, 2026Yudong Liu, Yuan Li, Zijia Tang +12Efficient VLM InferenceEfficient VLA Model Inference

  22. LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment

    May 4, 2026Junyi Hu, Qiji Zhou, Lei Zhang +1VLM RobustnessEfficient VLM Inference

  23. WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization

    May 4, 2026Wei Tao, Xiaoyang Qu, Peiqiang Wang +4Mixed-Precision QuantizationVLM Quantization

  24. CoVSpec: Efficient Device-Edge Co-Inference for Vision-Language Models via Speculative Decoding

    May 4, 2026Yuanyuan Jia, Shunpu Tang, Qianqian YangEfficient VLM InferenceEdge Computing

  25. Decouple and Cache: KV Cache Construction for Streaming Video Understanding

    May 3, 2026Zhanzhong Pang, Dibyadip Chatterjee, Fadime Sener +1Streaming Video UnderstandingKV Caching

  26. Make Your LVLM KV Cache More Lightweight

    May 1, 2026Xihao Chen, Yangyang Guo, Roger ZimmermannKV CachingEfficient VLM Inference