Efficient VLM Inference

VLM: Vision-Language Model

Latest papers 322

All topics
CardsList
  1. Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding

    Jun 23, 2026Qitong Wang, Fan Du, Pranav Maneriker +2Efficient VLM InferenceEgocentric Vision

  2. video-SALMONN-R3^3: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

    Jun 23, 2026Yixuan Li, Guangzhi Sun, Yudong Yang +1Efficient VLM InferenceVideo QA

  3. P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling

    Jun 23, 2026Le Xiang, Chenxi Zhai, Shu Wei +5Multi-Token PredictionEfficient VLM Inference

  4. Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

    Jun 23, 2026Zengjie Chen, Yuxiang Cai, Jingcai Guo +3Efficient VLM InferenceMultimodal Large Language Models

  5. UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models

    Jun 22, 2026Lin Sun, Zhiwei Guan, Conglin Wang +7Efficient VLM InferenceEfficient VLA Model Inference

  6. Look Before You Zoom: Adaptive Routing for the Resolution-Context Trade-off in Visual RAG

    Jun 20, 2026Oanh N. Tran, Thanh Quoc Hung Le, Oscar Chew +2Multimodal RAGEfficient VLM Inference

  7. FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages

    Jun 19, 2026Juntong Peng, Qi Chen, Deyuan Qu +3Vision-Language ModelsVLMs for Autonomous Driving

  8. TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living

    Jun 18, 2026Arkaprava Sinha, Dominick Reilly, Siddharth Krishnan +2Temporal Video GroundingEfficient VLM Inference

  9. ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference

    Jun 18, 2026Yang Tan, Junlong Tong, Linan Yue +3Streaming Video UnderstandingEfficient VLM Inference

  10. SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering

    Jun 17, 2026Ayush Dwivedi, Qixin Wang, Ashvi Soni +5Visual Question AnsweringEfficient VLM Inference

  11. CABLE: Cloud-Assisted Bandwidth-efficient LMM-based Encoding for V2X Systems

    Jun 17, 2026Haohua Que, Zhipeng Bao, Qianyi Wu +1Efficient VLM InferenceEdge Computing

  12. ActiveSAM: Fast and Accurate Open-Vocabulary Semantic Segmentation with Frozen SAM 3

    Jun 15, 2026Tran Dinh Tien, Zhiqiang ShenEfficient VLM InferenceOpen-Vocabulary Semantic Segmentation

  13. DCP-Prune: Ultra-Low Token Pruning with Distribution Consistency Preservation

    Jun 15, 2026Xifeng Xue, Xiaokang Wang, Zirui Li +2Efficient VLM InferenceVisual Token Pruning

  14. Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

    Jun 15, 2026Yifan Wang, Peiming Li, Shiyu Li +5Efficient VLM InferenceLarge Vision-Language Models

  15. One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

    Jun 12, 2026Yongru Chen, Kai Zhang, Zeliang Zong +4Efficient VLM InferenceLarge Vision-Language Models

  16. ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation

    Jun 12, 2026Yanzhao Guo, Wenkai Chen, Jianwei ZhangLanguage-Conditioned Robot ManipulationEfficient VLM Inference

  17. Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

    Jun 10, 2026Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun LiuEfficient VLM InferenceVisual Token Pruning

  18. From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

    Jun 10, 2026Yuchen Guan, Xiao Li, Zongyu Guo +4Efficient VLM InferenceLong-Video Understanding

  19. AVIS: Adaptive Test-Time Scaling for Vision-Language Models

    Jun 10, 2026Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni +8Test-Time Adaptation of VLMsEfficient VLM Inference

  20. Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation

    Jun 7, 2026Yishuo Cai, Jiahui Liu, Yuanxin Liu +9Tool Use in VLMsEfficient VLM Inference

  21. Learnable Token Sparsification for Efficient Gigapixel Whole Slide Image Reasoning

    Jun 7, 2026Jingzhi Chen, Landi He, Zhuo Chen +2Efficient VLM InferenceMedical VLMs

  22. vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models

    Jun 6, 2026Khanh D. Nguyen, Hung T. Ho, Chinh T. Nguyen +5AI Accelerator InferenceEfficient VLM Inference

  23. RhinoVLA Technical Report

    Jun 5, 2026Huixi Technology, :, Chen Zhang +13Efficient VLM InferenceEfficient VLA Model Inference

  24. SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models

    Jun 5, 2026Sunoh Kim, Daeho UmVLM RobustnessVLM Adaptation

  25. MemoVAD: Resource-Efficient Video Anomaly Detection via Dynamic Semantic Memory in Edge Computing Scenarios

    Jun 4, 2026Guo Li, Jiandian Zeng, Yang Li +3Streaming Video UnderstandingEfficient VLM Inference