VLM Inference

VLM: Vision-Language Model

Latest papers 56

All topics
CardsList
  1. Self-Prophetic Decoding to Unlock Visual Search in LVLMs

    May 27, 2026Zhendong He, Qiyuan Dai, Guanbin Li +2Large Vision-Language ModelsVLM Reasoning

  2. The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP

    May 26, 2026Kahyeon Nam, Hyesong ChoiVLM QuantizationActivation Quantization

  3. MetaphorVU: Towards Metaphorical Video Understanding

    May 25, 2026Zhuoqun Li, Boxi Cao, Guiping Jiang +13VLM EvaluationFigurative Language Understanding

  4. Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration

    May 24, 2026Yuanzhi Xu, Qian Gao, Jun Fan +4VLM RobustnessVision-Language Models

  5. Improving 3D Labeling in Self-Driving by Inferring Vehicle Information using Vision Language Models

    May 20, 2026Steven Chen, Shivesh Khaitan, Nemanja DjuricVLMs for Autonomous DrivingAutonomous Driving

  6. Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

    May 18, 2026Xinpeng Dong, Min Zhang, Kairong Han +3Object Hallucination in VLMsMultimodal Large Language Models

  7. LATERN: Test-Time Context-Aware Explainable Video Anomaly Detection

    May 14, 2026Mitchell Piehl, Muchao YeInterpretable Anomaly DetectionVLM Reasoning

  8. Test-Time Hinting for Black-Box Vision-Language Models

    May 13, 2026Kaihua Hou, Abhijith Varma Mudunuri, Jiaxing Qiu +3Visual Question AnsweringVLM Adaptation

  9. Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium

    May 11, 2026Qingxin Xiao, Peilin Zhao, Yangyang Zhao +2VLM RobustnessHallucination in Language Models

  10. What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs

    May 10, 2026Jiaping Lin, Fei Shen, Junzhe Li +4GUI GroundingVision-Language Grounding

  11. VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA

    May 6, 2026Haibin He, Maoyuan Ye, Jing Zhang +2Video QAVideo Frame Selection

  12. EdgeFM: Efficient Edge Inference for Vision-Language Models

    Apr 30, 2026Mengling Deng, Yuanpeng Chen, Sheng Yang +12Efficient VLM InferenceEdge Inference

  13. Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning

    Apr 28, 2026Yashwant Pravinrao Bangde, Debaditya RoyObject Hallucination in VLMsVision-Language Grounding

  14. Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation

    Apr 27, 2026Yubo Jiang, Xin Yang, Abudukelimu Wuerkaixi +7Hallucination in Language ModelsObject Hallucination in VLMs

  15. Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

    Apr 25, 2026Boqi Chen, Xudong Liu, Yunke Ao +1Visual Question AnsweringLanguage Model Calibration

  16. Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Vision-Language ModelsHallucination in Language Models

  17. Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents

    Apr 10, 2026Sangwon Baik, Gunhee Kim, Mingi Choi +1Language-Conditioned Robot ManipulationObject Pose Estimation

  18. CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference

    Apr 7, 2026Yulin Zou, Wenyan Chen, Yan Chen +6Efficient VLM InferenceVLM Inference

  19. Mitigating Cross-Image Information Leakage in Multi-Image Understanding with Large Vision-Language Models

    Aug 19, 2025Yeji Park, Minyoung Lee, Sanghyuk Chun +1Large Vision-Language ModelsVLM Reasoning

  20. AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference via Dynamical Text Guidance

    Aug 8, 2025Weichen Zhang, Zhui Zhu, Ningbo Li +5Efficient VLM InferenceVisual Token Pruning

  21. Mitigating Hallucinations via Inter-Layer Consistency Aggregation in Large Vision-Language Models

    May 18, 2025Kai Tang, Jinhao You, Yichen Guo +8Vision-Language ModelsHallucination in Language Models