VLM Inference

VLM: Vision-Language Model

Latest papers 56

All topics
CardsList
  1. Why VLMs Miss Small Objects, and When Zooming In Is Safe

    Oct 7, 2026Junzhe Shi, Yuan Gan, Shida JiangVision-Language ModelsVLM Inference

  2. CVIF: A Criticality-Driven Visual Intervention Framework for Geometric Diagram Understanding in MLLMs

    Oct 5, 2026Jiahui Kang, Bifan Wei, Lingling Zhang +4Test-Time Adaptation of VLMsVisual Reasoning

  3. ReSight-SMC: Two-Stage Power Sampling via Island SMC with Visual Scouts

    Sep 28, 2026Yaowen Zhang, Xiangyu Qiu, Junyi Hu +5Markov Chain Monte CarloLarge Vision-Language Models

  4. INTCORT: Training-Free Spatial Reasoning Enhancement for Vision-Language Models via Input Transformations and Confidence Routing

    Sep 21, 2026Haoran Sun, Jingqi Xu, Yanhui Li +3Visual Spatial ReasoningVLM Reasoning

  5. Compressing AI Traffic: Standardized Neural Network Coding of Visual-Token Representations in Split Vision-Language Inference

    Sep 1, 2026Reza Heidari, Hamed R. Tavakoli, Juho KannalaVisual Token CompressionVLM Inference

  6. LOCI: A Locator-Critic with Refinement Loop

    Aug 31, 2026Walid Bousselham, Mathilde Caron, Arsha Nagrani +1Visual Question AnsweringVision-Language Grounding

  7. How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems

    Aug 8, 2026Henri Vanhuynegem, Weitao Xu, Yiran Shen +1VLM EvaluationVisual Question Answering

  8. Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models

    Jul 25, 2026Sultan Alshehri, Zhantao Yang, Han Zhang +1Vision-Language ModelsVLM Reasoning

  9. A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi

    Jul 16, 2026A. C. Opus, J. Q. LuEfficient Transformer InferenceGPU Kernel Optimization

  10. What Keeps Vision-Language Models Looking at the Image?

    Jul 14, 2026Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi +3Vision-Language ModelsVLM Interpretability

  11. Sparse Attention for Dense Open-Vocabulary Prediction in CLIP

    Jul 8, 2026Fatimah Zohra, Chen Zhao, Shuming Liu +1Visual AttentionFine-Grained Image Retrieval

  12. QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

    Jul 6, 2026Wei Ao, Lan Wang, Vishnu Naresh BoddetiTemporal Video GroundingStreaming Video Understanding

  13. Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models

    Jul 2, 2026Zikai Zhang, Rui Hu, Olivera Kotevska +1Adversarial Attacks on VLMsLarge Vision-Language Models

  14. ProCal: Inference-Time Proposal Calibration for Open-Vocabulary Object Detection

    Jul 2, 2026Jae-Ryung Hong, Ho-Joong Kim, Seong-Whan LeeOpen-Vocabulary Object DetectionVLM Inference

  15. Towards High-Resolution Visual Perception via Hierarchical Entity Exploration

    Jul 1, 2026Ziyu Ma, Shidong Yang, Yuxiang Ji +5Large Vision-Language ModelsFine-Grained Visual Perception

  16. Dismantling Pathological Shortcuts: A Causal Framework for Faithful LVLM Decoding

    Jun 25, 2026Liu Yu, Can Chen, Ping Kuang +3Object Hallucination in VLMsFaithfulness in VLMs

  17. MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

    Jun 16, 2026Xingming Li, Ao Cheng, Qiyao Sun +4VLM RobustnessVision-Language Models

  18. VisualClaw: A Real-Time, Personalized Agent for the Physical World

    Jun 15, 2026Haoqin Tu, Jianwen Chen, Zijun Wang +14Continual Learning for LLM AgentsAI Agent Benchmarks

  19. NAVI-Orbital: First In-Orbit Demonstration of a Zero-Shot Vision-Language Model for Autonomous Earth Observation

    Jun 5, 2026Juan Manuel Delfa Victoria, Taran Cyriac John, Andrew W. HersonRemote Sensing Image UnderstandingVision-Language Models

  20. Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models

    May 29, 2026Yijie Tong, Yifan Hou, Shaobo Cui +2VLM EvaluationVision-Language Models

  21. Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering

    May 28, 2026Soumyadeep Jana, Pulkit Mittal, Sanasam Ranbir SinghHallucination in Language ModelsLarge Vision-Language Models