Vision-Language Grounding

Momentum

44 papers in the last four weeks, up 175% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 288

All topics
CardsList
  1. RefCaptioner: Multi-Reference Image-Grounded Video Captioning

    Jul 30, 2026Tengfei Liu, Yang Shi, Yuran Wang +16Video CaptioningVision-Language Grounding

  2. One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

    Jul 30, 2026Rui Tang, Wentao Yang, Peirong Zhang +4Visual TokenizationScene Text Recognition

  3. Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction

    Jul 30, 2026Lei Yang, Xinze Liu, Dayan Wu +7Hallucination Detection in VLMsLLM Hallucination Mitigation

  4. Prior Directions: Why GUI Grounding Gets Locked in the Past

    Jul 29, 2026Weile Gong, Zijian Lu, Mingcai Chen +3Vision-Language ModelsGUI Grounding

  5. Towards Faithful Sentimental Image Captioning via Evidence-Aware Multi-Agent Reasoning

    Jul 28, 2026Tiecheng Cai, Zexian Yang, Chao Chen +2Image CaptioningVision-Language Grounding

  6. IMPRINT: Image-Conditioned Query Enrichment for Long-Tail Object Goal Navigation

    Jul 27, 2026Jelin Raphael Akkara, Filippo Ziliotto, Luciano Serafini +2Vision-Language GroundingObject-Goal Navigation

  7. DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering

    Jul 27, 2026Yue Zhang, Xiangyu Li, Wanshu Fan +2Visual Question AnsweringVision Transformer

  8. CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

    Jul 23, 2026Hanseok Oh, Parishad BehnamGhader, Benno Krojer +4VLM EvaluationMultimodal RAG

  9. Do Pathology Vision-Language Models Truly See Pathology?

    Jul 23, 2026Chengyang Zhang, Wenchuan Zhang, Bo Li +10VLM EvaluationComputational Pathology

  10. ProCap: Prominence-guided Object Rectification for Faithful and Comprehensive Video Captioning

    Jul 23, 2026Debjyoti Das Adhikary, Aritra Hazra, Partha Pratim ChakrabartiVideo CaptioningVision-Language Grounding

  11. WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding

    Jul 17, 2026Zonglin Yang, Wei-Zhen Liang, Nevin Lawrence +4Open-Vocabulary Object DetectionWeed Detection

  12. How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

    Jul 17, 2026Navya Gupta, Bingjie Xu, Avinash Anand +2Visual Question AnsweringVLM Interpretability

  13. IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models

    Jul 17, 2026Xiuyuan Zhu, Ke Lu, Hao Wu +4Cross-Modal Knowledge DistillationMultimodal Large Language Models

  14. Fine-grained CLIP fine-tuning with self-annotated region alignment

    Jul 15, 2026Chenyang Zhao, Wei Lin, Antoni B. Chan +1VLM AdaptationVision-Language Grounding

  15. GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

    Jul 15, 2026Kaicong Huang, Weiheng Oh, Ruimin KeZero-Shot LearningVision-Language Grounding

  16. CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

    Jul 14, 2026Lin Peng, Cong Wan, Zeyu Guo +2VLM EvaluationVisual Reasoning

  17. Instance-Enriched Semantic Maps for Visual Language Navigation

    Jul 14, 2026Jiho Hong, Eunae Kang, Sanghyun Kim +1Embodied NavigationVision-Language Navigation

  18. SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

    Jul 13, 2026Mingjie Xie, Guangjun He, Dongli Xu +5VLM RobustnessVision-Language Grounding

  19. Evaluation of Multilingual Ability to Use Spatial Deictic Expressions in Vision-Language Models

    Jul 8, 2026Kaito Watanabe, Taisei Yamamoto, Tomoki Doi +1Visual Spatial ReasoningMultilingual VLM Evaluation

  20. Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

    Jul 7, 2026Yoav Baron, Sara Dorfman, Roni Paiss +2Visual Place RecognitionVLM Interpretability

  21. Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning

    Jul 7, 2026Yake Wei, Yuan Wang, Fengyun Rao +2Vision-Language GroundingVLM Reasoning

  22. Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies

    Jul 6, 2026Adrian Szvoren, Dimitrios Kanoulas, Nilufer TuptukVisual NavigationVision-Language Navigation

  23. Learning Structured Visual Compositional Representations for Weakly Supervised Referring Expression Comprehension

    Jul 6, 2026Lian Xu, Mohammed Bennamoun, Farid Boussaid +3Visual Representation LearningVision-Language Grounding

  24. Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs

    Jul 4, 2026Anas Zafar, Leema Krishna Murali, Siddhant Bharadwaj +2VLM EvaluationCounterfactual Evaluation

  25. Token-Based Affordance Grounding with Large Vision-Language Models

    Jul 3, 2026Seung Il Lee, Qinqian Lei, Daguang Xu +4Zero-Shot LearningVision-Language Grounding

  26. GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

    Jul 1, 2026Dianyu Wang, Peirong Zhang, Xuyang Li +2Vision-Language GroundingVLM Reasoning