Vision-Language Grounding

Momentum

44 papers in the last four weeks, up 175% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 288

All topics
CardsList
  1. COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

    Apr 30, 2026Bingli Wang, Huanze Tang, Haijun Lv +5Vision-Language ModelsVision-Language Grounding

  2. InterPartAbility: Phrase-Region Grounding for Interpretable Text-to-Image Person Re-Identification

    Apr 29, 2026Shakeeb Murtaza, Aryan Shukla, Rajarshi Bhattacharya +2VLM InterpretabilityVision-Language Grounding

  3. Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning

    Apr 29, 2026Hao Guo, Fei Wang, Junjie Chen +4VLM RobustnessVisual Reasoning

  4. Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning

    Apr 28, 2026Yashwant Pravinrao Bangde, Debaditya RoyObject Hallucination in VLMsVision-Language Grounding

  5. A systematic evaluation of vision-language models for observational astronomical reasoning tasks

    Apr 27, 2026Wenke Ren, Hengxiao Guo, Wenwen Zuo +1VLM EvaluationVision-Language Models

  6. Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation

    Apr 27, 2026Yubo Jiang, Xin Yang, Abudukelimu Wuerkaixi +7Hallucination in Language ModelsObject Hallucination in VLMs

  7. Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues

    Apr 27, 2026Beomchan Park, Seongho Kim, Hyunjun Kim +2VLM RobustnessLLM Grounding

  8. CAGE-SGG: Counterfactual Active Graph Evidence for Open-Vocabulary Scene Graph Generation

    Apr 24, 2026Suiyang Guang, Chenyu Liu, Ruohan Zhang +1Vision-Language Grounding

  9. Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

    Apr 23, 2026Chentao Li, Zirui Gao, Mingze Gao +3Multimodal QAVision-Language Grounding

  10. VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

    Apr 23, 2026Byeonggeuk Lim, Kyeonghyun Kim, JungMin Yun +1VLM EvaluationCoT Reasoning

  11. Can MLLMs "Read" What is Missing?

    Apr 23, 2026Jindi Guo, Chaozheng Huang, Xi FangVLM EvaluationDocument Understanding

  12. Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding

    Apr 23, 2026Wenkai Wang, Xiyun Li, Hongcan Guo +5Reinforcement LearningGUI Grounding

  13. Beyond Pixels: Introspective and Interactive Grounding for Visualization Agents

    Apr 22, 2026Yiyang Lu, Woong Shin, Ahmad Maroof Karimi +3Scientific VisualizationData Visualization

  14. From Scene to Object: Text-Guided Dual-Gaze Prediction

    Apr 22, 2026Zehong Ke, Yanbo Jiang, Jinhao Li +5Gaze EstimationAutonomous Driving Perception

  15. PLaMo 2.1-VL Technical Report

    Apr 21, 2026Tommi Kerola, Yuya Masuda, Takashi Masuko +5Visual Question AnsweringVision-Language Models

  16. AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation

    Apr 20, 2026Rui Qian, Chuanhang Deng, Qiang Huang +6Image SegmentationText-Guided Image Segmentation

  17. Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation

    Apr 20, 2026Zhen Liu, Yuhan Liu, Jinjun Wang +3Embodied NavigationVision-Language Navigation

  18. DiffuSAM: Diffusion Guided Zero-Shot Object Grounding for Remote Sensing Imagery

    Apr 20, 2026Geet Sethi, Panav Shah, Ashutosh Gandhe +1Remote Sensing Image UnderstandingDiffusion Model Guidance

  19. Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models

    Apr 20, 2026Ziyao Tang, Pengkun Jiao, Bin Zhu +3VLM EvaluationVLM Robustness

  20. AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation

    Apr 19, 2026Rongsheng Hu, Runwei Guan, Yicheng Di +2Visual Question AnsweringLLM-Assisted Annotation

  21. Prompt Sensitivity in Vision-Language Grounding: How Small Changes in Wording Affect Object Detection

    Apr 18, 2026Dawar Jyoti Deka, Amit Sethi, Syed Mohammad AliOpen-Vocabulary Object DetectionVLM Robustness

  22. DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models

    Apr 18, 2026JiYang Wang, Jiawei Chen, Mengqi Xiao +3VLM EvaluationHallucination Detection in VLMs

  23. Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

    Apr 8, 2026Mengdan Zhu, Senhao Cheng, Liang ZhaoVLM InterpretabilityLatent Visual Reasoning