Vision-Language Grounding

Momentum

44 papers in the last four weeks, up 175% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 288

All topics
CardsList
  1. Improving Visual Grounding in Remote Sensing via Cluster-Guided Refinement and Model Ensemble Voting

    May 30, 2026Panav Shah, Geet Sethi, Ashutosh GandheRemote SensingVision-Language Grounding

  2. Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely

    May 29, 2026Chalamalasetti Kranti, Sherzod Hakimov, David SchlangenVisual Spatial ReasoningMulti-Agent Collaboration

  3. iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

    May 29, 2026Chang-Bin Zhang, Yujie Zhong, Qiang Zhang +1Large Vision-Language ModelsVision-Language Grounding

  4. ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models

    May 28, 2026Zihu Wang, Karthik Somayaji N. S, Peng LiVisual ReasoningLarge Vision-Language Models

  5. Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering

    May 28, 2026Soumyadeep Jana, Pulkit Mittal, Sanasam Ranbir SinghHallucination in Language ModelsLarge Vision-Language Models

  6. LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

    May 26, 2026Shihao Wang, Shilong Liu, Yuanguo Kuang +10Efficient VLM InferenceVision-Language Grounding

  7. PinPoint: Prompting with Informative Interior Points

    May 26, 2026Pouya Sadeghi, Shawn He, Pedro Pablo Guerrero Vela +3Image SegmentationPromptable Image Segmentation

  8. OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following

    May 26, 2026Qiaomu Miao, Haoyu Wu, Jingyi Xu +2Gaze EstimationVision-Language Grounding

  9. Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker

    May 25, 2026Zongjian Wu, Lei ZhangVLM EvaluationVision-Language Grounding

  10. Binding Visual Features Point by Point

    May 25, 2026Udith Haputhanthri, Declan Campbell, Rim Assouel +2Vision-Language ModelsVLM Interpretability

  11. Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence

    May 25, 2026Yufei Zheng, Xuhan Zhu, Zide Liu +9Visual Spatial ReasoningMetric Depth Estimation

  12. PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

    May 22, 2026Rim Assouel, Amir Bar, Michal Drozdzal +1Visual Spatial ReasoningSynthetic Data Generation

  13. Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?

    May 21, 2026Zixuan Lan, Luzhe Sun, Matthew R. Walter +1VLM EvaluationVLM Interpretability

  14. Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

    May 21, 2026Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos +2Object Hallucination in VLMsVLM Interpretability

  15. Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception

    May 21, 2026Rusiru Thushara, Yasiru Ranasinghe, Jay Paranjape +1Thermal ImagingVisual Question Answering

  16. VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

    May 20, 2026Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu +5VLM EvaluationVisual Question Answering

  17. WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents

    May 19, 2026Bingnan Liu, Chenhang Cui, Rui Huang +7VLM EvaluationAI Agent Benchmarks

  18. Mechanisms of Object Localization in Vision-Language Models

    May 19, 2026Timothy Schaumlöffel, Martina G. Vilas, Gemma RoigVision-Language ModelsVLM Interpretability

  19. P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation

    May 19, 2026Kai Sheng, Liuyi Wang, Haojie Dai +5Embodied NavigationVision-Language Navigation

  20. EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

    May 18, 2026Dongyan Lin, Phillip Rust, Angel Villar Corrales +19VLM EvaluationVision-Language Models

  21. Key-Gram: Extensible World Knowledge for Embodied Manipulation

    May 18, 2026Jingjing Fan, Siyuan Li, Botao Ren +1Memory-Augmented VLMsLanguage-Conditioned Robot Manipulation

  22. Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs

    May 18, 2026Jun-Yu Pan, Yansen Wang, Enze Zhang +3EEG DecodingEEG-Based Visual Decoding

  23. Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

    May 18, 2026Xinpeng Dong, Min Zhang, Kairong Han +3Object Hallucination in VLMsMultimodal Large Language Models

  24. See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

    May 18, 2026Boyuan Sun, Bowen Yin, Yuanming Li +2Cross-Modal LearningVideo Object Segmentation

  25. SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning

    May 18, 2026Xiao Yang, Ronghao Fu, Zhiwen Lin +10VLM EvaluationVLM Robustness