Vision-Language Grounding

Momentum

44 papers in the last four weeks, up 175% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 288

All topics
CardsList
  1. When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

    Aug 25, 2026Zhengxiang Wang, Owen RambowVLM EvaluationLarge Vision-Language Models

  2. Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding

    Aug 13, 2026Junyi Hu, Tian Bai, Fengyi Wu +7Vision-Language ModelsVision-Language Grounding

  3. MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

    Aug 11, 2026Changhao Xiang, Shangyu Xing, Zhen Wu +2Multimodal GroundingMultimodal Pretraining

  4. MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models

    Aug 11, 2026Yuan Wang, Hualiang Wang, Yixin Chen +6Unified Multimodal ModelsVision-Language Grounding

  5. Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

    Aug 10, 2026Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian +4Geometric Representation LearningVision-Language Grounding

  6. From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation

    Aug 10, 2026Zeyuan Ma, Jiaxin Chen, Di HuangUAV NavigationVision-Language Navigation

  7. SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models

    Aug 9, 2026Junjie He, Junfeng Li, Zhide Zhong +9World Models for RoboticsLanguage-Conditioned Robot Manipulation

  8. Evidence-RL: Towards Evidence-intensive Visual Reasoning

    Aug 8, 2026Haojie Huang, Xinlei Yu, Chengming Xu +6Vision-Language GroundingVisually Grounded Reasoning

  9. SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

    Aug 8, 2026Yizhi Li, Jiawei Jiang, Guanhong Wang +2Sports Video AnalysisVideo QA

  10. Vision-Language Grounding as Bidirectional Concept Correspondence

    Aug 8, 2026Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer +1Vision-Language GroundingVision-Language Alignment

  11. I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

    Aug 7, 2026Shibo Gao, Chongxiao Wang, Chenglong Huang +10Video QAVision-Language Grounding

  12. Human-AI Perceptual Alignment by Playing Hues and Cues

    Aug 7, 2026Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver +3VLM EvaluationVision-Language Grounding

  13. Visual Grounding in Zero-Shot Vision-Language Control

    Aug 6, 2026J. de Curtò, Dayani Plasencia, Diego Sánchez +1VLM EvaluationVLMs for Autonomous Driving

  14. Simile Understanding in Text-to-Image Models: An Evaluation Framework

    Aug 5, 2026Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito +4Figurative Language UnderstandingVision-Language Grounding

  15. When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

    Aug 5, 2026Yongxin Wang, Ruizhe Zhou, Yueling Tang +4Multimodal QAMultimodal Reasoning

  16. Thinking with Anchors: Grounded and Efficient Document Reasoning

    Aug 5, 2026Sichen Zhu, Yuchen Zhu, Wenzhuo Xu +13Vision-Language GroundingDocument Layout Analysis

  17. Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding

    Aug 4, 2026Jiapeng Li, Yong Li, Junjie Zhou +2Geospatial Representation LearningCross-Modal Retrieval

  18. SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification

    Aug 4, 2026Feixiang Liu, Likun Wang, Qiang Qiu +3Visual Spatial ReasoningVision-Language Grounding

  19. Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding

    Aug 4, 2026Xiuyuan Zhu, Ke Lu, Kun Dong +6Vision-Language Grounding

  20. Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models

    Aug 3, 2026Zhaokai Yin, Zhipeng ZhangVision-Language GroundingVision-Language-Action Models

  21. Dynamic Resolution Routing for Efficient Egocentric Grounding

    Aug 3, 2026Huixin Sun, Wangbo Zhao, Fanyue Wei +3Efficient VLM InferenceVision-Language Grounding

  22. VespaSeg: A Resource-Aware Ground-then-Segment Pipeline for Referring Expression Segmentation

    Aug 2, 2026Savindu Dilshan WickramasinghePromptable Image SegmentationEfficient VLM Inference

  23. SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

    Aug 1, 2026Yufei Zhang, Chenlu Zhan, Donghui Sun +2Vision-Language GroundingVLMs for Robotics

  24. CrossProjection: Geometric Grounding Beyond Viewpoint Change in Architectural Drawings

    Aug 1, 2026Kaho Li, Pengyu Zeng, Yuqin Dai +3Multi-View ConsistencyVision-Language Grounding