Vision-Language Grounding

Momentum

44 papers in the last four weeks, up 175% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 288

All topics
CardsList
  1. BindCLIP: One Balanced Coupling For Compositional Vision Language Scoring

    Sep 20, 2026Liuyang Song, Yi Zhang, Zhongyi Deng +2Vision-Language ModelsVision-Language Grounding

  2. Pay More Attention To Text In High-Resolution MLLMs

    Sep 20, 2026Zhongkuan Mao, Wenzhuo Zhao, Xianjie Liu +7Visual Question AnsweringVision-Language Grounding

  3. DocAttriBench: Benchmarking Answer Grounding in Document Visual Question Answering

    Sep 17, 2026Luca De Grandis, Silvia Cappelletti, William Raccagni +3Visual Question AnsweringVision-Language Grounding

  4. PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection

    Sep 16, 2026Sara Pieri, Evangelos Kazakos, Shizhe Chen +2Image CaptioningPanoptic Segmentation

  5. RankGround: Efficient High-Resolution GUI Grounding via Lightweight Reranker-Guided Crop Selection

    Sep 16, 2026Liyang Fan, Xinping Bi, Yitai Li +3Efficient Multimodal InferenceMultimodal Reranking

  6. GroundingVLN: Reasoning and Acting with Grounding for Vision-Language Navigation

    Sep 16, 2026Kailing Li, Yu Han, Tianwen Qian +4Vision-Language NavigationVision-Language Grounding

  7. Semantic-Spatial Agreement Verification for Mitigating Object Hallucination in Multimodal Large Language Models

    Sep 15, 2026Ziheng Ren, Qian Gao, Jun Fan +3Hallucination Detection in VLMsObject Hallucination in VLMs

  8. sensVLA: Spatially-Grounded Vision-Language-Action Model for Autonomous Wheel Loader

    Sep 15, 2026Gopi Krishna Erabati, Bjarne Johannsen, Angus Stewart +1Robotic ControlVision-Language Grounding

  9. ProtoLIP: From Sentence-Level to Object-Level Evidence Disentanglement

    Sep 14, 2026Yan Zhu, Yongbo Chen, Zhengming Ding +1Vision-Language ModelsPrototype Learning

  10. P-POSEMEM: Projective Semantic Memory for Consistent Language Grounding under Pose-Graph Rewrites

    Sep 14, 2026Ha Sier, Ali Salmasi, Mengya Xu +5Vision-Language GroundingGraph-Based Agent Memory

  11. ChitraMiti: Benchmarking Visual Grounding and Modality Reliance in Bengali Geometric Reasoning

    Sep 14, 2026Khan Raiyan Ibne Reza, Sanjana Aktar Maria, Sumaiya Tabassum Nimi +1Mathematical Reasoning BenchmarksMultilingual VLM Evaluation

  12. Vague2Detect: Handling Ambiguous Prompts in Knowledge-Based Open-World Detection

    Sep 9, 2026Ibrohimjon Muminov, Jihie KimOpen-Vocabulary Object DetectionVision-Language Grounding

  13. DSE-VTG: Dual-Side Enhancement for Training-Free Video Temporal Grounding

    Sep 8, 2026Zhuo Cao, Bingqing Zhang, Sen Wang +1Temporal Video GroundingTest-Time Adaptation of VLMs

  14. AirAnchor: Bridging Local and Global Spatial Information for Zero-Shot Aerial Vision-and-Language Navigation

    Sep 8, 2026Shanwei Fan, Bin Zhang, Zhiwei Xu +4Zero-Shot LearningUAV Navigation

  15. Human-Centric Image Captioning with Subject-Centered Spatial Understanding

    Sep 8, 2026Bozhou Li, Jiahang Zhang, Yue Ding +11VLM EvaluationImage Captioning

  16. DroneGround: Open-Vocabulary Drone Payload Characterization Using Synthetic Data and Grounded Vision-Language Models

    Sep 7, 2026Ami Pandat, Rajasekhar Punna, Gopika Vinod +1Open-Vocabulary Object DetectionVision-Language Grounding

  17. LOCI: A Locator-Critic with Refinement Loop

    Aug 31, 2026Walid Bousselham, Mathilde Caron, Arsha Nagrani +1Visual Question AnsweringVision-Language Grounding

  18. Cost-efficient Active Learning for Referring Image Segmentation and Grounding

    Aug 31, 2026Junbeom Hong, Seonghoon Yu, Hyung Rok Jung +2Active LearningReferring Image Segmentation

  19. Learning Compositional Spatio-Temporal Video Grounding with Synthetic Curriculum

    Aug 31, 2026Xingjian Wang, Shijian Wang, Yibo Wang +4Temporal Video GroundingSynthetic Data Generation

  20. VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs

    Aug 31, 2026Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +1Hallucination Detection in VLMsVLM Hallucination

  21. OPUS: A Simple yet Effective Unified Framework for Open-Vocabulary Detection

    Aug 31, 2026Xiaoyan Wei, Zhimin Yao, Ruilin Yang +4Open-Vocabulary Object DetectionVision-Language Grounding

  22. Semantic-Spatial Discriminability Enhancement for Generalized Visual Grounding

    Aug 31, 2026Kaiyan Lei, Xu-Yao ZhangVision-Language GroundingVisual Grounding

  23. ManGo: Manga Active Narrative Grounding Optimization

    Aug 30, 2026Hao Qiu, Junyan Wang, Zheyuan Liu +4Visual Question AnsweringRL for Language Model Reasoning