Vision-Language Grounding

Momentum

44 papers in the last four weeks, up 175% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 283

All topics
CardsList
  1. GeoPID: Decomposing and Steering Visual Information in Vision-Language Models

    Oct 6, 2026Seulgi Kim, Zhixiong Zhang, Xinwei Zhang +2Vision-Language Grounding

  2. Readout Blindness: VLM Scores Miss the Spatial Direction Their Frozen Encoders Retain

    Oct 5, 2026Guangyuan Li, Tianming Du, Yan Jiang +2VLM EvaluationVision-Language Grounding

  3. Visual Grounding Safety in Vision-Language Models

    Oct 5, 2026Erfan Shayegani, Kundan Krishna, Yue Dong +3VLM EvaluationVision-Language Grounding

  4. Answer with Evidence: Consistency-Aware Grounded Visual Question Answering for Roadside Traffic Scenes

    Oct 4, 2026Runwei Guan, Rongsheng Hu, Shangshu Chen +9Autonomous Driving BenchmarksVisual Question Answering

  5. Recurrent Latent Visual Search for GUI Grounding

    Oct 4, 2026Kaiyu Wu, Beichen Zheng, Weiyao Huang +1GUI GroundingVision-Language Grounding

  6. Look Where You Say You're Looking: Self-Grounded Attention for Visual Reasoning

    Oct 4, 2026Uri Berger, Gal Chechik, Gal DalalVision-Language GroundingVLM Reasoning

  7. VIEScore2: Unified Image Evaluation with Spatially Grounded Explanations

    Oct 1, 2026Xianda Du, Max Ku, Weiming Ren +5VLM EvaluationImage Editing Evaluation

  8. R-GroundBench: A Diagnostic Benchmark for R-Group Groundingin Markush Molecular Editing

    Sep 30, 2026Xin Wang, Zichuan Ying, Xinna Lin +8Vision-Language GroundingDrug Discovery

  9. GroundingPI: A Grounding Foundation Model towards Physical Intelligence with Visual Primitives

    Sep 30, 2026Qize Yu, Lianrui Fan, Boyu Chen +23Vision-Language GroundingVLMs for Robotics

  10. GroundAnything: Reconciling Parallel Decoding with Precise Visual Grounding at Flash Speed

    Sep 30, 2026Qize Yu, Lianrui Fan, Bowen Ping +19Efficient VLM InferenceVision-Language Grounding

  11. SpatialCORE: Confidence-Aware Grounded Spatial Reasoning in Large Vision--Language Models

    Sep 30, 2026Rafi Ibn Sultan, Xiangyu Zhou, Md. Sajid Alam Chowdhury +4Visual Spatial ReasoningLarge Vision-Language Models

  12. Composition, Not Conversation: VLMs Lose the Scene, Not the Thread

    Sep 29, 2026L. D. M. S. Sai Teja, Ufaq Khan, N. Siva Gopala Krishna +5VLM EvaluationVisual Question Answering

  13. How Medical VLMs Underutilize Their Vision Encoders: A Dermatology Perspective

    Sep 29, 2026Janet Wang, Yunbei Zhang, Xiao Wang +1Medical DiagnosisVLM Interpretability

  14. AnswerMap: Faithful Spatial Interpretability of VLMs from Answer Posteriors

    Sep 28, 2026Mohamed Eltahir, Fardows Adam, Duaa M. Tahir +6Vision-Language ModelsVLM Interpretability

  15. GHOST-Q: Towards Studying Grounding Hallucinations Overlooked Under Same-score TradeOffs in Quantized VLMS

    Sep 24, 2026Saim Rehman, Muhammad ShafiqueVLM EvaluationVLM Quantization

  16. Small yet Assistive: Spatially-Aware Post-Training for Low Vision

    Sep 23, 2026Rishabh Choudhary, Shreyansh Raj, Umesh Goyal +6Vision-Language ModelsVLM Adaptation

  17. A Unified Framework and Dataset for Oriented Object Visual Grounding in Remote Sensing

    Sep 23, 2026Zeyu Ding, Yong Zhou, Jiaqi Zhao +5Remote Sensing Image UnderstandingVision-Language Grounding

  18. Pro-Bench: Prompt-Robust Open-Vocabulary Visual Grounding Across Real-World Heterogeneous Environments

    Sep 22, 2026Linus Nwankwo, Muslim Alaran, Christian Rauch +2Vision-Language GroundingVisual Grounding

  19. DeCo: Efficient Decouple-to-Couple Learning for Multi-Task Visual Grounding

    Sep 21, 2026Xiaoqiang Lu, Licheng Jiao, Long Sun +5Multimodal Disentangled Representation LearningReferring Expression Segmentation

  20. Look Where It Counts: A Free, Label-Free Visual Evidence Signal for Fine-Grained Vision-Language Reasoning

    Sep 21, 2026Santi Ram Tiwari, Nihal Naik, Devbrat Pandey +1Vision-Language GroundingVLM Reasoning

  21. BindCLIP: One Balanced Coupling For Compositional Vision Language Scoring

    Sep 20, 2026Liuyang Song, Yi Zhang, Zhongyi Deng +2Vision-Language ModelsVision-Language Grounding

  22. Pay More Attention To Text In High-Resolution MLLMs

    Sep 20, 2026Zhongkuan Mao, Wenzhuo Zhao, Xianjie Liu +7Visual Question AnsweringVision-Language Grounding

  23. DocAttriBench: Benchmarking Answer Grounding in Document Visual Question Answering

    Sep 17, 2026Luca De Grandis, Silvia Cappelletti, William Raccagni +3Visual Question AnsweringVision-Language Grounding

  24. PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection

    Sep 16, 2026Sara Pieri, Evangelos Kazakos, Shizhe Chen +2Image CaptioningPanoptic Segmentation

  25. RankGround: Efficient High-Resolution GUI Grounding via Lightweight Reranker-Guided Crop Selection

    Sep 16, 2026Liyang Fan, Xinping Bi, Yitai Li +3Efficient Multimodal InferenceMultimodal Reranking

  26. GroundingVLN: Reasoning and Acting with Grounding for Vision-Language Navigation

    Sep 16, 2026Kailing Li, Yu Han, Tianwen Qian +4Vision-Language NavigationVision-Language Grounding

  27. Semantic-Spatial Agreement Verification for Mitigating Object Hallucination in Multimodal Large Language Models

    Sep 15, 2026Ziheng Ren, Qian Gao, Jun Fan +3Hallucination Detection in VLMsObject Hallucination in VLMs

  28. sensVLA: Spatially-Grounded Vision-Language-Action Model for Autonomous Wheel Loader

    Sep 15, 2026Gopi Krishna Erabati, Bjarne Johannsen, Angus Stewart +1Robotic ControlVision-Language Grounding

  29. ProtoLIP: From Sentence-Level to Object-Level Evidence Disentanglement

    Sep 14, 2026Yan Zhu, Yongbo Chen, Zhengming Ding +1Vision-Language ModelsPrototype Learning

  30. P-POSEMEM: Projective Semantic Memory for Consistent Language Grounding under Pose-Graph Rewrites

    Sep 14, 2026Ha Sier, Ali Salmasi, Mengya Xu +5Vision-Language GroundingGraph-Based Agent Memory

  31. ChitraMiti: Benchmarking Visual Grounding and Modality Reliance in Bengali Geometric Reasoning

    Sep 14, 2026Khan Raiyan Ibne Reza, Sanjana Aktar Maria, Sumaiya Tabassum Nimi +1Mathematical Reasoning BenchmarksMultilingual VLM Evaluation

  32. Vague2Detect: Handling Ambiguous Prompts in Knowledge-Based Open-World Detection

    Sep 9, 2026Ibrohimjon Muminov, Jihie KimOpen-Vocabulary Object DetectionVision-Language Grounding

  33. DSE-VTG: Dual-Side Enhancement for Training-Free Video Temporal Grounding

    Sep 8, 2026Zhuo Cao, Bingqing Zhang, Sen Wang +1Temporal Video GroundingTest-Time Adaptation of VLMs

  34. AirAnchor: Bridging Local and Global Spatial Information for Zero-Shot Aerial Vision-and-Language Navigation

    Sep 8, 2026Shanwei Fan, Bin Zhang, Zhiwei Xu +4Zero-Shot LearningUAV Navigation

  35. Human-Centric Image Captioning with Subject-Centered Spatial Understanding

    Sep 8, 2026Bozhou Li, Jiahang Zhang, Yue Ding +11VLM EvaluationImage Captioning

  36. DroneGround: Open-Vocabulary Drone Payload Characterization Using Synthetic Data and Grounded Vision-Language Models

    Sep 7, 2026Ami Pandat, Rajasekhar Punna, Gopika Vinod +1Open-Vocabulary Object DetectionVision-Language Grounding

  37. LOCI: A Locator-Critic with Refinement Loop

    Aug 31, 2026Walid Bousselham, Mathilde Caron, Arsha Nagrani +1Visual Question AnsweringVision-Language Grounding

  38. Cost-efficient Active Learning for Referring Image Segmentation and Grounding

    Aug 31, 2026Junbeom Hong, Seonghoon Yu, Hyung Rok Jung +2Active LearningReferring Image Segmentation

  39. Learning Compositional Spatio-Temporal Video Grounding with Synthetic Curriculum

    Aug 31, 2026Xingjian Wang, Shijian Wang, Yibo Wang +4Temporal Video GroundingSynthetic Data Generation

  40. VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs

    Aug 31, 2026Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +1Hallucination Detection in VLMsVLM Hallucination

  41. OPUS: A Simple yet Effective Unified Framework for Open-Vocabulary Detection

    Aug 31, 2026Xiaoyan Wei, Zhimin Yao, Ruilin Yang +4Open-Vocabulary Object DetectionVision-Language Grounding

  42. Semantic-Spatial Discriminability Enhancement for Generalized Visual Grounding

    Aug 31, 2026Kaiyan Lei, Xu-Yao ZhangVision-Language GroundingVisual Grounding

  43. ManGo: Manga Active Narrative Grounding Optimization

    Aug 30, 2026Hao Qiu, Junyan Wang, Zheyuan Liu +4Visual Question AnsweringRL for Language Model Reasoning

  44. When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

    Aug 25, 2026Zhengxiang Wang, Owen RambowVLM EvaluationLarge Vision-Language Models

  45. Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding

    Aug 13, 2026Junyi Hu, Tian Bai, Fengyi Wu +7Vision-Language ModelsVision-Language Grounding