Vision-Language Grounding

Momentum

44 papers in the last four weeks, up 175% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 288

All topics
CardsList
  1. Beyond Anonymous Captions: Grounding Character Identity in Video Captioning and Question Answering

    Oct 7, 2026Anas Filali Razzouki, Killian Steunou, Khalil Guetari +3Video CaptioningVideo QA

  2. YUBI-STAG: Contact and Semantic-Rich Alignment for VLAs via Automated Video-Language Grounding

    Oct 7, 2026Masatoshi Tateno, Takehiko Ohkawa, Yueh-Hua Wu +4Vision-Language GroundingVLMs for Robotics

  3. Visual Evidence Under Cross-Examination: Evaluating and Controlling Decision-Level Evidence Use in Vision-Language Models

    Oct 7, 2026Huiyao Zhang, Jin Bai, Zilong Su +6VLM EvaluationFaithfulness in VLMs

  4. Spatial Latent Reasoning for Embodied Reference Understanding

    Oct 7, 2026Ling Li, Jianhui Zhong, Wei Liu +3Vision-Language GroundingContinuous Latent Reasoning

  5. GeoPID: Decomposing and Steering Visual Information in Vision-Language Models

    Oct 6, 2026Seulgi Kim, Zhixiong Zhang, Xinwei Zhang +2Vision-Language Grounding

  6. Readout Blindness: VLM Scores Miss the Spatial Direction Their Frozen Encoders Retain

    Oct 5, 2026Guangyuan Li, Tianming Du, Yan Jiang +2VLM EvaluationVision-Language Grounding

  7. Visual Grounding Safety in Vision-Language Models

    Oct 5, 2026Erfan Shayegani, Kundan Krishna, Yue Dong +3VLM EvaluationVision-Language Grounding

  8. Answer with Evidence: Consistency-Aware Grounded Visual Question Answering for Roadside Traffic Scenes

    Oct 4, 2026Runwei Guan, Rongsheng Hu, Shangshu Chen +9Autonomous Driving BenchmarksVisual Question Answering

  9. Recurrent Latent Visual Search for GUI Grounding

    Oct 4, 2026Kaiyu Wu, Beichen Zheng, Weiyao Huang +1GUI GroundingVision-Language Grounding

  10. Look Where You Say You're Looking: Self-Grounded Attention for Visual Reasoning

    Oct 4, 2026Uri Berger, Gal Chechik, Gal DalalVision-Language GroundingVLM Reasoning

  11. VIEScore2: Unified Image Evaluation with Spatially Grounded Explanations

    Oct 1, 2026Xianda Du, Max Ku, Weiming Ren +5VLM EvaluationImage Editing Evaluation

  12. R-GroundBench: A Diagnostic Benchmark for R-Group Groundingin Markush Molecular Editing

    Sep 30, 2026Xin Wang, Zichuan Ying, Xinna Lin +8Vision-Language GroundingDrug Discovery

  13. GroundingPI: A Grounding Foundation Model towards Physical Intelligence with Visual Primitives

    Sep 30, 2026Qize Yu, Lianrui Fan, Boyu Chen +23Vision-Language GroundingVLMs for Robotics

  14. GroundAnything: Reconciling Parallel Decoding with Precise Visual Grounding at Flash Speed

    Sep 30, 2026Qize Yu, Lianrui Fan, Bowen Ping +19Efficient VLM InferenceVision-Language Grounding

  15. SpatialCORE: Confidence-Aware Grounded Spatial Reasoning in Large Vision--Language Models

    Sep 30, 2026Rafi Ibn Sultan, Xiangyu Zhou, Md. Sajid Alam Chowdhury +4Visual Spatial ReasoningLarge Vision-Language Models

  16. Composition, Not Conversation: VLMs Lose the Scene, Not the Thread

    Sep 29, 2026L. D. M. S. Sai Teja, Ufaq Khan, N. Siva Gopala Krishna +5VLM EvaluationVisual Question Answering

  17. How Medical VLMs Underutilize Their Vision Encoders: A Dermatology Perspective

    Sep 29, 2026Janet Wang, Yunbei Zhang, Xiao Wang +1Medical DiagnosisVLM Interpretability

  18. AnswerMap: Faithful Spatial Interpretability of VLMs from Answer Posteriors

    Sep 28, 2026Mohamed Eltahir, Fardows Adam, Duaa M. Tahir +6Vision-Language ModelsVLM Interpretability

  19. GHOST-Q: Towards Studying Grounding Hallucinations Overlooked Under Same-score TradeOffs in Quantized VLMS

    Sep 24, 2026Saim Rehman, Muhammad ShafiqueVLM EvaluationVLM Quantization

  20. Small yet Assistive: Spatially-Aware Post-Training for Low Vision

    Sep 23, 2026Rishabh Choudhary, Shreyansh Raj, Umesh Goyal +6Vision-Language ModelsVLM Adaptation

  21. A Unified Framework and Dataset for Oriented Object Visual Grounding in Remote Sensing

    Sep 23, 2026Zeyu Ding, Yong Zhou, Jiaqi Zhao +5Remote Sensing Image UnderstandingVision-Language Grounding

  22. Pro-Bench: Prompt-Robust Open-Vocabulary Visual Grounding Across Real-World Heterogeneous Environments

    Sep 22, 2026Linus Nwankwo, Muslim Alaran, Christian Rauch +2Vision-Language GroundingVisual Grounding

  23. DeCo: Efficient Decouple-to-Couple Learning for Multi-Task Visual Grounding

    Sep 21, 2026Xiaoqiang Lu, Licheng Jiao, Long Sun +5Multimodal Disentangled Representation LearningReferring Expression Segmentation

  24. Look Where It Counts: A Free, Label-Free Visual Evidence Signal for Fine-Grained Vision-Language Reasoning

    Sep 21, 2026Santi Ram Tiwari, Nihal Naik, Devbrat Pandey +1Vision-Language GroundingVLM Reasoning