Vision-Language Grounding

Momentum

44 papers in the last four weeks, up 175% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 288

All topics
CardsList
  1. GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models

    Jul 1, 2026Hongkuan Zhou, Tristan Rehm, Nadeem Nazer +3Industrial Anomaly DetectionVision-Language Grounding

  2. Information-Regularized Attention for Visual-Centric Reasoning

    Jul 1, 2026Guohao Sun, Xiaofang Wang, Yash Patel +3VLM RobustnessVision-Language Grounding

  3. Personalized Object Identification and Localization via In-Context Inference with Vision-Language Models

    Jul 1, 2026Kensuke Nakamura, Byung-Woo HongFew-Shot Object DetectionVision-Language Grounding

  4. Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

    Jun 30, 2026Qian Ma, S M Rayeed, Charles V. Stewart +2VLM EvaluationVisual Question Answering

  5. PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

    Jun 30, 2026Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11Vision-Language GroundingTool-Using Vision-Language Agents

  6. Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue

    Jun 30, 2026Nan Li, Albert Gatt, Massimo PoesioVLM EvaluationVision-Language Grounding

  7. Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning

    Jun 30, 2026Chih-Ting Liao, Fei Shen, Xin Cao +1Visual Spatial ReasoningVLM Interpretability

  8. H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning

    Jun 29, 2026Eric Peh, Debaditya Roy, Basura FernandoReinforcement LearningVisual Reasoning

  9. Enhancing Part-Level Point Grounding for Any Open-Source MLLMs

    Jun 28, 2026Jin-Cheng Jhang, Fu-En Wang, Xin Yang +4Multimodal Large Language ModelsVision-Language Grounding

  10. Understanding How MLLMs Describe Artworks Using Token Activation Maps

    Jun 26, 2026Nicola Fanelli, Pasquale De Marinis, Raffaele Scaringi +3VLM InterpretabilityVision-Language Grounding

  11. GAVEL: Grounded Caption Error Verification and Localization

    Jun 25, 2026Zixian Gao, Atsushi Hashimoto, Kuniaki SaitoVLM EvaluationText-Image Alignment

  12. Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning

    Jun 24, 2026Yanzhe Tang, Xinyu Shao, Yuxuan Hu +6Language-Conditioned Robot ManipulationVision-Language Grounding

  13. V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning

    Jun 24, 2026Haoxiang Sun, Zhihang Yi, Langxuan Deng +6Visual ReasoningVLM Distillation

  14. PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

    Jun 23, 2026Ling Li, Bowen Liu, Zinuo Zhan +5Visual Spatial ReasoningVision-Language Grounding

  15. ActiveScope: Actively Seeking and Correcting Perception for MLLMs

    Jun 23, 2026Yajing Wang, Chao Bi, Junshu Sun +4Multimodal Large Language ModelsVision-Language Grounding

  16. Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

    Jun 22, 2026Qian Ma, Qiong Wu, Zhengyi Zhou +1Multimodal RAGVisual Question Answering

  17. Listening makes Vision Clear for VLMs

    Jun 22, 2026Yiyang Chen, Yixin Tan, Binrui ShenVLM EvaluationVisual Attention

  18. Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

    Jun 22, 2026Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo +1Visual Question AnsweringVisual Reasoning

  19. 4DVLT: Dynamic Scene Understanding with Worldline-Centered Vision-Language Tracking

    Jun 21, 2026Chaoyue Li, Boxue Yang, Shengyao Zhou +3Visual Object TrackingVision-Language Grounding

  20. CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming

    Jun 21, 2026Ruixun Liu, Lingyu Zhang, Lanxuan Xue +3VLM EvaluationSpatial Reasoning Benchmarks

  21. SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs

    Jun 18, 2026Bo Yin, Xiaobin Hu, Chengming Xu +6VLM RobustnessVLM Adaptation

  22. Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models

    Jun 18, 2026Yifeng Wu, Huimin Huang, Ruiluo Wu +5Visual Spatial ReasoningMultimodal Large Language Models

  23. ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks

    Jun 17, 2026Simon Schwaiger, David Seyser, Alessandro Scherl +2Vision-Language ModelsVision-Language Grounding

  24. CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework

    Jun 16, 2026Sneha Rao, Shaina Raza, Dhanesh RamachandramVLM EvaluationVision-Language Grounding

  25. Trust the Right Teacher: Quality-Aware Self-Distillation for GUI Grounding

    Jun 16, 2026Jingyuan Huang, Zuming Huang, Yucheng Shi +4On-Policy Self-DistillationGUI Grounding