Vision-Language Grounding

Momentum

44 papers in the last four weeks, up 175% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 288

All topics
CardsList
  1. CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework

    Jun 16, 2026Sneha Rao, Shaina Raza, Dhanesh RamachandramVLM EvaluationVision-Language Grounding

  2. Trust the Right Teacher: Quality-Aware Self-Distillation for GUI Grounding

    Jun 16, 2026Jingyuan Huang, Zuming Huang, Yucheng Shi +4On-Policy Self-DistillationGUI Grounding

  3. MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

    Jun 16, 2026Xingming Li, Ao Cheng, Qiyao Sun +4VLM RobustnessVision-Language Models

  4. LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models

    Jun 15, 2026Zhou Tao, Fang Zhang, Zewen Ding +5Multimodal Large Language ModelsVision-Language Grounding

  5. Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

    Jun 15, 2026Yifan Wang, Peiming Li, Shiyu Li +5Efficient VLM InferenceLarge Vision-Language Models

  6. Training-Free Open-Vocabulary Visual Grounding for Remote Sensing Images and Videos

    Jun 15, 2026Ke Li, Di Wang, Yongshan Zhu +5Remote Sensing Image UnderstandingTemporal Video Grounding

  7. Thinking with Visual Grounding

    Jun 15, 2026Junkai Zhang, Yihe Deng, Kai-Wei Chang +1Visual Spatial ReasoningVision-Language Grounding

  8. RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought

    Jun 14, 2026Yaoting Huang, Yifu Yuan, Linqi Han +6Visual Spatial ReasoningCoT Reasoning

  9. Post-Launch Capability Expansion of Vision-Language Models via Prompting for On-Orbit Spacecraft Inspection

    Jun 13, 2026Nicholas A. Welsh, Lennon J. Shikhman, Monty Nehru Attazs +3Instance SegmentationPromptable Image Segmentation

  10. Gaze Heads: How VLMs Look at What They Describe

    Jun 12, 2026Rohit Gandikota, David BauImage CaptioningVisual Attention

  11. VISTA: View-Consistent Self-Verified Training for GUI Grounding

    Jun 12, 2026Xinyu Qiu, Yunzhu Zhang, Heng Jia +3Multi-View ConsistencyVLM Robustness

  12. AERMANI-PLACE: Language Guided Object Placement with Aerial Manipulators

    Jun 12, 2026Sarthak Mishra, Ritama Sanyal, Rishabh Dev Yadav +2Language-Conditioned Robot ManipulationVision-Language Grounding

  13. Dense Coordinate-List Fine-Tuning Induces a Controllable Interference Surface in Vision-Language Models

    Jun 12, 2026Chenyu Zhou, Qiliang Jiang, Boguang PanVLM AdaptationVision-Language Grounding

  14. Mirage Probes: How Vision Models Fake Visual Understanding

    Jun 11, 2026Daniel Ben-Levi, Judah Goldfeder, Weiliang Zhao +5Vision-Language ModelsVLM Interpretability

  15. GIVE: Grounding Human Gestures in Vision-Language-Action Models

    Jun 11, 2026Pengfei Liu, Gen Li, Junqiao Fan +4Language-Conditioned Robot ManipulationVision-Language Grounding

  16. Objects Before Words: Object-First Inductive Biases for Grounding Language in Child-View Video

    Jun 11, 2026Sathira Silva, Abrham Kahsay Gebreselasie, Muhammad Umer Sheikh +3Object-Centric Representation LearningEgocentric Video Understanding

  17. Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning

    Jun 11, 2026Allison Andreyev, Landon Eum, Nestor Tiglao +1Robotic GraspingZero-Shot Robotic Manipulation

  18. Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

    Jun 9, 2026Pratham Singla, Shivank Garg, Vihan Singh +1VLM EvaluationVision-Language Models

  19. Language as a Sensor: Calibrated Spatial Belief Estimation in 3D Scenes from Natural Language

    Jun 7, 2026Aryan Naveen, Jason Xinyu Liu, Luca Carlone +1Vision-Language GroundingSemantic Mapping

  20. Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems

    Jun 6, 2026Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra +3VLM EvaluationVLM Robustness

  21. DragOn: A Benchmark and Dataset for Drag-Based GUI Interactions

    Jun 4, 2026Nathan Bout, Maxime Langevin, Ronan RiochetGUI AgentsGUI Grounding

  22. InsightVQA: High-Dimensional Emotion-Cognitive Visual Question Answering Benchmark

    Jun 1, 2026Shiyu Wang, Ziyu Liu, Chaoyi Yu +6VLM EvaluationVisual Question Answering

  23. Self-Improving Small Object Grounding in LVLMs

    Jun 1, 2026Tianze Yang, Yucheng Shi, Ruitong Sun +2Large Vision-Language ModelsVLM Interpretability

  24. An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation

    May 31, 2026Bingyu Li, Da Zhang, Tao Huo +3Large Vision-Language ModelsReferring Image Segmentation