Vision-Language Grounding

Momentum

44 papers in the last four weeks, up 175% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 288

All topics
CardsList
  1. SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation

    May 17, 2026Jingzhi Huang, Junkai Huang, Wenxuan Song +4Visual Spatial ReasoningVision-Language Navigation

  2. EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

    May 16, 2026Haozhe Shan, Xiancong Ren, Han Dong +9VLM EvaluationVision-Language Grounding

  3. From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding

    May 15, 2026Yuyuan Liu, Yiping Ji, Anjie Le +6Vision-Language GroundingVisual Grounding

  4. DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding

    May 15, 2026Yichao Liu, Huawen Shen, Liu Yu +3GUI AgentsGUI Grounding

  5. SteerSeg: Attention Steering for Reasoning Video Segmentation

    May 14, 2026Ali Cheraghian, Hamidreza Dastmalchi, Abdelwahed Khamis +3Video Object SegmentationReferring Video Object Segmentation

  6. EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding

    May 14, 2026Yuejiao Su, Xinshen Zhang, Zhen Ye +3Egocentric Video UnderstandingVision-Language Grounding

  7. Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs

    May 13, 2026Jincai Huang, Shihao Zou, Yuchen Guo +5Surgical Video UnderstandingVision-Language Grounding

  8. CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models

    May 13, 2026Sangin Lee, Yukyung ChoiEfficient VLM InferenceVision-Language Grounding

  9. From Web to Pixels: Bringing Agentic Search into Visual Perception

    May 12, 2026Bokang Yang, Xinyi Sun, Kaituo Feng +3Visual Question AnsweringVision-Language Grounding

  10. Allegory of the Cave: Measurement-Grounded Vision-Language Learning

    May 12, 2026Kepeng Xu, Li Xu, Gang He +1Large Vision-Language ModelsVision-Language Grounding

  11. Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking

    May 11, 2026Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur +4VLM EvaluationVision-Language Models

  12. The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

    May 11, 2026Hao Liu, Jicheng LiuVLM EvaluationVision-Language Grounding

  13. Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

    May 10, 2026Xuan Gong, Hanbo Huang, Hao Zheng +4Vision-Language ModelsVision-Language Grounding

  14. From Pixels to Concepts: Do Segmentation Models Understand What They Segment?

    May 10, 2026Shuang Liang, Zeqing Wang, Yuxian Li +2VLM EvaluationImage Segmentation

  15. What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs

    May 10, 2026Jiaping Lin, Fei Shen, Junzhe Li +4GUI GroundingVision-Language Grounding

  16. Language-Conditioned Visual Grounding with CLIP Multilingual

    May 9, 2026J. de Curtò, Mauro Liz, I. de ZarzàVLM EvaluationMultilingual VLM Evaluation

  17. Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

    May 9, 2026Filippo Ziliotto, Ciro Beneduce, Bruno Lepri +3AI Agent EvaluationVision-Language Grounding

  18. Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning

    May 8, 2026Jin Cui, Xinyue Long, Xunyong Zhang +5Visual Spatial ReasoningVisual Reasoning

  19. MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation

    May 7, 2026Shichao Kan, Xuyang Zhang, Haojie Zhang +7Cross-Modal AlignmentVision-Language Grounding

  20. Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions

    May 7, 2026Kjetil Indrehus, Adrian Duric, Changkyu Choi +1Vision-Language GroundingDocument QA

  21. RemoteZero: Geospatial Reasoning with Zero Human Annotations

    May 6, 2026Liang Yao, Fan Liu, Shengxiang Xu +4Self-TrainingRemote Sensing

  22. Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting

    May 4, 2026Giacomo Pacini, Luca Ciampi, Nicola Messina +3VLM EvaluationVLM Robustness

  23. AutoFocus: Uncertainty-Aware Active Visual Search for GUI Grounding

    May 4, 2026Ruilin Yao, Shegnwu Xiong, Tianyu Zou +2Uncertainty QuantificationGUI Grounding

  24. Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

    May 2, 2026Peiyang Liu, Ziqiang Cui, Xi Wang +2Retrieval-Augmented GenerationVision-Language Grounding

  25. FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting

    Apr 30, 2026Fengxian Ji, Jingpu Yang, Zirui Song +5GUI AgentsVision-Language Grounding