Vision-Language Grounding

Momentum

44 papers in the last four weeks, up 175% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 288

All topics
CardsList
  1. LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

    Mar 30, 2026Chanyoung Kim, Minwoo Kim, Minseok Kang +2Vision-Language GroundingVision-Language-Action Models

  2. OptiSAR-Net++: A Large-Scale Benchmark and Transformer-Free Framework for Cross-Domain Remote Sensing Visual Grounding

    Mar 25, 2026Xiaoyu Tang, Jun Dong, Jintao Cheng +1Remote SensingVision-Language Grounding

  3. The Dual Mechanisms of Spatial Variable Binding in Vision-Language Models

    Mar 23, 2026Kelly Cui, Nikhil Prakash, Shoval Messica +4VLM InterpretabilityVision-Language Grounding

  4. GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data

    Mar 15, 2026Roger Ferrod, Maël Lecene, Krishna Sapkota +4VLM EvaluationRemote Sensing Image Understanding

  5. Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding

    Mar 5, 2026Jiaqi Li, Shuntian Zheng, Yixian Shen +4Temporal Video GroundingVision-Language Grounding

  6. Towards Long-Form Spatio-Temporal Video Grounding

    Feb 26, 2026Xin Gu, Bing Fan, Jiali Yao +5Temporal Video GroundingLong-Context Modeling

  7. Visual-Language-Guided Task Planning for Horticultural Robots

    Jan 17, 2026Jose Cuaran, Kendall Koe, Aditya Potnis +2Large Language Model-Based Robot PlanningVision-Language Grounding

  8. PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology

    Dec 19, 2025Fengchun Liu, Songhan Jiang, Linghan Cai +2Computational PathologyVision-Language Grounding

  9. VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing

    Dec 12, 2025Emanuel Sánchez Aimar, Gulnaz Zhambulova, Fahad Shahbaz Khan +2Cross-Modal LearningMultimodal Embedding

  10. MMLongCite: A Benchmark for Evaluating Faithfulness of Long-Context Vision-Language Models

    Oct 15, 2025Keyan Zhou, Zecheng Tang, Lingfeng Ming +9VLM EvaluationVision-Language Grounding

  11. Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

    Oct 10, 2025Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra +6Object Hallucination in VLMsMultimodal Large Language Models

  12. Talk in Pieces, See in Whole: Disentangled and Hierarchical Representation Learning in Language-based Object Detection

    Sep 29, 2025Sojung An, Kwanyong Park, Yong Jae Lee +1Open-Vocabulary Object DetectionDisentangled Representation Learning

  13. RefAM: Attention Magnets for Zero-Shot Referral Segmentation

    Sep 26, 2025Anna Kukleva, Enis Simsar, Alessio Tonioni +4Zero-Shot LearningImage Segmentation

  14. TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding

    Aug 11, 2025Chaohong Guo, Xun Mo, Yongwei Nie +3Temporal Video GroundingVision-Language Models

  15. FORGE: Forensic Reasoning with Grounded Evidence

    Mar 20, 2025Rohit Kundu, Shan Jia, Vishal Mohanty +2VLM AdaptationExplainable Deepfake Detection

  16. Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation

    Mar 14, 2025Yaohua Liu, Binkai Ou, Rong Fu +2Vision-Language NavigationVision-Language Grounding

  17. Geometric Coastline Localization using Vision-Language Models

    Date pendingRafia Malik, Bernhard Pfahringer, Karin Bryan +2Remote Sensing Image UnderstandingGeospatial Foundation Models