Visual Grounding Benchmarks

Momentum

0 papers in the last four weeks, down 100% on the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 25

All topics
CardsList
  1. Mutual Equilibrium: Multimodal Representation Learning through Reciprocal Feedback

    Sep 30, 2026Ho-min Park, Byungkon KangMultimodal RepresentationsMultimodal Classification

  2. From Routing Signals to Selective Review: Visual regrounding in MoE VLMs

    Sep 29, 2026Hongzhu Guo, Mohsen Fayyaz, Nanyun PengVisual Grounding BenchmarksMixture-Of-Experts

  3. Seg3DParts: Segmentation-Grounded Controllable Part-Level 3D Generation

    Sep 29, 2026Jiantao Lin, Meixi Chen, Yingjie Xu +53D ModelsVisual Grounding Benchmarks

  4. GeoBridge: Decoupled Semantic Conditioning for Generative Image Geolocalization

    Aug 12, 2026Zhiyang Dou, Xumeng Han, Fengde Peng +4Cross-View Geo-LocalizationVisual Grounding Benchmarks

  5. VSMP-IMU: Video-Grounded Semantic Motion Programs for Sensor-Aware Synthetic IMU Generation

    Aug 6, 2026Lala Shakti Swarup Ray, Vitor Fortes Rey, Mengxi Liu +2Human Activity RecognitionInertial Measurement Units

  6. SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

    Aug 3, 2026Yiming Wang, Ye Chen, Hanqi Chen +1Scalable Vector GraphicSketches

  7. How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

    Jul 17, 2026Navya Gupta, Bingjie Xu, Avinash Anand +2Visual Grounding BenchmarksMisalignment Persona

  8. UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

    Jul 9, 2026Haibin Tian, Huichao Xie, Xuelin Qian +3Aerial ImageryVisual Grounding Benchmarks

  9. Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

    Jul 2, 2026Liyan Tang, Fangcong Yin, Greg DurrettRecent Vision-Language ModelsVisual Grounding Benchmarks

  10. Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs

    Jun 30, 2026Deniz Bickici, Michael Pabst, Shohei Mori +13D Scene GraphsVoxel

  11. Understanding How MLLMs Describe Artworks Using Token Activation Maps

    Jun 26, 2026Nicola Fanelli, Pasquale De Marinis, Raffaele Scaringi +3Long Visual-Token SequencesMultimodal Large Language Models

  12. PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

    Jun 23, 2026Ling Li, Bowen Liu, Zinuo Zhan +5Visual Grounding BenchmarksMultimodal Large Language Models

  13. Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

    Jun 22, 2026Jiho Choi, Seonho Lee, Seojeong Park +13D RepresentationVisual Grounding Benchmarks

  14. Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

    Jun 22, 2026Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo +1Visual Grounding BenchmarksVisual Reasoning

  15. Training-Free Open-Vocabulary Visual Grounding for Remote Sensing Images and Videos

    Jun 15, 2026Ke Li, Di Wang, Yongshan Zhu +5Weak Visual GroundingVisual Grounding Benchmarks

  16. Improving Visual Grounding in Remote Sensing via Cluster-Guided Refinement and Model Ensemble Voting

    May 30, 2026Panav Shah, Geet Sethi, Ashutosh GandheRemote Sensing Image SegmentationRemote Sensing

  17. Beyond Appearance: Can Multimodal Large Language Models Exploit Vertical Structure for Remote Sensing Natural Scene Understanding?

    May 25, 2026Jing Huang, Duanchu Wang, Junjie Yang +5Visual Grounding BenchmarksRemote Sensing

  18. Dual-Pathway Circuits of Object Hallucination in Vision-Language Models

    May 13, 2026Jiaxin Liu, Ding Zhong, Yue Wang +6Object HallucinationGenerative Hallucination

  19. MAG-VLAQ: Multi-modal Aerial-Ground Query Aggregation for Cross-View Place Recognition

    May 10, 2026Zhengyi Xu, Yuhang Ming, Zhihao Zhan +3Visual Place RecognitionCross-View Fusion

  20. Investigating Anisotropy in Visual Grounding under Controlled Counterfactual Perturbations

    May 9, 2026Gabriele Lombardo, Luigi Maiorana, Liliana Lo Presti +1Visual Grounding BenchmarksContextual Cues

  21. RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios

    Dec 31, 2025Tianyi Zhao, Jiawen Xi, Linhui Xiao +4Visual Grounding BenchmarksRgb-Event Object Tracking