Visually Grounded Reasoning

Momentum

17 papers in the last four weeks, up 183% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 285

All topics
CardsList
  1. ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

    May 29, 2026Kaiwen Xue, Tao Wei, Guoxin Zhang +5Spatial Reasoning BenchmarksVisual Spatial Reasoning

  2. SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes

    May 29, 2026Tianhui Liu, Jie Feng, Zhiheng Zheng +6Spatial Reasoning BenchmarksVisual Spatial Reasoning

  3. iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

    May 29, 2026Chang-Bin Zhang, Yujie Zhong, Qiang Zhang +1Large Vision-Language ModelsVision-Language Grounding

  4. Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

    May 29, 2026Ruina Hu, Chen Wang, Lai Wei +5Reinforcement Learning with Verifiable RewardsVisually Grounded Reasoning

  5. StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning

    May 29, 2026Xixiang He, Baiqi Wu, Xingming Li +4VLM EvaluationVisual Reasoning

  6. ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models

    May 28, 2026Zihu Wang, Karthik Somayaji N. S, Peng LiVisual ReasoningLarge Vision-Language Models

  7. Grounded 3D-Aware Spatial Vision-Language Modeling

    May 28, 2026An-Chieh Cheng, Yang Fu, Yatai Ji +123D Spatial ReasoningVisually Grounded Reasoning

  8. VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies

    May 28, 2026Mingjian Gao, Wenqiao Zhang, Yuqian Yuan +9Efficient VLM InferenceEfficient VLA Model Inference

  9. Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning

    May 28, 2026Yaowu Fan, Tao Han, Dazhao Du +2Tool-Using Vision-Language AgentsVLM Reasoning

  10. SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs

    May 27, 2026Jiawei Li, Ziyi Liu, Weijie Shi +33D Spatial ReasoningLatent Visual Reasoning

  11. Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning

    May 27, 2026Yang Zhang, Xiaoshuai Sun, Rui Zhao +5Active PerceptionMultimodal Reasoning

  12. Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning

    May 27, 2026Xuanzhao Dong, Wenhui Zhu, Peijie Qiu +11Visual Question AnsweringTool-Using Vision-Language Agents

  13. Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought

    May 26, 2026Yuchen Guo, Junli Gong, Hongmin Cai +2Image SegmentationText-Guided Image Segmentation

  14. Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

    May 26, 2026Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell +1VLM EvaluationData Visualization

  15. InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward

    May 26, 2026Zhiwei Ning, Wenwen Tong, Xiangli Kong +12Multimodal ReasoningVLM Reasoning

  16. VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

    May 25, 2026Jingru Chen, Yiming Liu, Mingtao Chen +5VLM EvaluationTool Use in VLMs

  17. Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents

    May 25, 2026Dong-Hee Kim, Reuben Tan, Donghyun KimTool Use in VLMsAgentic Reasoning

  18. ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

    May 25, 2026Jiangyang Li, Cong Wan, Changjie Wu +8Visual Spatial ReasoningVLM Reasoning

  19. Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

    May 25, 2026Longteng Guo, Yifan Wang, Pengkang Huo +4Visual ReasoningVLM Reasoning

  20. DUEL: Adversarial Self-Play for Multimodal Reasoning

    May 24, 2026Lin Qiu, Hanqing Zeng, Yao Liu +3VLM RobustnessVLM Reasoning

  21. EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge

    May 23, 2026Zhiwei Chen, Yupeng Hu, Zixu Li +4Test-Time AdaptationVLM Adaptation

  22. Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs

    May 23, 2026Wen Ma, Fucheng Niu, Zhiting Fan +3Adversarial Attacks on VLMsHealthcare

  23. OmniEgo-R2^2: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

    May 23, 2026Zixu Li, Zhiwei Chen, Zhiheng Fu +4Egocentric Video QAEgocentric Video Understanding

  24. ETCHR: Editing To Clarify and Harness Reasoning

    May 22, 2026Beichen Zhang, Yuhong Liu, Jinsong Li +3Tool Use in VLMsMultimodal Reasoning

  25. PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

    May 22, 2026Rim Assouel, Amir Bar, Michal Drozdzal +1Visual Spatial ReasoningSynthetic Data Generation

  26. Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?

    May 21, 2026Zixuan Lan, Luzhe Sun, Matthew R. Walter +1VLM EvaluationVLM Interpretability

  27. SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation

    May 21, 2026Zhenyu Lu, Liupeng Li, Jinpeng Wang +4Image SegmentationText-Guided Image Segmentation