Visually Grounded Reasoning

Momentum

17 papers in the last four weeks, up 183% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 285

All topics
CardsList
  1. Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely

    May 29, 2026Chalamalasetti Kranti, Sherzod Hakimov, David SchlangenVisual Spatial ReasoningMulti-Agent Collaboration

  2. ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

    May 29, 2026Kaiwen Xue, Tao Wei, Guoxin Zhang +5Spatial Reasoning BenchmarksVisual Spatial Reasoning

  3. SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes

    May 29, 2026Tianhui Liu, Jie Feng, Zhiheng Zheng +6Spatial Reasoning BenchmarksVisual Spatial Reasoning

  4. iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

    May 29, 2026Chang-Bin Zhang, Yujie Zhong, Qiang Zhang +1Large Vision-Language ModelsVision-Language Grounding

  5. Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

    May 29, 2026Ruina Hu, Chen Wang, Lai Wei +5Reinforcement Learning with Verifiable RewardsVisually Grounded Reasoning

  6. StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning

    May 29, 2026Xixiang He, Baiqi Wu, Xingming Li +4VLM EvaluationVisual Reasoning

  7. ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models

    May 28, 2026Zihu Wang, Karthik Somayaji N. S, Peng LiVisual ReasoningLarge Vision-Language Models

  8. Grounded 3D-Aware Spatial Vision-Language Modeling

    May 28, 2026An-Chieh Cheng, Yang Fu, Yatai Ji +123D Spatial ReasoningVisually Grounded Reasoning

  9. VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies

    May 28, 2026Mingjian Gao, Wenqiao Zhang, Yuqian Yuan +9Efficient VLM InferenceEfficient VLA Model Inference

  10. Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning

    May 28, 2026Yaowu Fan, Tao Han, Dazhao Du +2Tool-Using Vision-Language AgentsVLM Reasoning

  11. SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs

    May 27, 2026Jiawei Li, Ziyi Liu, Weijie Shi +33D Spatial ReasoningLatent Visual Reasoning

  12. Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning

    May 27, 2026Yang Zhang, Xiaoshuai Sun, Rui Zhao +5Active PerceptionMultimodal Reasoning

  13. Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning

    May 27, 2026Xuanzhao Dong, Wenhui Zhu, Peijie Qiu +11Visual Question AnsweringTool-Using Vision-Language Agents

  14. Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought

    May 26, 2026Yuchen Guo, Junli Gong, Hongmin Cai +2Image SegmentationText-Guided Image Segmentation

  15. Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

    May 26, 2026Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell +1VLM EvaluationData Visualization

  16. InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward

    May 26, 2026Zhiwei Ning, Wenwen Tong, Xiangli Kong +12Multimodal ReasoningVLM Reasoning

  17. VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

    May 25, 2026Jingru Chen, Yiming Liu, Mingtao Chen +5VLM EvaluationTool Use in VLMs

  18. Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents

    May 25, 2026Dong-Hee Kim, Reuben Tan, Donghyun KimTool Use in VLMsAgentic Reasoning

  19. ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

    May 25, 2026Jiangyang Li, Cong Wan, Changjie Wu +8Visual Spatial ReasoningVLM Reasoning

  20. Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

    May 25, 2026Longteng Guo, Yifan Wang, Pengkang Huo +4Visual ReasoningVLM Reasoning

  21. DUEL: Adversarial Self-Play for Multimodal Reasoning

    May 24, 2026Lin Qiu, Hanqing Zeng, Yao Liu +3VLM RobustnessVLM Reasoning

  22. EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge

    May 23, 2026Zhiwei Chen, Yupeng Hu, Zixu Li +4Test-Time AdaptationVLM Adaptation

  23. Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs

    May 23, 2026Wen Ma, Fucheng Niu, Zhiting Fan +3Adversarial Attacks on VLMsHealthcare

  24. OmniEgo-R2^2: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

    May 23, 2026Zixu Li, Zhiwei Chen, Zhiheng Fu +4Egocentric Video QAEgocentric Video Understanding

  25. ETCHR: Editing To Clarify and Harness Reasoning

    May 22, 2026Beichen Zhang, Yuhong Liu, Jinsong Li +3Tool Use in VLMsMultimodal Reasoning

  26. PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

    May 22, 2026Rim Assouel, Amir Bar, Michal Drozdzal +1Visual Spatial ReasoningSynthetic Data Generation

  27. Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?

    May 21, 2026Zixuan Lan, Luzhe Sun, Matthew R. Walter +1VLM EvaluationVLM Interpretability