Visually Grounded Reasoning

Momentum

17 papers in the last four weeks, up 183% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 286

All topics
CardsList
  1. ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

    Aug 5, 2026Lei Peng, Shuai Lv, Wei HuVLM ReasoningVisually Grounded Reasoning

  2. CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

    Aug 3, 2026Xuehang Guo, Pingyue Zhang, Ruiyi Zhang +6Data VisualizationChart QA

  3. DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

    Aug 1, 2026An Lanji, Dawei Liu, Jin Li +3AI Agent ReliabilityVLM Interpretability

  4. TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning

    Jul 31, 2026Binnan Liu, Yechi Ma, Tian Xie +1Visual ReasoningVisually Grounded Reasoning

  5. Visual Credit Audit for Multimodal Spatial Reasoning

    Jul 29, 2026Feixiang Liu, Qiang Qiu, Lanbo Sun +3VLM EvaluationSpatial Reasoning Benchmarks

  6. SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

    Jul 15, 2026Cheng Tang, Junzhi Ning, Min Cen +9Reinforcement Learning with Verifiable RewardsVisually Grounded Reasoning

  7. UniVR: Thinking in Visual Space for Unified Visual Reasoning

    Jul 14, 2026Zhongwei Ren, Yunchao Wei, Yao Zhao +5Physical ReasoningVisual Spatial Reasoning

  8. The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning

    Jul 13, 2026Wencheng Ye, Yi Bin, Yujuan Ding +7VLM InterpretabilityMultimodal Reasoning

  9. OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

    Jul 10, 2026Yang Chen, Yunwen Li, Yufan Shen +6VLM EvaluationDocument Understanding

  10. Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction

    Jul 9, 2026Sophia Koehler, Antonia Wüst, Inga Ibs +5AI Agent EvaluationActive Learning

  11. Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

    Jul 7, 2026Han-Jun Ko, Jr-Jen Chen, Haobo Yuan +4Physical ReasoningVLM Reasoning

  12. Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning

    Jul 7, 2026Yake Wei, Yuan Wang, Fengyun Rao +2Vision-Language GroundingVLM Reasoning

  13. Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

    Jul 7, 2026Zhiwei Yang, Yuanchen Wu, Nan Zhang +3Multimodal Large Language ModelsMultimodal CoT Reasoning

  14. Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies

    Jul 6, 2026Adrian Szvoren, Dimitrios Kanoulas, Nilufer TuptukVisual NavigationVision-Language Navigation

  15. EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization

    Jul 6, 2026Youngkil Song, Yoonjae Baek, Dongwon Kim +3Temporal Video GroundingMultimodal CoT Reasoning

  16. IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning

    Jul 3, 2026Yuening Cai, Junwei Zhou, Youran Qu +1VLM EvaluationSpatial Reasoning Benchmarks

  17. MentalThink: Shaping Thoughts in Mental SVG World

    Jul 3, 2026Kangheng Lin, Jisheng Yin, Dingming Li +11Visual Spatial ReasoningLatent Visual Reasoning

  18. ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

    Jul 3, 2026Peiming Li, Yifan Wang, Xiaotian Zhang +4Multimodal Large Language ModelsLatent Visual Reasoning

  19. Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

    Jul 2, 2026Liyan Tang, Fangcong Yin, Greg DurrettVLM RobustnessVision-Language Models

  20. Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

    Jul 1, 2026Hongxing Li, Xiufeng Huang, Dingming Li +11Visual ReasoningVLM Reasoning

  21. GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

    Jul 1, 2026Dianyu Wang, Peirong Zhang, Xuyang Li +2Vision-Language GroundingVLM Reasoning

  22. Latent Visual Cache for Video Reasoning

    Jul 1, 2026Yongheng Zhang, Zhipeng Xu, Hao Wu +4Memory-Augmented VLMsVision-Language Models

  23. MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos

    Jul 1, 2026Leyuan Yu, Xiao Tang, Minghao Liu +6VLM EvaluationSpatial Reasoning Benchmarks

  24. PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

    Jun 30, 2026Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11Vision-Language GroundingTool-Using Vision-Language Agents

  25. Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

    Jun 30, 2026Rui Hao, Qiankun Li, Junyuan Mao +4Radiology Report GenerationMedical VQA

  26. Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning

    Jun 30, 2026Chih-Ting Liao, Fei Shen, Xin Cao +1Visual Spatial ReasoningVLM Interpretability