Visually Grounded Reasoning

Momentum

17 papers in the last four weeks, up 183% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 285

All topics
CardsList
  1. CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

    Aug 3, 2026Xuehang Guo, Pingyue Zhang, Ruiyi Zhang +6Data VisualizationChart QA

  2. DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

    Aug 1, 2026An Lanji, Dawei Liu, Jin Li +3AI Agent ReliabilityVLM Interpretability

  3. TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning

    Jul 31, 2026Binnan Liu, Yechi Ma, Tian Xie +1Visual ReasoningVisually Grounded Reasoning

  4. Visual Credit Audit for Multimodal Spatial Reasoning

    Jul 29, 2026Feixiang Liu, Qiang Qiu, Lanbo Sun +3VLM EvaluationSpatial Reasoning Benchmarks

  5. SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

    Jul 15, 2026Cheng Tang, Junzhi Ning, Min Cen +9Reinforcement Learning with Verifiable RewardsVisually Grounded Reasoning

  6. UniVR: Thinking in Visual Space for Unified Visual Reasoning

    Jul 14, 2026Zhongwei Ren, Yunchao Wei, Yao Zhao +5Physical ReasoningVisual Spatial Reasoning

  7. The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning

    Jul 13, 2026Wencheng Ye, Yi Bin, Yujuan Ding +7VLM InterpretabilityMultimodal Reasoning

  8. OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

    Jul 10, 2026Yang Chen, Yunwen Li, Yufan Shen +6VLM EvaluationDocument Understanding

  9. Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction

    Jul 9, 2026Sophia Koehler, Antonia Wüst, Inga Ibs +5AI Agent EvaluationActive Learning

  10. Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

    Jul 7, 2026Han-Jun Ko, Jr-Jen Chen, Haobo Yuan +4Physical ReasoningVLM Reasoning

  11. Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning

    Jul 7, 2026Yake Wei, Yuan Wang, Fengyun Rao +2Vision-Language GroundingVLM Reasoning

  12. Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

    Jul 7, 2026Zhiwei Yang, Yuanchen Wu, Nan Zhang +3Multimodal Large Language ModelsMultimodal CoT Reasoning

  13. Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies

    Jul 6, 2026Adrian Szvoren, Dimitrios Kanoulas, Nilufer TuptukVisual NavigationVision-Language Navigation

  14. EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization

    Jul 6, 2026Youngkil Song, Yoonjae Baek, Dongwon Kim +3Temporal Video GroundingMultimodal CoT Reasoning

  15. IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning

    Jul 3, 2026Yuening Cai, Junwei Zhou, Youran Qu +1VLM EvaluationSpatial Reasoning Benchmarks

  16. MentalThink: Shaping Thoughts in Mental SVG World

    Jul 3, 2026Kangheng Lin, Jisheng Yin, Dingming Li +11Visual Spatial ReasoningLatent Visual Reasoning

  17. ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

    Jul 3, 2026Peiming Li, Yifan Wang, Xiaotian Zhang +4Multimodal Large Language ModelsLatent Visual Reasoning

  18. Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

    Jul 2, 2026Liyan Tang, Fangcong Yin, Greg DurrettVLM RobustnessVision-Language Models

  19. Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

    Jul 1, 2026Hongxing Li, Xiufeng Huang, Dingming Li +11Visual ReasoningVLM Reasoning

  20. GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

    Jul 1, 2026Dianyu Wang, Peirong Zhang, Xuyang Li +2Vision-Language GroundingVLM Reasoning

  21. Latent Visual Cache for Video Reasoning

    Jul 1, 2026Yongheng Zhang, Zhipeng Xu, Hao Wu +4Memory-Augmented VLMsVision-Language Models

  22. MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos

    Jul 1, 2026Leyuan Yu, Xiao Tang, Minghao Liu +6VLM EvaluationSpatial Reasoning Benchmarks

  23. PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

    Jun 30, 2026Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11Vision-Language GroundingTool-Using Vision-Language Agents

  24. Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

    Jun 30, 2026Rui Hao, Qiankun Li, Junyuan Mao +4Radiology Report GenerationMedical VQA

  25. Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning

    Jun 30, 2026Chih-Ting Liao, Fei Shen, Xin Cao +1Visual Spatial ReasoningVLM Interpretability

  26. PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

    Jun 30, 2026Duc Cao Dinh, Khai Le-Duc, Florent Draye +43D Spatial ReasoningVisually Grounded Reasoning