Visually Grounded Reasoning

Momentum

17 papers in the last four weeks, up 183% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 285

All topics
CardsList
  1. VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

    Apr 23, 2026Byeonggeuk Lim, Kyeonghyun Kim, JungMin Yun +1VLM EvaluationCoT Reasoning

  2. Beyond Pixels: Introspective and Interactive Grounding for Visualization Agents

    Apr 22, 2026Yiyang Lu, Woong Shin, Ahmad Maroof Karimi +3Scientific VisualizationData Visualization

  3. Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models

    Apr 22, 2026Juhong Min, Lazar Valkov, Vitali Petsiuk +2Visual AttentionEfficient VLM Inference

  4. V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Multimodal ReasoningReinforcement Learning with Verifiable Rewards

  5. Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Vision-Language ModelsHallucination in Language Models

  6. AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation

    Apr 20, 2026Rui Qian, Chuanhang Deng, Qiang Huang +6Image SegmentationText-Guided Image Segmentation

  7. SYMBOLIZER: Symbolic Model-free Task Planning with VLMs

    Apr 20, 2026Sami Azirar, Zlatan Ajanovic, Hermann BlumSymbolic PlanningRobot Task Planning

  8. SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning

    Apr 19, 2026Yian Li, Yang Jiao, Bin Zhu +4Visual Spatial ReasoningUnified Multimodal Models

  9. KIRA: Knowledge-Intensive Image Retrieval and Reasoning Architecture for Specialized Visual Domains

    Apr 18, 2026Parthaw Goswami, Jaynto Goswami DeepMultimodal RAGVisual Reasoning

  10. Real-Time Visual Attribution Streaming in Thinking Model

    Apr 17, 2026Seil Kang, Woojung Han, Junhyeok Kim +3VLM InterpretabilityMultimodal Reasoning

  11. Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs

    Apr 17, 2026Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian +1Spatial Reasoning BenchmarksVisual Spatial Reasoning

  12. Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

    Apr 17, 2026Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti +2Spatial Reasoning BenchmarksVisual Spatial Reasoning

  13. Beyond a Single Frame: Multi-Frame Spatially Grounded Reasoning Across Volumetric MRI

    Apr 17, 2026Lama Moukheiber, Caleb M. Yeung, Haotian Xue +33D Spatial Reasoning3D Medical Imaging

  14. Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models

    Apr 16, 2026Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras +1CoT FaithfulnessVision-Language Models

  15. Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding

    Apr 16, 2026Zhixuan Wu, Quanxing Zha, Teng Wang +6Video ReasoningMultimodal CoT Reasoning

  16. Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

    Apr 16, 2026Yixu Huang, Tinghui Zhu, Muhao ChenEfficient VLM InferenceVisual Reasoning

  17. GUI-Perturbed: Domain Randomization Reveals Systematic Brittleness in GUI Grounding Models

    Apr 15, 2026Yangyue Wang, Harshvardhan Sikka, Yash Mathur +3VLM EvaluationDomain Randomization

  18. Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

    Apr 8, 2026Mengdan Zhu, Senhao Cheng, Liang ZhaoVLM InterpretabilityLatent Visual Reasoning

  19. Can VLMs Reason Robustly? A Neuro-Symbolic Investigation

    Mar 25, 2026Weixin Chen, Antonio Vergari, Han ZhaoVLM RobustnessVisual Reasoning

  20. A Very Big Video Reasoning Suite

    Feb 23, 2026Maijunxian Wang, Ruisi Wang, Juyi Lin +53Reasoning EvaluationVideo Reasoning

  21. OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents

    Feb 19, 2026Akashah Shabbir, Muhammad Umer Sheikh, Muhammad Akhtar Munir +8Remote SensingGeospatial Reasoning

  22. SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

    Feb 6, 2026Niccolo Avogaro, Nayanika Debnath, Li Mi +6Visual Question AnsweringEfficient VLM Inference

  23. R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

    Jan 25, 2026Zhuohong Chen, Zhengxian Wu, Zirui Liao +6Multimodal RAGVisual Question Answering

  24. CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

    Jan 12, 2026Chaoyu Li, Fei Tao, Pooyan FazliTest-Time Scaling for VLMsTest-Time Scaling

  25. BabyVision: Visual Reasoning Beyond Language

    Jan 10, 2026Liang Chen, Weichu Xie, Yiyan Liang +27VLM EvaluationVisual Reasoning

  26. CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates

    Dec 11, 2025Shresth Grover, Priyank Pathak, Akash Kumar +1VLM ReasoningVisually Grounded Reasoning