Visually Grounded Reasoning

Momentum

17 papers in the last four weeks, up 183% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 285

All topics
CardsList
  1. MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

    Jun 16, 2026Xingming Li, Ao Cheng, Qiyao Sun +4VLM RobustnessVision-Language Models

  2. ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation

    Jun 16, 2026Tianyi Lu, Hui Zhang, Zijie Diao +8Long-Horizon Robotic ManipulationLanguage-Conditioned Robot Manipulation

  3. MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning

    Jun 16, 2026Wanshi Xu, Haokun Zhao, Haidong Yuan +2Multimodal ReasoningMultimodal Reward Modeling

  4. See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

    Jun 16, 2026Yilian Liu, Sicong Leng, Guoshun Nan +7Multimodal PretrainingVisually Grounded Reasoning

  5. ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

    Jun 16, 2026Hong Yang, Basura FernandoVisual Spatial ReasoningEmbodied QA

  6. Reinforcing Dual-Path Reasoning in Spatial Vision Language Models

    Jun 16, 2026Yatai Ji, An-Chieh Cheng, Yang Fu +13Visual Spatial Reasoning3D Spatial Reasoning

  7. Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations

    Jun 15, 2026Zhiqiang Zhou, Junliang Dai, Xu lingVLM InterpretabilityMultimodal CoT Reasoning

  8. Look Again Before You Abstain:Budgeted Conformal Evidence Acquisition for Reliable Vision-Language Model

    Jun 15, 2026Jian Xu, Delu Zeng, John Paisley +1Hallucination Detection in VLMsActive Perception

  9. Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

    Jun 15, 2026Yifan Wang, Peiming Li, Shiyu Li +5Efficient VLM InferenceLarge Vision-Language Models

  10. Thinking with Visual Grounding

    Jun 15, 2026Junkai Zhang, Yihe Deng, Kai-Wei Chang +1Visual Spatial ReasoningVision-Language Grounding

  11. RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought

    Jun 14, 2026Yaoting Huang, Yifu Yuan, Linqi Han +6Visual Spatial ReasoningCoT Reasoning

  12. FARM: Find Anything using Relational Spatial Memory

    Jun 13, 2026Siming He, Leo Huang, Adam Lilja +6Visual Spatial ReasoningRelational Reasoning

  13. VeriGeo: Controllable Geometry Question Generation with Numerical and Analytical Verification

    Jun 12, 2026Xiaoxian Duan, Zequn Liu, Yingce XiaSynthetic Data GenerationMultimodal Reasoning

  14. Mirage Probes: How Vision Models Fake Visual Understanding

    Jun 11, 2026Daniel Ben-Levi, Judah Goldfeder, Weiliang Zhao +5Vision-Language ModelsVLM Interpretability

  15. Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

    Jun 11, 2026Changye Li, Meng Lu, Yi Wu +1Tool Use in VLMsVisual Spatial Reasoning

  16. OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

    Jun 10, 2026Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci +6Medical VQAMedical VLMs

  17. Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding

    Jun 10, 2026Hyomin Kim, Junghye Kim, Joanie Hayoun Chung +4Reward ModelingText-to-Video Generation

  18. Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning

    Jun 10, 2026Chaofan Ma, Zhenjie Mao, Yuhuan Yang +5Visual Spatial Reasoning3D Spatial Reasoning

  19. AVIS: Adaptive Test-Time Scaling for Vision-Language Models

    Jun 10, 2026Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni +8Test-Time Adaptation of VLMsEfficient VLM Inference

  20. Visual Para-Thinker++: A Single-Policy Multi-Agent Framework for Visual Reasoning

    Jun 8, 2026Haoran Xu, Hongyu Wang, Yifei Gao +4Object Hallucination in VLMsMulti-Agent Collaboration

  21. Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?

    Jun 8, 2026Yizheng Sun, Mochuan Zhan, Yanan Ma +10VLM EvaluationVLM Robustness

  22. Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation

    Jun 7, 2026Yishuo Cai, Jiahui Liu, Yuanxin Liu +9Tool Use in VLMsEfficient VLM Inference

  23. TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

    Jun 7, 2026Lianyu Hu, Xiaoyu Ma, Zeqin Liao +1Multimodal Large Language ModelsMultimodal Reasoning

  24. EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories

    Jun 6, 2026Hassan Jaber, Refinath S N, Luca Cagliero +2Scene Graph GenerationVisual Spatial Reasoning

  25. STRIPS-WM: Learning Grounded Propositional STRIPS-style World Models from Images

    Jun 5, 2026Abhiroop Ajith, Constantinos ChamzasLong-Horizon Robotic ManipulationWorld Models for Robotics