Visually Grounded Reasoning

Momentum

17 papers in the last four weeks, up 183% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 285

All topics
CardsList
  1. GROW2^2: Grounding Which and Where for Robot Tool Use

    Jun 29, 2026Yuhong Deng, Yuyao Liu, David HsuRobotic Tool UseVisually Grounded Reasoning

  2. Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

    Jun 29, 2026Yutao Sun, Yanting Miao, Hao-Xuan Ma +8Tool Use in VLMsVLM Adaptation

  3. Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

    Jun 29, 2026Kai Jiang, Ruishu Zhu, Siqi Huang +2Visual Question AnsweringMultimodal Large Language Models

  4. H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning

    Jun 29, 2026Eric Peh, Debaditya Roy, Basura FernandoReinforcement LearningVisual Reasoning

  5. Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models

    Jun 26, 2026Niclas Lietzow, Danielle Bitterman, Carsten Eickhoff +2Knowledge Conflicts in Language ModelsVLM Interpretability

  6. COCOLogic-V2: Identifying Logical Inconsistencies via Truly Hard-Negatives

    Jun 26, 2026David Steinmann, Antonia Wüst, Kristian Kersting +1Logical ReasoningVisual Reasoning

  7. Latent Visual Diffusion Reasoning with Monte Carlo Tree Search

    Jun 26, 2026Xirui Teng, Nan Xi, Junsong YuanLatent Visual ReasoningVisually Grounded Reasoning

  8. Understanding How MLLMs Describe Artworks Using Token Activation Maps

    Jun 26, 2026Nicola Fanelli, Pasquale De Marinis, Raffaele Scaringi +3VLM InterpretabilityVision-Language Grounding

  9. ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

    Jun 25, 2026Sicheng Zhang, Muzammal Naseer, Binzhu Xie +5Compositional ReasoningMultimodal Reasoning

  10. Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

    Jun 25, 2026Mengzhao Wang, Yanli Ji, Wangmeng Zuo +2Efficient Multimodal InferenceKV Caching

  11. From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

    Jun 25, 2026Zhixing Li, Yinan YuVLM EvaluationSpatial Reasoning Benchmarks

  12. TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

    Jun 24, 2026Yu-Yang Chen, Lan-Zhe GuoSpatial Reasoning BenchmarksVisual Reasoning

  13. V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning

    Jun 24, 2026Haoxiang Sun, Zhihang Yi, Langxuan Deng +6Visual ReasoningVLM Distillation

  14. PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

    Jun 23, 2026Ling Li, Bowen Liu, Zinuo Zhan +5Visual Spatial ReasoningVision-Language Grounding

  15. Ill-Posed by Design: Probing Evidence Use in VLMs

    Jun 23, 2026Boaz Meivar, Shaked Perek, Shani Shvartzman +2VLM EvaluationCounterfactual Evaluation of VLMs

  16. An LMM for Precisely Grounding Elements in Documents

    Jun 23, 2026Yijian Lu, Chuangxin Zhao, Kai Sun +3Visual ReasoningLarge Vision-Language Models

  17. Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

    Jun 22, 2026Jiho Choi, Seonho Lee, Seojeong Park +1Visual Question AnsweringActive Perception

  18. VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

    Jun 22, 2026Haoling Li, Kai Zheng, Jie Wu +4Multimodal ReasoningMathematical Reasoning

  19. Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

    Jun 22, 2026Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo +1Visual Question AnsweringVisual Reasoning

  20. SATURN: Symbolic Spatial Reasoning for Multi-Perspective Grounding

    Jun 21, 2026Danial Kamali, Tanawan Premsri, Shreya Rajpal +33D Spatial ReasoningVisually Grounded Reasoning

  21. MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

    Jun 21, 2026Srinivas Venkatanarayanan, Clement Pakkam IsaacVLM EvaluationSpatial Reasoning Benchmarks

  22. S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

    Jun 18, 2026Yalun Dai, Hao Li, Shulin Tian +10Visual Spatial Reasoning3D Spatial Reasoning

  23. SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs

    Jun 18, 2026Bo Yin, Xiaobin Hu, Chengming Xu +6VLM RobustnessVLM Adaptation

  24. ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

    Jun 18, 2026Yihao Wang, Zijian He, Jie Ren +1Multimodal GroundingMultimodal Reasoning

  25. Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

    Jun 17, 2026Sihan Wang, Xiyao Liu, Lianqing Liu +1Vision-Language ModelsOn-Policy Self-Distillation

  26. Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs

    Jun 16, 2026Chengwen Liu, Zhe Huang, Jisheng Dang +3Multimodal Reward ModelingVideo Reasoning