Visually Grounded Reasoning

Momentum

17 papers in the last four weeks, up 183% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 285

All topics
CardsList
  1. GeoR-Bench: Evaluating Geoscience Visual Reasoning

    May 12, 2026Yushuo Zheng, Zicheng Zhang, Huiyu Duan +7Remote Sensing Image UnderstandingGeospatial Reasoning

  2. Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking

    May 11, 2026Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur +4VLM EvaluationVision-Language Models

  3. VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models

    May 11, 2026Hao Wang, Xiaobao Wei, Jingyang He +103D Spatial ReasoningRobotic Manipulation

  4. SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation

    May 11, 2026Niyati Rawal, Sushant Ravva, Shah Alam Abir +5VLM EvaluationSpatial Reasoning Benchmarks

  5. V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

    May 11, 2026Zhiwei Ning, Xuanang Gao, Jiaxi Cao +6Large Vision-Language ModelsMultimodal Reasoning

  6. The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

    May 11, 2026Xia Hu, Zhenrui Yue, Brian Potetz +4VLM EvaluationSpatial Reasoning Benchmarks

  7. Do multimodal models imagine electric sheep?

    May 10, 2026Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes +2Visual Spatial ReasoningWorld Model Learning

  8. Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

    May 10, 2026Xuan Gong, Hanbo Huang, Hao Zheng +4Vision-Language ModelsVision-Language Grounding

  9. Investigating Anisotropy in Visual Grounding under Controlled Counterfactual Perturbations

    May 9, 2026Gabriele Lombardo, Luigi Maiorana, Liliana Lo Presti +1Neural Representation GeometryVLM Interpretability

  10. CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

    May 9, 2026Joowon Kim, Seungho Shin, Joonhyung Park +1Video GenerationVideo Reasoning

  11. Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning

    May 8, 2026Jin Cui, Xinyue Long, Xunyong Zhang +5Visual Spatial ReasoningVisual Reasoning

  12. From Priors to Perception: Grounding Video-LLMs in Physical Reality

    May 6, 2026Zicheng Zhao, Chaofan Gan, Shijie Li +1VLM AdaptationVLM Reasoning

  13. Weakly Supervised Concept Learning for Object-centric Visual Reasoning

    May 5, 2026Sparsh Tiwari, Bettina Finzel, Gesina SchwalbeVisual ReasoningObject-Centric Representation Learning

  14. Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning

    May 5, 2026Qihua Dong, Ruozhen He, Junwen Chen +4Data VisualizationChart QA

  15. MolmoAct2: Action Reasoning Models for Real-world Deployment

    May 4, 2026Haoquan Fang, Jiafei Duan, Donovan Clay +26RoboticsEfficient VLA Models

  16. Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs

    May 4, 2026Xin Zhang, Qiqi Tao, Jiawei Du +2Inference-Time OptimizationTest-Time Optimization

  17. Perceptual Flow Network for Visually Grounded Reasoning

    May 4, 2026Yangfu Li, Yuning Gong, Hongjian Zhan +8Object Hallucination in VLMsVLM Reasoning

  18. Act2See: Emergent Active Visual Perception for Video Reasoning

    May 3, 2026Martin Q. Ma, Yuxiao Qu, Aditya Agrawal +4Tool Use in VLMsVideo Reasoning

  19. MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models

    May 2, 2026Yin Zhang, Jiaxuan Zhao, Zonghan Wu +5Vision-Language ModelsReinforcement Learning

  20. The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design

    May 2, 2026Anjie Liu, Ziqin Gong, Yan Song +6VLM ReasoningVisually Grounded Reasoning

  21. Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning

    Apr 28, 2026Yashwant Pravinrao Bangde, Debaditya RoyObject Hallucination in VLMsVision-Language Grounding

  22. DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

    Apr 28, 2026Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande +4VLM EvaluationVisual Reasoning

  23. Improving Vision-language Models with Perception-centric Process Reward Models

    Apr 27, 2026Yingqian Min, Kun Zhou, Yifan Li +6Process Reward ModelsObject Hallucination in VLMs

  24. PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model

    Apr 27, 2026Sinin Zhang, Yunfei Xie, Yuxuan Cheng +2Vision-Language ModelsVLM Reasoning

  25. Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation

    Apr 27, 2026Yubo Jiang, Xin Yang, Abudukelimu Wuerkaixi +7Hallucination in Language ModelsObject Hallucination in VLMs

  26. See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

    Apr 27, 2026Zhiheng Wu, Tong Wang, Shuning Wang +2Tool Use in VLMsVLM Reasoning

  27. SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments

    Apr 24, 2026Chih-Ting Liao, Xi Xiao, Chunlei Meng +6Spatial Reasoning BenchmarksVisual Spatial Reasoning

  28. SketchVLM: Vision language models can annotate images to explain thoughts and guide users

    Apr 23, 2026Brandon Collins, Logan Bolton, Hung Huy Nguyen +3Vision-Language ModelsLLM-Assisted Annotation

  29. Grounding Video Reasoning in Physical Signals

    Apr 23, 2026Alibay Osmanli, Zixu Cheng, Shaogang GongTemporal Video GroundingVideo QA