Visually Grounded Reasoning

Momentum

17 papers in the last four weeks, up 183% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 285

All topics
CardsList
  1. GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning

    May 21, 2026Deshui Miao, Xingsen Huang, Yameng Gu +3Visual Spatial ReasoningSpatiotemporal Reasoning

  2. Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

    May 21, 2026Changyuan Tian, Zhicong Lu, Huaxing Liu +7Multimodal Large Language ModelsMultimodal Reasoning

  3. Visual-Advantage On-Policy Distillation for Vision-Language Models

    May 21, 2026Ruiqi Liu, Xiaolei Lv, Gengsheng Li +8Vision-Language ModelsVLM Distillation

  4. MM-Conv: A Multimodal Dataset and Benchmark for Context-Aware Grounding in 3D Dialogue

    May 20, 2026Anna Deichler, Jim O'Regan, Fethiye Irmak Dogan +4Query ReformulationVisually Grounded Reasoning

  5. SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching

    May 20, 2026Xuefei Sun, Xujia Zhang, Brendan Crowe +23D SGGVisually Grounded Reasoning

  6. VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

    May 20, 2026Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu +5VLM EvaluationVisual Question Answering

  7. From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models

    May 19, 2026Juncheng Wu, Hardy Chen, Haoqin Tu +6Vision-Language ModelsVLM Reasoning

  8. GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards

    May 19, 2026Kyeongjin Ahn, Seungeon Lee, Krishna P. Gummadi +1Self-Play RLGeospatial Reasoning

  9. EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

    May 19, 2026Yang Dai, Dian Jiao, Tianwei Lin +1Egocentric Video QACoT Reasoning

  10. Leveraging Latent Visual Reasoning in Silence

    May 18, 2026Dongyao Zhu, Zhen Wang, Xi Xiao +7Visual Spatial ReasoningLatent Visual Reasoning

  11. AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents

    May 18, 2026Pan Wang, Yihao Hu, Xiujin Liu +3Memory-Augmented VLMsReward Shaping

  12. CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

    May 18, 2026Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid +3VLM EvaluationVision-Language Models

  13. GeoWorld-VLM: Geometry from World Models for Vision-Language Models

    May 15, 2026Renjie Gu, Kaichen Zhou, Yan Luo +1Visual Spatial ReasoningVLM Adaptation

  14. Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination

    May 15, 2026Chufan Shi, Cheng Yang, Yaokang Wu +4VLM EvaluationVLM Robustness

  15. MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

    May 14, 2026Minghao Guo, Qingyue Jiao, Zeru Shi +14Multimodal MemoryAI Agent Evaluation

  16. GeoVista: Visually Grounded Active Perception for Vision-Language Understanding of Ultra-High-Resolution Remote Sensing Images

    May 14, 2026Jiashun Zhu, Ronghao Fu, Jiasen Hu +3Remote Sensing Image UnderstandingRemote Sensing VQA

  17. CurveBench: A Benchmark for Exact Topological Reasoning over Nested Jordan Curves

    May 13, 2026Amirreza Mohseni, Mona Mohammadi, Morteza Saghafian +1VLM EvaluationSpatial Reasoning Benchmarks

  18. Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

    May 13, 2026Haozhe Wang, Qixin Xu, Changpeng Wang +4Multimodal ReasoningVLM Reasoning

  19. CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning

    May 13, 2026Tengda Guo, Jie Leng, Hanlei Li +6Process Reward ModelsVisual Reasoning

  20. Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models

    May 13, 2026Yiran Ling, Qing Lian, Jinghang Li +6Robotic ControlRobot Policy Learning

  21. PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning

    May 13, 2026Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong +6VLM ReasoningReinforcement Learning with Verifiable Rewards

  22. 3D Primitives are a Spatial Language for VLMs

    May 12, 2026Junze Liu, Kun Qian, Florian Dubost +8Spatial Reasoning Benchmarks3D Spatial Reasoning

  23. Beyond Localization: A Comprehensive Benchmark of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images

    May 12, 2026Yuangong Chen, Wai Keung Wong, Jiaxing Li +2Spatial Reasoning BenchmarksVisual Spatial Reasoning

  24. UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs

    May 12, 2026Shuo Ni, Tong Wang, Jing Zhang +5VLM EvaluationRemote Sensing Image Understanding

  25. Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model

    May 12, 2026Chenfeng Wang, Wei He, Xuhan Zhu +10Visual ReasoningLatent Visual Reasoning

  26. UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs

    May 12, 2026Houcheng Jiang, Jiajun Fu, Junfeng Fang +4Efficient Multimodal InferenceMultimodal Large Language Models

  27. Allegory of the Cave: Measurement-Grounded Vision-Language Learning

    May 12, 2026Kepeng Xu, Li Xu, Gang He +1Large Vision-Language ModelsVision-Language Grounding