Visually Grounded Reasoning

Momentum

17 papers in the last four weeks, up 183% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 285

All topics
CardsList
  1. VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

    Nov 21, 2025Lingxiao Li, Yifan Wang, Xinyan Gao +3Visual Spatial ReasoningVisual Reasoning

  2. SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

    Nov 10, 2025Hunar Batra, Haoqin Tu, Hardy Chen +3Visual Question AnsweringScene Graph Generation

  3. Explain Before You Answer: A Survey on Compositional Visual Reasoning

    Aug 24, 2025Fucai Ke, Joy Hsu, Zhixi Cai +10Compositional ReasoningVisual Reasoning

  4. A Study of Commonsense Reasoning over Visual Object Properties

    Aug 14, 2025Abhishek Kolari, Mohammadhossein Khojasteh, Yifan Jiang +2VLM EvaluationVisual Question Answering

  5. Position: Reasoning After Perception Means Reasoning Without Vision

    Jul 21, 2025Hongcheng Gao, Zihao Huang, Jingyi Tang +12Visual ReasoningVLM Reasoning

  6. AntiGrounding: Executable Robot Trajectories as Visual Prompts for VLM-Guided Manipulation

    Jun 14, 2025Wenbo Li, Yiteng Chen, Wenhao Li +1Trajectory GenerationLanguage-Conditioned Robot Manipulation

  7. Gondola: Grounded Vision Language Planning for Robotic Manipulation

    Jun 12, 2025Shizhe Chen, Ricardo Garcia, Paul Pacaud +1Long-Horizon Robotic ManipulationRobot Task Planning

  8. ViPlan: A Benchmark for Visual Planning with Symbolic Predicates and Vision-Language Models

    May 19, 2025Matteo Merler, Nicola Dainese, Minttu Alakuijala +5Large Language Model-Based Robot PlanningSymbolic Planning

  9. ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models

    Feb 13, 2025Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma +31Visual ReasoningVLM Reasoning

  10. Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

    Date pendingGuiqiu Liao, Matjaz Jogan, Daniel A. HashimotoImage TokenizationHealthcare

  11. Reason Through the Latent! Making Latent Visual Reasoning Necessary

    Date pendingSuhyeong Park, Junha Jung, Jaewoo KangVisual ReasoningMultimodal Reasoning