VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

    Jun 16, 2026Hong Yang, Basura FernandoVisual Spatial ReasoningEmbodied QA

  2. Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition

    Jun 16, 2026Alessandro Sottovia, Alessandro Torcinovich, Oswald LanzZero-Shot LearningMulti-Agent Debate

  3. Reinforcing Dual-Path Reasoning in Spatial Vision Language Models

    Jun 16, 2026Yatai Ji, An-Chieh Cheng, Yang Fu +13Visual Spatial Reasoning3D Spatial Reasoning

  4. LADBench: A Benchmark for Logical Fault Detection in Images

    Jun 16, 2026Sahasra Kondapalli, Lara Radovanovic, Aadi Palnitkar +2VLM EvaluationMultimodal Reasoning

  5. Enhancing Pathological VLMs with Cross-scale Reasoning

    Jun 16, 2026Chi Phan, Tianyi Zhang, Qiaochu Xue +5Visual Question AnsweringComputational Pathology

  6. Implicit vs. Explicit Prompting Strategies for LVLMs in Referential Communication

    Jun 16, 2026Peter Zeng, Amie J. Paige, Weiling Li +3LLM PromptingPragmatic Reasoning in Language Models

  7. Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

    Jun 15, 2026Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina +1VLM EvaluationMultilingual Language Models

  8. Chronological Blindness: Benchmarking Temporal Reasoning in Vision-Language Models with CHRONOSIGHT

    Jun 15, 2026Parthaw Goswami, Jaynto Goswami DeepVLM EvaluationTemporal Reasoning

  9. GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction

    Jun 15, 2026Ruoxuan Yang, Tieyuan Chen, Xiaofeng Huang +6VLM ReasoningMultimodal Sentiment Analysis

  10. Thinking with Visual Grounding

    Jun 15, 2026Junkai Zhang, Yihe Deng, Kai-Wei Chang +1Visual Spatial ReasoningVision-Language Grounding

  11. RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought

    Jun 14, 2026Yaoting Huang, Yifu Yuan, Linqi Han +6Visual Spatial ReasoningCoT Reasoning

  12. From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models

    Jun 13, 2026Bessie Dominguez-Dager, Francisco Gomez-Donoso, Miguel Cazorla +3Egocentric Video UnderstandingIn-Context Learning

  13. CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

    Jun 12, 2026Jiayue Cao, Zhicong Lu, Xuehan Sun +6Multimodal Reward ModelingVLM Reasoning

  14. Position: The Systemic Lack of Agency in Visual Reasoning

    Jun 11, 2026Yizhao Huang, Haoyang Chen, Shiqin Wang +6VLM EvaluationVLM Reasoning

  15. OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

    Jun 10, 2026Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci +6Medical VQAMedical VLMs

  16. From Prompts to Tokens: Internalizing Causal Supervision in Vision-Language Model for Multi-Image Causal Reasoning

    Jun 10, 2026Haoping Yu, Yuanxi Li, Jing MaVisual ReasoningCausal Structure Learning

  17. AVIS: Adaptive Test-Time Scaling for Vision-Language Models

    Jun 10, 2026Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni +8Test-Time Adaptation of VLMsEfficient VLM Inference

  18. 4DP-QA: Scalable QA for 4D Perception in Vision Language Models

    Jun 10, 2026Seokju Cho, Abhishek Badki, Hang Su +5VLM EvaluationVLM Reasoning

  19. Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

    Jun 9, 2026Yifu Yuan, Yaoting Huang, Xianze Yao +20Long-Horizon Robotic ManipulationRobot Foundation Models

  20. Do VLMs Reason Like Engineers? A Benchmark and a Stage-wise Evaluation

    Jun 9, 2026Syed Wasiq, Syed Mohamad Tawseeq, Yashwant Pravinrao Bangde +1VLM EvaluationVisual Question Answering

  21. Reason Twice: Segmentation via Candidate Discovery and Comparative Reasoning

    Jun 8, 2026Xinyan Gao, Haoran Hao, Xiangyu YueImage SegmentationText-Guided Image Segmentation

  22. Visual Para-Thinker++: A Single-Policy Multi-Agent Framework for Visual Reasoning

    Jun 8, 2026Haoran Xu, Hongyu Wang, Yifei Gao +4Object Hallucination in VLMsMulti-Agent Collaboration

  23. MAGIS: Evidence-Based Multi-Agent Reasoning for Interpretable Strabismus Clinical Decision-Making

    Jun 8, 2026Xikai Tang, Yifan Wang, Jiafan Zhuang +12Medical DiagnosisMedical VLMs

  24. Temporal-Aware Reasoning Optimization for Video Temporal Grounding

    Jun 8, 2026Minghang Zheng, Zihao Yin, Yi Yang +2Temporal Video GroundingTemporal Reasoning