VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

    Jul 2, 2026Liyan Tang, Fangcong Yin, Greg DurrettVLM RobustnessVision-Language Models

  2. Show Me Examples: Inferring Visual Concepts from Image Sets

    Jul 2, 2026Nick Stracke, Kolja Bauer, Stefan Andreas Baumann +3Vision-Language ModelsConditional Image Generation

  3. Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

    Jul 1, 2026Hongxing Li, Xiufeng Huang, Dingming Li +11Visual ReasoningVLM Reasoning

  4. GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

    Jul 1, 2026Dianyu Wang, Peirong Zhang, Xuyang Li +2Vision-Language GroundingVLM Reasoning

  5. ESC: Emotional Self-Correction for Reliable Vision-Language Models

    Jul 1, 2026Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy +9LLM Self-CorrectionVLM Reasoning

  6. Latent Visual Cache for Video Reasoning

    Jul 1, 2026Yongheng Zhang, Zhipeng Xu, Hao Wu +4Memory-Augmented VLMsVision-Language Models

  7. OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping

    Jul 1, 2026Xudong Li, Mengdan Zhang, Peixian Chen +7Visual Spatial Reasoning3D Spatial Reasoning

  8. DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding

    Jul 1, 2026Zhengbo Zhang, Mark He Huang, Zhigang Tu +1Temporal Video GroundingVLM Reasoning

  9. GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

    Jul 1, 2026Yanan Wang, Wen Li, Yibin Ying +1Text-Guided Image SegmentationVLM Reasoning

  10. What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models

    Jul 1, 2026Amirhosein Chahe, Tyler Naes, Jovin D'sa +4VLMs for Autonomous DrivingOcclusion Reasoning

  11. Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

    Jun 30, 2026Qian Ma, S M Rayeed, Charles V. Stewart +2VLM EvaluationVisual Question Answering

  12. PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

    Jun 30, 2026Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11Vision-Language GroundingTool-Using Vision-Language Agents

  13. Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision

    Jun 30, 2026Xianda Zheng, Huan Gao, Meng-Fen Chiang +3LLM AlignmentMedical VLMs

  14. SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search

    Jun 30, 2026Ming Dai, Zhihong Lu, Jinjie Gu +5Tool-Augmented Language Model AgentsAgentic Search

  15. Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

    Jun 30, 2026Ziqi Li, Zijian Chen, Tingzhu Chen +1VLM EvaluationDocument Understanding

  16. Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving

    Jun 30, 2026Anh Dung Dinh, Simon Khan, Flora SalimEfficient VLM InferenceSpeculative Decoding

  17. Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning

    Jun 30, 2026Hongyi Lin, Yang Liu, Jinhua Zhao +1VLM ReasoningMultimodal Foundation Models

  18. Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

    Jun 29, 2026Yutao Sun, Yanting Miao, Hao-Xuan Ma +8Tool Use in VLMsVLM Adaptation

  19. Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

    Jun 29, 2026Kai Jiang, Ruishu Zhu, Siqi Huang +2Visual Question AnsweringMultimodal Large Language Models

  20. H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning

    Jun 29, 2026Eric Peh, Debaditya Roy, Basura FernandoReinforcement LearningVisual Reasoning

  21. StrucTab: A Structured Optimization Framework for Table Parsing

    Jun 29, 2026Gengluo Li, Shangpin Peng, Chengquan Zhang +10Table Structure RecognitionVLM Reasoning

  22. Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation

    Jun 29, 2026Wentong Tian, Jiyuan Zhao, Tianliang Yao +4RL for RoboticsRobotic Endovascular Intervention

  23. ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models

    Jun 28, 2026Rahul Chowdhury, Timothy A Rupprecht, Xuan Shen +2Visual Spatial ReasoningVLM Adaptation

  24. MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

    Jun 28, 2026Hong-Han Wang, Yuntao Wang, Hu DingLarge Vision-Language ModelsVLM Reasoning

  25. EVLA: An Electro-Aware Multimodal Assistant for Physically-Grounded Driving Reasoning and Control

    Jun 27, 2026Yuxin Liu, Zihan Chen, Haoyu Wang +3VLMs for Autonomous DrivingEnd-to-End Autonomous Driving

  26. On Test-Time Scaling for Vision-Language Models

    Jun 27, 2026Fawaz Sammani, Tzoulio Chamiti, Nikos DeligiannisVLM EvaluationTest-Time Scaling for VLMs