VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

    Apr 19, 2026Gaozhi Zhou, Hu He, Peng Shen +8Remote Sensing Image UnderstandingVisual Question Answering

  2. Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

    Apr 17, 2026Yige Xu, Yongjie Wang, Zizhuo Wu +3Vision-Language ModelsVLM Adaptation

  3. Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization

    Apr 17, 2026Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem +1VLM EvaluationLarge Vision-Language Models

  4. Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs

    Apr 17, 2026Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian +1Spatial Reasoning BenchmarksVisual Spatial Reasoning

  5. AstroVLM: Expert Multi-agent Collaborative Reasoning for Astronomical Imaging Quality Diagnosis

    Apr 17, 2026Yaohui Han, Tianshuo Wang, Zixi Zhao +6Vision-Language ModelsVLM Reasoning

  6. PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation

    Apr 17, 2026Shuyan Ke, Yifan Mei, Changli Wu +4Image SegmentationRemote Sensing Image Segmentation

  7. HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning

    Apr 17, 2026Yanbin Wei, Chun Kang, Siwei Li +11VLM EvaluationLarge Vision-Language Models

  8. How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability Study

    Apr 16, 2026Zhen Yang, Ping Jian, Zhongbin Guo +5Visual Spatial ReasoningLarge Vision-Language Models

  9. Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models

    Apr 16, 2026Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras +1CoT FaithfulnessVision-Language Models

  10. Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

    Apr 16, 2026Yixu Huang, Tinghui Zhu, Muhao ChenEfficient VLM InferenceVisual Reasoning

  11. H2VLR: Heterogeneous Hypergraph Vision-Language Reasoning for Few-Shot Anomaly Detection

    Apr 16, 2026Jianghong Huang, Luping Ji, Weiwei Duan +1Few-Shot Anomaly DetectionMedical Image Anomaly Detection

  12. A Progressive Training Strategy for Embodied Vision-Language Models to Mitigate Spatio-Temporal Hallucinations

    Apr 12, 2026Xiaoda Yang, Shuai Yang, Can Wang +9VLM AdaptationVLM Hallucination

  13. Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents

    Apr 10, 2026Sangwon Baik, Gunhee Kim, Mingi Choi +1Language-Conditioned Robot ManipulationObject Pose Estimation

  14. Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

    Apr 8, 2026Mengdan Zhu, Senhao Cheng, Liang ZhaoVLM InterpretabilityLatent Visual Reasoning

  15. Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering

    Mar 30, 2026Yanjie Zhang, Yafei Li, Rui Sheng +5VLM RobustnessChart QA

  16. Can VLMs Reason Robustly? A Neuro-Symbolic Investigation

    Mar 25, 2026Weixin Chen, Antonio Vergari, Han ZhaoVLM RobustnessVisual Reasoning

  17. Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs

    Mar 23, 2026Efthymios Tsaprazlis, Tiantian Feng, Anil Ramakrishna +3VLM EvaluationPrivacy Auditing

  18. VIGIL: Part-Grounded Structured Reasoning for Generalizable Deepfake Detection

    Mar 23, 2026Xinghan Li, Junhao Xu, Jingjing ChenExplainable Deepfake DetectionDeepfake Detection

  19. Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

    Mar 12, 2026Mei Chee Leong, Ying Gu, Hui Li Tan +2VLM EvaluationVision-Language Models

  20. BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations

    Mar 6, 2026Thomas Monninger, Shaoyuan Xie, Qi Alfred Chen +1VLMs for Autonomous DrivingEnd-to-End Autonomous Driving

  21. Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

    Mar 5, 2026Shan Ning, Longtian Qiu, Xuming HeVisual Question AnsweringReinforcement Learning

  22. HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework

    Feb 27, 2026Jiacheng Yang, Anqi Chen, Yunkai Dang +5Efficient Multimodal InferenceVLM Reasoning

  23. Imagination Helps Visual Reasoning, But Not Yet in Latent Space

    Feb 26, 2026You Li, Chi Chen, Yanghao Li +4Causal Mediation AnalysisVisual Reasoning

  24. Egocentric Bias in Vision-Language Models

    Feb 10, 2026Maijunxian Wang, Yijiang Li, Bingyang Wang +6VLM EvaluationVisual Spatial Reasoning

  25. Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models

    Feb 7, 2026Yankai Yang, Yancheng Long, Hongyang Wei +12Reward ModelingMultimodal Reward Modeling

  26. SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

    Feb 6, 2026Niccolo Avogaro, Nayanika Debnath, Li Mi +6Visual Question AnsweringEfficient VLM Inference

  27. MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models

    Jan 28, 2026Wenbo Xu, Wei Lu, Xiangyang LuoExplainable Deepfake DetectionDeepfake Detection