VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning

    Apr 29, 2026Wanyue Zhang, Wenxiang Wu, Wang Xu +6Visual Spatial ReasoningVLM Adaptation

  2. Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning

    Apr 29, 2026Hao Guo, Fei Wang, Junjie Chen +4VLM RobustnessVisual Reasoning

  3. Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning

    Apr 28, 2026Yashwant Pravinrao Bangde, Debaditya RoyObject Hallucination in VLMsVision-Language Grounding

  4. A systematic evaluation of vision-language models for observational astronomical reasoning tasks

    Apr 27, 2026Wenke Ren, Hengxiao Guo, Wenwen Zuo +1VLM EvaluationVision-Language Models

  5. Improving Vision-language Models with Perception-centric Process Reward Models

    Apr 27, 2026Yingqian Min, Kun Zhou, Yifan Li +6Process Reward ModelsObject Hallucination in VLMs

  6. PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model

    Apr 27, 2026Sinin Zhang, Yunfei Xie, Yuxuan Cheng +2Vision-Language ModelsVLM Reasoning

  7. See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

    Apr 27, 2026Zhiheng Wu, Tong Wang, Shuning Wang +2Tool Use in VLMsVLM Reasoning

  8. Grounding Before Generalizing: How AI Differs from Humans in Causal Transfer

    Apr 27, 2026Liangru Xiang, Yuxi Ma, Zhihao Cao +2LLM GroundingCausal Structure Learning

  9. IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

    Apr 27, 2026Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides +2Intent ClassificationVideo-Language Models

  10. Agri-CPJ: A Training-Free Explainable Framework for Agricultural Pest Diagnosis Using Caption-Prompt-Judge and LLM-as-a-Judge

    Apr 26, 2026Wentao Zhang, Qi Zhang, Mingkun Xu +6Agricultural Image AnalysisVLM Reasoning

  11. Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

    Apr 25, 2026Boqi Chen, Xudong Liu, Yunke Ao +1Visual Question AnsweringLanguage Model Calibration

  12. SketchVLM: Vision language models can annotate images to explain thoughts and guide users

    Apr 23, 2026Brandon Collins, Logan Bolton, Hung Huy Nguyen +3Vision-Language ModelsLLM-Assisted Annotation

  13. VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

    Apr 23, 2026Byeonggeuk Lim, Kyeonghyun Kim, JungMin Yun +1VLM EvaluationCoT Reasoning

  14. Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning

    Apr 23, 2026Mohit Vaishnav, Tanel TammetLogical ReasoningVisual Reasoning

  15. SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning

    Apr 23, 2026Chan Yeong Hwang, Miso Choi, Sunghyun On +2Test-Time AdaptationMulti-Agent Orchestration

  16. Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models

    Apr 22, 2026Juhong Min, Lazar Valkov, Vitali Petsiuk +2Visual AttentionEfficient VLM Inference

  17. OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model

    Apr 22, 2026Qiguang Chen, Chengyu Luan, Jiajun Wu +7VLM EvaluationVisual Reasoning

  18. Video-ToC: Video Tree-of-Cue Reasoning

    Apr 22, 2026Qizhong Tan, Zhuotao Tian, Guangming Lu +2Video ReasoningVLM Reasoning

  19. HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

    Apr 22, 2026Tao Cheng, Shi-Zhe Chen, Hao Zhang +3Multimodal Large Language ModelsMultimodal Reasoning

  20. EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving

    Apr 22, 2026Finn Rasmus Schäfer, Yuan Gao, Dingrui Wang +5VLM EvaluationAutonomous Driving Benchmarks

  21. Visual Reasoning through Tool-supervised Reinforcement Learning

    Apr 21, 2026Qihua Dong, Gozde Sahin, Pei Wang +4Tool Use in VLMsVLM Reasoning

  22. Infection-Reasoner: A Compact Vision-Language Model for Wound Infection Classification with Evidence-Grounded Clinical Reasoning

    Apr 21, 2026Palawat Busaranuvong, Reza Saadati Fard, Emmanuel Agu +4HealthcareMedical Diagnosis

  23. Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

    Apr 21, 2026Chuou Xu, Liya Ji, Qifeng ChenLarge Vision-Language ModelsVLM Reasoning

  24. CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models

    Apr 21, 2026Shengli Zhou, Xiangchen Wang, Guanhua Chen +13D Spatial ReasoningVLM Reasoning

  25. Disparities In Negation Understanding Across Languages In Vision-Language Models

    Apr 21, 2026Charikleia Moraitaki, Sarah Pan, Skyler Pulling +3VLM EvaluationVision-Language Models

  26. S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models

    Apr 20, 2026Nitish Shukla, Surgan Jandial, Arun RossDirect Preference OptimizationVisual Reasoning

  27. XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

    Apr 20, 2026Kangan Qian, ChuChu Xie, Yang Zhong +133D Spatial ReasoningEmbodied QA

  28. Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models

    Apr 20, 2026Haiweng Xu, Sipeng Zheng, Hao Luo +3VLM EvaluationVLM Reasoning

  29. ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning

    Apr 20, 2026Tuan Van Vo, Tan Q. Nguyen, Khang Nguyen +5Robotic ManipulationVLM Reasoning