VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. Vision-Language Models for Deployable Social Robot Navigation: Bridging Semantic Reasoning and Low-Level Control

    Jun 27, 2026Runji Cai, Toshihiko Yamasaki, Ling XiaoSafe Robot NavigationSocial Robot Navigation

  2. Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models

    Jun 25, 2026Shravan Venkatraman, Ritesh Thawkar, Omkar Thawakar +4Multimodal Large Language ModelsVLM Reasoning

  3. ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

    Jun 25, 2026Sicheng Zhang, Muzammal Naseer, Binzhu Xie +5Compositional ReasoningMultimodal Reasoning

  4. OracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training

    Jun 24, 2026Zijia Song, Yelin Wang, Zhengyi Ma +5VLM ReasoningPreference Optimization

  5. Enhancing Brain MRI Anomaly Detection and Reasoning with ROI Rethink and Synthetic Data

    Jun 24, 2026Shangkun Li, Jie Xu, Yi Guo +2Medical Image Anomaly DetectionVLM Reasoning

  6. Graph it first! Enabling Reasoning on Long-form Egocentric Videos through Scene Graphs

    Jun 24, 2026Agnese Taluzzi, Riccardo Santambrogio, Simone Mentasti +2Egocentric Video QAVideo QA

  7. Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray

    Jun 24, 2026Yonathan Michael, Mohamad Alansari, Natnael Takele +2Multimodal GroundingMultimodal Reasoning

  8. V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning

    Jun 24, 2026Haoxiang Sun, Zhihang Yi, Langxuan Deng +6Visual ReasoningVLM Distillation

  9. Vision-Language Model Reasoning for Contextual Semantic Mapping in Intralogistics

    Jun 23, 2026Marvin Rüdt, Hao Pang, Constantin Enke +2VLM ReasoningSemantic Mapping

  10. SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards

    Jun 23, 2026Sheng Xia, Zhengqin Lai, Tianxiang Jiang +4Temporal Video GroundingVideo Reasoning

  11. CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

    Jun 23, 2026Xinyu Mao, Yuhui Zeng, Xiaokun Liu +6Video CaptioningVideo-Language Models

  12. HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models

    Jun 22, 2026Hoang-Bao Le, Aiden Durrant, Thai Son Mai +3Contrastive LearningVLM Reasoning

  13. AIR: Adaptive Interleaved Reasoning with Code in MLLMs

    Jun 22, 2026Cong Han, Xiaohan Lan, Haibo Qiu +1Multimodal Large Language ModelsMathematical Reasoning

  14. Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

    Jun 22, 2026Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo +1Visual Question AnsweringVisual Reasoning

  15. VideoLatent: Video-Language Learning via Latent Self-Forcing

    Jun 22, 2026Zi-Yuan Hu, Zicong Tang, Shijia Huang +3Multimodal Large Language ModelsLatent Visual Reasoning

  16. MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

    Jun 21, 2026Srinivas Venkatanarayanan, Clement Pakkam IsaacVLM EvaluationSpatial Reasoning Benchmarks

  17. Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

    Jun 21, 2026Zhuoran Jin, Kejian Zhu, Hongbang Yuan +5Multimodal ReasoningVLM Reasoning

  18. Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding

    Jun 21, 2026Haodi Liu, Xinhang Yang, Kunda Yan +3Vision-Language ModelsHuman Activity Recognition

  19. Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

    Jun 20, 2026Sourabh Sharma, Sonam Gupta, SadbhawnaVLM ReasoningVLM Hallucination Mitigation

  20. HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

    Jun 19, 2026Awais Rauf, Ahmed Hasssan, Greg SlabaughVideo UnderstandingLong-Context Modeling

  21. Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

    Jun 18, 2026Haochen Han, Jue Wang, Alex Jinpeng Wang +1Test-Time AdaptationMultimodal Large Language Models

  22. Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

    Jun 17, 2026Sihan Wang, Xiyao Liu, Lianqing Liu +1Vision-Language ModelsOn-Policy Self-Distillation

  23. From Bounding Boxes to Visual Reasoning: An On-Policy Data Annotation Tool for Vision-Language Models

    Jun 17, 2026Like Zhang, Runliang Niu, Shiqi Wang +5Human-in-the-Loop AnnotationVLM Reasoning

  24. CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework

    Jun 16, 2026Sneha Rao, Shaina Raza, Dhanesh RamachandramVLM EvaluationVision-Language Grounding

  25. ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation

    Jun 16, 2026Tianyi Lu, Hui Zhang, Zijie Diao +8Long-Horizon Robotic ManipulationLanguage-Conditioned Robot Manipulation