VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models

    May 8, 2026Dongdong Wang, Deepak Balakrishnan, Ravi Srinivasan +1Remote Sensing Image UnderstandingLarge Vision-Language Models

  2. GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

    May 8, 2026Brown Ebouky, Gabriele Carrino, Niccolo Avogaro +3Active PerceptionVLM Reasoning

  3. RuleSafe-VL: Evaluating Rule-Conditioned Decision Reasoning in Vision-Language Content Moderation

    May 8, 2026Zhifeng Lu, Dianyuan Wang, Yuhu Shang +1VLM EvaluationLogical Reasoning

  4. Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning

    May 8, 2026Jin Cui, Xinyue Long, Xunyong Zhang +5Visual Spatial ReasoningVisual Reasoning

  5. Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric

    May 7, 2026Ying Gu, Mei Chee Leong, Hui Li Tan +3VLM EvaluationLarge Vision-Language Models

  6. Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning

    May 7, 2026Xueheng Li, Yu Wang, Tao Hu +6Agricultural Image AnalysisVLM Reasoning

  7. 4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding

    May 7, 2026Zhangquan Chen, Manyuan Zhang, Xinlei Yu +9Visual Spatial ReasoningVideo Reasoning

  8. Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

    May 7, 2026Yuan Wang, Ouxiang Li, Yulong Xu +8Reward ModelingMultimodal Reward Modeling

  9. CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs

    May 7, 2026Zhengru Fang, Yanan Ma, Yu Guo +5VLM EvaluationChest X-Ray Classification

  10. AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries

    May 7, 2026Zhen Zhang, Yuhang Yang, Yunxiang Jiang +5Temporal Video GroundingLong-Video Understanding

  11. FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis

    May 6, 2026Woojin Lee, Pranav Mekkoth, Ye Tian +2Hierarchical ClassificationFine-Grained Image Classification

  12. PRISM: Perception Reasoning Interleaved for Sequential Decision Making

    May 6, 2026Mohamed Salim Aissi, Clemence Grislain, Clement Romac +4Active PerceptionVLM Reasoning

  13. When Relations Break: Analyzing Relation Hallucination in Vision-Language Model Under Rotation and Noise

    May 6, 2026Philip Wootaek Shin, Ajay Narayanan Sridhar, Sivani Devarapalli +3VLM RobustnessVLM Hallucination

  14. Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing

    May 6, 2026Miao Wang, Yuling Shi, Yijiang Li +8Grounded Text GenerationLarge Language Model-Based Role-Play Simulation

  15. From Priors to Perception: Grounding Video-LLMs in Physical Reality

    May 6, 2026Zicheng Zhao, Chaofan Gan, Shijie Li +1VLM AdaptationVLM Reasoning

  16. Information Coordination as a Bridge: A Neuro-Symbolic Architecture for Reliable Autonomous Driving Scene Understanding

    May 6, 2026Shuo Liu, Lei Shi, Haowen Liu +3Object Hallucination in VLMsAutonomous Driving Perception

  17. Large Language Models are Universal Reasoners for Visual Generation

    May 5, 2026Sucheng Ren, Chen Chen, Zhenbang Wang +5Diffusion Model GuidanceImage Generation

  18. What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity

    May 5, 2026Haoxi Li, Qinglin Hou, Jianfei Ma +6Intrinsic MotivationRL Exploration

  19. MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models

    May 5, 2026Kangkang Wang, Qinting Jiang, Wanping Zhang +2VLM EvaluationVision-Language Models

  20. Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs

    May 4, 2026Xin Zhang, Qiqi Tao, Jiawei Du +2Inference-Time OptimizationTest-Time Optimization

  21. Perceptual Flow Network for Visually Grounded Reasoning

    May 4, 2026Yangfu Li, Yuning Gong, Hongjian Zhan +8Object Hallucination in VLMsVLM Reasoning

  22. Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning

    May 4, 2026Haoyu Wang, Haonan Wang, Yuyan Chen +5Multimodal ICLIn-Context Learning

  23. Act2See: Emergent Active Visual Perception for Video Reasoning

    May 3, 2026Martin Q. Ma, Yuxiao Qu, Aditya Agrawal +4Tool Use in VLMsVideo Reasoning

  24. MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models

    May 2, 2026Yin Zhang, Jiaxuan Zhao, Zonghan Wu +5Vision-Language ModelsReinforcement Learning

  25. The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design

    May 2, 2026Anjie Liu, Ziqin Gong, Yan Song +6VLM ReasoningVisually Grounded Reasoning

  26. Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

    May 1, 2026Siyuan Huang, Xiaoye Qu, Yafu Li +6Memory-Augmented VLMsVLM Robustness

  27. Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning

    Apr 30, 2026Junpeng Ding, Zichen Tang, Haihong E +17AI for ScienceVLM Reasoning