VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. WOVEN: Weaving Visual World Modeling into Multimodal LLMs

    Oct 8, 2026Zheyu Fan, Yue Zhang, Mingkai Deng +9VLM ReasoningWorld Model Learning

  2. Look Back, Think Ahead: Visual Memory on Demand for Efficient Multimodal Reasoning

    Oct 8, 2026Yicheng Xue, Han Wu, Jufeng Yang +4VLM ReasoningEfficient Multimodal Inference

  3. Seek-and-View Reasoning for Multi-View Spatial Understanding

    Oct 8, 2026Qixiang Chen, Cheng Zhang, Fucai Ke +3Visual Spatial ReasoningSpatial Reasoning

  4. Less from More: Reinforcing Sparse Video Reasoning from Dense References

    Oct 7, 2026Wenfang Sun, Yingjun Du, Cees G. M. SnoekVideo ReasoningVLM Reasoning

  5. SPLIT-RL: Staged Perception-Language Reasoning Training with Claim-Level Advantages

    Oct 7, 2026Raja Kumar, Rajat Koner, Ritwick Chaudhry +3VLM ReasoningRL for VLMs

  6. VICO: Visual Environments Co-Evolving for Vision-Language Model Reasoning

    Oct 7, 2026Meng Lu, Ligeng Zhu, Olivia Xiao +8VLM ReasoningRL for VLMs

  7. System Switch: When Should a Fast Decision Model Stop and Think?

    Oct 7, 2026Gian Luca BailoLLM Decision-MakingSelective Prediction

  8. Mixture of Layers: Dynamic Layer Routing for Visual Reasoning

    Oct 7, 2026Jeonghwan Kim, Sofia Stoica, Jiwan Chung +5VLM ReasoningLarge Vision-Language Models

  9. SpaTime: Streaming Vision-Language Models for Spatio-temporal Reasoning

    Oct 6, 2026Hairong Yin, Huangying Zhan, Shin-Fang Chng +2Vision-Language ModelsSpatiotemporal Reasoning

  10. Selective Transfer of RL Updates for Visual Reasoning

    Oct 6, 2026Suxin Ji, Hungtao Wan, Mingjun Liu +1Reinforcement LearningVLM Reasoning

  11. Event-Driven Proactive Robot Assistance through Vision-Language Reasoning

    Oct 6, 2026Fengkai Liu, Hao Su, Haozhuang Chi +6Human-Robot CollaborationVLM Reasoning

  12. SpatialChain: A Benchmark for Auditing Spatial Reasoning Faithfulness in VLMs

    Oct 5, 2026Rafael Teixeira Sousa, Vinícius Paulo Lopes de Oliveira, Elisa Ayumi Masasi de Oliveira +5VLM EvaluationSpatial Reasoning Benchmarks

  13. Rotated, but How Far? Diagnosing and Improving Object-Rotation Reasoning in VLMs

    Oct 5, 2026Zhaochen Wang, Yujun Cai, Huangbo Zou +4VLM EvaluationObject Pose Estimation

  14. Atomic Visual Entailment: Enhancing Zero-Shot Vision-Language Reasoning through Atomic Fact Decomposition and Learned Selection

    Oct 4, 2026Nallathambi Vethiappan, Derya Soydaner, Gijs WijnholdsZero-Shot LearningVLM Reasoning

  15. Look Where You Say You're Looking: Self-Grounded Attention for Visual Reasoning

    Oct 4, 2026Uri Berger, Gal Chechik, Gal DalalVision-Language GroundingVLM Reasoning

  16. Agentic AI with Structured CoT for Enhancing AI's Spatial Intelligence: Visualization and Reasoning of Rotation

    Oct 3, 2026Uttamasha Monjoree, Wei YanSpatial Reasoning Benchmarks3D Spatial Reasoning

  17. From Reasoning Failures to Composable Video Spatial Intelligence

    Oct 1, 2026Pengzhan Sun, Junbin Xiao, Ramanathan Rajaraman +2Spatial Reasoning BenchmarksVideo Reasoning

  18. Hob-VL: A Benchmark for Visually Grounded Boolean Reasoning

    Oct 1, 2026Yuzhou Wang, Emile Anand, Ijay NarangVLM EvaluationVisual Question Answering

  19. Skeleton-and-Strategy Prompting: Training-Free Negation Understanding for Vision-Language Models

    Oct 1, 2026Yuliang Cai, Mohammad Rostami, Jesse ThomasonVisual Question AnsweringIn-Context Learning

  20. CineMR: Tool-Integrated Vision-Language Reasoning for Quantitative Cardiac MRI Assessment

    Oct 1, 2026Kunyang Li, Hai Nguyen, Joshua Lowe +6Tool Use in VLMsMedical VQA

  21. Two Clocks in Diffusion MLLMs: When Answers Stabilize Before Rationales Unfold

    Oct 1, 2026Keuntae Kim, Yong Suk ChoiVLM EvaluationVisual Question Answering

  22. PhysVista: Benchmarking Physical Intelligence in VLMs via a Perception-Reasoning-Assessment Loop

    Sep 30, 2026Xinge Peng, Yiting Lu, Tianwu Zhi +4VLM EvaluationPhysical Consistency in Video Generation

  23. STARS: From Spatiotemporal Dynamics to Social Representations in Human-Robot Interaction

    Sep 30, 2026Nathan Tsoi, Michael J. Munje, Tejas Oberoi +5VLM EvaluationSocial Robot Navigation

  24. KilometerVision: A New Frontier for Large-Scale Spatial Intelligence in VLMs

    Sep 30, 2026Aravindh Mahendran, Michael King, Matthew Koichi Grimes +12Spatial Reasoning BenchmarksVisual Spatial Reasoning

  25. Uruqi: Learning Spatial Cognition from Visual Experience

    Sep 30, 2026Shichao Li, Meiqi Wang, Fei Su +1Spatial Reasoning BenchmarksVisual Spatial Reasoning

  26. Aligning Thoughts with Answers: Probability Rewards to Tame Thinking Drift

    Sep 30, 2026Pengzhan Sun, Shiu-hong Kao, Shijie Li +4VLM ReasoningRL for VLMs

  27. When Can Text Replace Vision? Structural Bottlenecks in Diagram Reasoning

    Sep 30, 2026Yunbei Zhang, Janet Wang, Jihun Hamm +1Visual ReasoningQuestion Answering