VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. Soft Spatial Reasoning

    Sep 30, 2026Rafi Ibn Sultan, Md. Sajid Alam Chowdhury, Saleh Zare Zade +4Visual Spatial ReasoningVLM Reasoning

  2. LoopVL: Recurrent Visual Intelligence

    Sep 29, 2026Zhe Qian, Ziyang Gong, Zhongxing Xu +9Vision-Language ModelsLarge Vision-Language Models

  3. Composition, Not Conversation: VLMs Lose the Scene, Not the Thread

    Sep 29, 2026L. D. M. S. Sai Teja, Ufaq Khan, N. Siva Gopala Krishna +5VLM EvaluationVisual Question Answering

  4. NeuronEye: Query-Guided Visual Concept Activation for Vision-Language Reasoning

    Sep 29, 2026Ruiyu Yan, Bowen Chen, Shaowen Wan +1VLM InterpretabilityVLM Reasoning

  5. Spatial-OPSD: Self-Improving Spatial Reasoning via Label-Free Self-Distillation

    Sep 29, 2026Zhenyu Liu, Zhangquan Chen, Keyi Chen +4Visual Spatial Reasoning3D Spatial Reasoning

  6. DSPO: Diversity-aware Subjective Policy Optimization for Robust Emotional Reasoning

    Sep 29, 2026Cheng Ye, Weidong Chen, Bingyan Xu +1VLM RobustnessMultimodal Reasoning

  7. FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution

    Sep 29, 2026FangZhi Zhong, Xuerui Qiu, Yuqi Pan +4Efficient VLM InferenceVLM Reasoning

  8. LeRF: Learning Reference Coordinate Frames for Perspective Taking Reasoning

    Sep 28, 2026Bang Xiao, Wenqi Jia, Ozgur Kara +5Visual Spatial ReasoningVisual Reasoning

  9. ReVA: A Scene-Centric Dataset Beyond Repetition for Remote Sensing Video Question Answering

    Sep 28, 2026Zhen Yao, Likai Wang, Yuming Yang +9Remote Sensing VQAVideo QA

  10. Token-Disentangled Latent Test-Time Scaling for Vision-Language Reasoning

    Sep 28, 2026Hao-Xuan Ma, Yihao Liu, Yutao Sun +8Test-Time Scaling for VLMsTest-Time Scaling

  11. ReSight-SMC: Two-Stage Power Sampling via Island SMC with Visual Scouts

    Sep 28, 2026Yaowen Zhang, Xiangyu Qiu, Junyi Hu +5Markov Chain Monte CarloLarge Vision-Language Models

  12. WM-VLM: Probing Internal World Models for Interleaved Visual-Textual Reasoning

    Sep 28, 2026Yuheng Zha, Yilei Wang, Qiyue Gao +5World Model Learning3D Spatial Reasoning

  13. From Perception to Integration: Revisiting the Internal Dynamics of Reasoning in Vision-Language Models

    Sep 28, 2026Rong Yu Xu, Prayag Tiwari, Shaolei ZhangEfficient VLM InferenceVLM Interpretability

  14. Distilling Visual Reasoning into Text Space

    Sep 28, 2026Wenhan Yang, Nilay Naharas, Ali Payani +1CoT DistillationVLM Distillation

  15. Geometric Encoding for Spatial Reasoning in Vision-Language Models

    Sep 28, 2026Antonio Jun, Haoshui Yu, Zhengyi Lu +2Visual Spatial ReasoningVLM Reasoning

  16. Beyond Retrieval Relevance: Scene-Grounded Risk Entailment for Vision-Language Driving

    Sep 28, 2026Jiaxin Liu, Ruilin Yu, Liang Peng +8VLMs for Autonomous DrivingAutonomous Driving

  17. SpatialSkill: Self-Evolving Skills for Cross-View Spatial Reasoning

    Sep 28, 2026Ruifan Zuo, Guocheng Hu, Wanshui Gan +3Visual Spatial ReasoningVLM Reasoning

  18. SCOPD: Sparse-Context On-Policy Self-Distillation for Efficient Vision-Language Models

    Sep 28, 2026Ahmadreza Jeddi, Enming Zhang, Jasper Gerigk +12Efficient VLM InferenceOn-Policy Self-Distillation

  19. BIRD: Distilling Decision Boundaries into Rationales for MLLM Adaptation

    Sep 27, 2026Anglin Liu, Yanlin Wu, Ruichao Chen +6VLM AdaptationVLM Reasoning

  20. Seeing and Solving Are Not Enough for Vision-Language Models

    Sep 27, 2026Ziheng Wang, Mingxuan Xie, Yilin Liu +3VLM EvaluationVisual Question Answering

  21. SpatialSpeak: QA-Native Reconstruction with Local and Global Context for Spatial Chain-of-Thought Reasoning

    Sep 27, 2026Yang Cao, Jiaxin Zhang, Dave Zhenyu Chen +4Visual Spatial Reasoning3D Spatial Reasoning

  22. SphMind: Towards Robust, Training-Free VLM-based Spatial Reasoning with a 360 Camera

    Sep 27, 2026Shriram Damodaran, Soumyaratna Debnath, Cheston Tan +1Test-Time Adaptation of VLMs3D Spatial Reasoning

  23. CCRV-Bench: Constraint-Based Evaluation of Causal Reasoning in Vision-Language Models

    Sep 25, 2026Linyuan Gao, Yuan Wu, Yi ChangVLM EvaluationVLM Reasoning

  24. Multimodal Thinking with Renderable Programs

    Sep 24, 2026Sunli Chen, Ding Zhong, Ziqiao Ma +6Multimodal ReasoningVLM Reasoning

  25. Looks the Same, Answers Differently: Flip-Direction Steering for Robust Vision-Language Reasoning

    Sep 23, 2026Yeonsung Jung, Joonhyun Jeong, Hoang Pham +4VLM RobustnessCounterfactual Evaluation of VLMs