VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. Symbolic and Abstractive Reasoning with Complex Visual Queries

    Jun 8, 2026Yichi Zhang, Jingdian Lu, Zhuo Chen +4Visual ReasoningSynthetic Data Generation

  2. ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China

    Jun 8, 2026Yi Zhang, Bolei Ma, Yong Cao +3VLM EvaluationVisual Question Answering

  3. AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models

    Jun 8, 2026Shouwei Ruan, Bin Wang, Zhenyu Wu +5VLM ReasoningMultimodal Foundation Models

  4. Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?

    Jun 8, 2026Yizheng Sun, Mochuan Zhan, Yanan Ma +10VLM EvaluationVLM Robustness

  5. Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation

    Jun 7, 2026Yishuo Cai, Jiahui Liu, Yuanxin Liu +9Tool Use in VLMsEfficient VLM Inference

  6. PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping

    Jun 7, 2026Qiming Li, Tianlun Li, Xiaolong Cheng +5Token-Level Credit AssignmentVLM Reasoning

  7. TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

    Jun 7, 2026Lianyu Hu, Xiaoyu Ma, Zeqin Liao +1Multimodal Large Language ModelsMultimodal Reasoning

  8. DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning

    Jun 6, 2026Hangui Lin, Yan Shu, Zhengyang Liang +8Cross-Modal AlignmentVLM Reasoning

  9. The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

    Jun 5, 2026Lujun Li, Lama Sleem, Niccolo Gentile +4VLM EvaluationLarge Vision-Language Models

  10. VeriDrive: Verifiable Counterfactual Supervision for Cost-Efficient Vision-Language Planning

    Jun 5, 2026Zikai Zhang, Hubert P. H. Shum, Toby P. BreckonAutonomous Driving DatasetsVLMs for Autonomous Driving

  11. Textual Supervision Enhances Geospatial Representations in Vision-Language Models

    Jun 5, 2026Marcelo Sartori Locatelli, Fernando Tonucci, Jea Kwon +5Vision-Language ModelsGeospatial Representation Learning

  12. Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation

    Jun 5, 2026Xiangyi Zheng, Xiangyu Wang, Qinan Liao +6UAV NavigationVision-Language Navigation

  13. Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators

    Jun 4, 2026Chenming Zhu, Jingli Lin, Yilin Long +4Visual Spatial ReasoningWorld Model Learning

  14. HyperVis: Continuous Latent Visual Relational Graphs on the Lorentz Hyperboloid for Compositional Reasoning

    Jun 4, 2026Moshiur Farazi, Sameera Ramasinghe, Mahbub Ahmed Turza +1Visual ReasoningVLM Reasoning

  15. Global-Local Monte Carlo Tree Search in Vision-Language Models for Text-to-3D Indoor Scene Generation

    Jun 4, 2026Mengshi Qi, Wei Deng, Xianlin Zhang +1Monte Carlo Tree SearchVLM Reasoning

  16. Causal Scaffolding for Physical Reasoning: A Benchmark for Causally-Informed Physical World Understanding in VLMs

    Jun 4, 2026Tianyi Tang, Zhuoyi Lin, Zeyu Feng +4VLM EvaluationVLM Reasoning

  17. Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents

    Jun 4, 2026XiuYu Zhang, Junfeng Fang, Zhenkai LiangVLM EvaluationLatent Visual Reasoning

  18. VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning

    Jun 4, 2026Shufan Zhang, Ziyue Lin, Bairun Wang +4Video ReasoningVLM Reasoning

  19. Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models

    Jun 4, 2026Haoyu Zhou, Qing Qing, Caichong Li +6VLM EvaluationVision-Language Models

  20. Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models

    Jun 4, 2026Mohammad Mahdi Abootorabi, Omid Ghahroodi, Anas Madkoor +4VLM EvaluationMultilingual VLM Evaluation

  21. Food-R1: A Unified Multi-Task Food Vision-Language Model with Reinforcement Learning

    Jun 3, 2026Yu Zhu, Yongkang Li, Wenjie Zhu +5Vision-Language ModelsVLM Reasoning

  22. Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

    Jun 2, 2026Mahtab Bigverdi, Linjie Li, Weikai Huang +8Visual Spatial ReasoningVisual Reasoning

  23. Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection

    Jun 2, 2026Senjie Jin, Peixin Wang, Boyang Liu +8Token-Level Credit AssignmentVisual Reasoning

  24. TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics

    Jun 2, 2026Chao Wen, Jacqueline Staub, Adish SinglaVLM EvaluationLLM-Based Program Synthesis

  25. Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding

    Jun 2, 2026Zhengyi Zhao, Shubo Zhang, Zezhong Wang +6Multimodal Disentangled Representation LearningRepresentation Disentanglement

  26. World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

    Jun 2, 2026Yucheng Zhou, Wei Tao, Yiwen Guo +1On-Policy Self-DistillationWorld Models