VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

    Aug 3, 2026Zixuan Huang, Yang Zhou, Kaixuan Wang +7VLM ReasoningReinforcement Learning with Verifiable Rewards

  2. SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models

    Aug 3, 2026Hai Nguyen, Tung Vu, Cong TranSpatial Reasoning Benchmarks3D Spatial Reasoning

  3. Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

    Aug 2, 2026Jianmin Chen, Jiaqi Tang, Wei Wei +9Vision-Language ModelsLong-Context Modeling

  4. It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

    Aug 2, 2026Puzhuo Zheng, Hasan KurbanVLM EvaluationSelf-Consistency Decoding

  5. Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks

    Jul 31, 2026Rupak Sarkar, Neha Srikanth, Saloni Gupta +3VLM EvaluationVision-Language Models

  6. Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving

    Jul 31, 2026Zeyu Dong, Yimin Zhu, Yu Wu +1VLMs for Autonomous DrivingEnd-to-End Autonomous Driving

  7. Can Vision-Language Models Reason about AI Edits in Images?

    Jul 30, 2026Darsha Udayanga, Pin-Yu Chen, Payel Das +1Image Forgery DetectionImage Forgery Localization

  8. FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Self-Verification

    Jul 30, 2026Haoqing Wang, Xingrun Xing, Ziheng Li +2Tool Use in VLMsVLM Reasoning

  9. MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes

    Jul 30, 2026Weihang Wang, Kainan Tu, Jielei Zhang +9VLM EvaluationVision-Language Models

  10. Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

    Jul 30, 2026Liangjie Zhao, Jiaqing Lyu, Kexin Tang +5VLM EvaluationVisual Reasoning

  11. JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

    Jul 30, 2026Shawn Li, Wei Yang, Jike Zhong +11VLM EvaluationSpatial Reasoning Benchmarks

  12. Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models

    Jul 29, 2026Supratik Bhowal, Subhrajyoti Basu, Aritra Gir Mahanta +1Medical VQAMedical VLMs

  13. Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

    Jul 27, 2026Yueru Luo, Xu Yan, Changqing Zhou +5Autonomous DrivingVLM Reasoning

  14. MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

    Jul 27, 2026Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu +2Visual Question AnsweringVideo Understanding

  15. PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis

    Jul 26, 2026Chi Phan, Tianyi Zhang, Yufeng Wu +7Computational PathologyMedical VQA

  16. What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features

    Jul 25, 2026Chen-Yi Lu, Yueh-Shao Chen, Somali ChaterjiVision-Language ModelsVLM Adaptation

  17. Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation

    Jul 25, 2026Shuai Wang, Daoan Zhang, Zhe Tang +2VLM AdaptationOn-Policy Self-Distillation

  18. Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models

    Jul 25, 2026Sultan Alshehri, Zhantao Yang, Han Zhang +1Vision-Language ModelsVLM Reasoning

  19. EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

    Jul 24, 2026Hao Yang, Jin Wang, Xuejie ZhangContent ModerationVLM Reasoning

  20. Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints

    Jul 23, 2026Liqiang Jing, Xiong Zhou, Siddharth Varia +3VLM EvaluationVisual Reasoning

  21. MIRROR: Learning from the Other View for Multi-Modal Reasoning

    Jul 23, 2026Wen Ye, Yuxiao Qu, Aviral Kumar +1Cross-Modal Knowledge DistillationMultimodal Reasoning

  22. Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

    Jul 22, 2026Md Tanvirul AlamSynthetic Data GenerationVLM Reasoning

  23. ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

    Jul 21, 2026Yuan Wang, Yongchao Du, Mengting Chen +4Image GenerationRL for Image Generation

  24. No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

    Jul 21, 2026Feinan Cheng, Dongliang Xu, Wenli Nong +4Vision-Language ModelsUAV Navigation