VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

    May 26, 2026Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell +1VLM EvaluationData Visualization

  2. InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward

    May 26, 2026Zhiwei Ning, Wenwen Tong, Xiangli Kong +12Multimodal ReasoningVLM Reasoning

  3. OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following

    May 26, 2026Qiaomu Miao, Haoyu Wu, Jingyi Xu +2Gaze EstimationVision-Language Grounding

  4. From Data to Insights: Exploring Program-of-Thoughts Prompting for Chart Summarization

    May 25, 2026Yutong Qu, Wei ZhangData VisualizationVLM Reasoning

  5. Extending Embodied Question Answering from Perception to Decision

    May 25, 2026Xicheng Gong, Qiwei Li, Peiran Xu +1Embodied QAVLM Reasoning

  6. Beyond Appearance: Can Multimodal Large Language Models Exploit Vertical Structure for Remote Sensing Natural Scene Understanding?

    May 25, 2026Jing Huang, Duanchu Wang, Junjie Yang +5VLM EvaluationRemote Sensing Image Understanding

  7. ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

    May 25, 2026Jiangyang Li, Cong Wan, Changjie Wu +8Visual Spatial ReasoningVLM Reasoning

  8. Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

    May 25, 2026Longteng Guo, Yifan Wang, Pengkang Huo +4Visual ReasoningVLM Reasoning

  9. DUEL: Adversarial Self-Play for Multimodal Reasoning

    May 24, 2026Lin Qiu, Hanqing Zeng, Yao Liu +3VLM RobustnessVLM Reasoning

  10. IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring

    May 23, 2026Xinge Peng, Yiting Lu, Xin Li +1VLM ReasoningImage Quality Assessment

  11. Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs

    May 23, 2026Wen Ma, Fucheng Niu, Zhiting Fan +3Adversarial Attacks on VLMsHealthcare

  12. D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving

    May 22, 2026Kevin Richard, Alphin Varghese, Colin Pham +2VLMs for Autonomous DrivingCross-Modal Alignment

  13. DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving

    May 22, 2026Hao Vo, Khoa Vo, Phu Loc Nguyen +10VLM EvaluationAutonomous Driving Datasets

  14. CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection

    May 22, 2026Hyeongmuk Lim, Youngbum HurInterpretable Anomaly DetectionVLM Reasoning

  15. AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation

    May 21, 2026Wenxuan Guo, Xiuwei Xu, Yichen Liu +7Vision-Language NavigationVLM Reasoning

  16. GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning

    May 21, 2026Deshui Miao, Xingsen Huang, Yameng Gu +3Visual Spatial ReasoningSpatiotemporal Reasoning

  17. Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow

    May 21, 2026Chengsheng Zhang, Chenghao Sun, Zhining Xie +1VLM HallucinationVLM Interpretability

  18. Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding

    May 21, 2026Zelin Zheng, Xinyan Liu, Ruixin Li +4Temporal Video GroundingVideo-Language Models

  19. Visual-Advantage On-Policy Distillation for Vision-Language Models

    May 21, 2026Ruiqi Liu, Xiaolei Lv, Gengsheng Li +8Vision-Language ModelsVLM Distillation

  20. SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals

    May 21, 2026Zihang Lin, Huaiyuan Qin, Muli Yang +1VLM EvaluationVision-Language Models

  21. Ablate-to-Validate: Are Vision-Language Models Really Using Continuous Thought Tokens?

    May 20, 2026Tianyi Zhang, Mahtab Bigverdi, Ranjay KrishnaVLM EvaluationVLM Interpretability

  22. Lost in Fog: Sensor Perturbations Expose Reasoning Fragility in Driving VLAs

    May 20, 2026Abhinaw Priyadershi, Jelena FrtunikjVLM RobustnessVLMs for Autonomous Driving

  23. VersusQ: Pairwise Margin Reasoning for Generalizable Video Quality Assessment

    May 20, 2026Shibei Meng, Binxin Yang, Yuan Liu +4Pairwise ComparisonLearning to Rank

  24. Bridging Structure and Language: Graph-Based Visual Reasoning for Autonomous Road Understanding

    May 20, 2026Lena Wild, Katie Z Luo, Marco PavoneVisual ReasoningAutonomous Driving

  25. RISE: Reliable Improvement in Self-Evolving Vision-Language Models

    May 20, 2026Chaoran Xu, Yingmao Miao, Pengfei Zhang +3Vision-Language ModelsVLM Adaptation

  26. ΔΔynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos

    May 20, 2026Chia-Hsiang Kao, Cong Phuoc Huynh, Chien-Yi Wang +5VLM ReasoningPhysical Reasoning in Video

  27. From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models

    May 19, 2026Juncheng Wu, Hardy Chen, Haoqin Tu +6Vision-Language ModelsVLM Reasoning