VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures

    Sep 1, 2026Can Polat, Mustafa Kurban, Erchin Serpedin +1VLM EvaluationVLM Reasoning

  2. Teaching Vision-Language Models to Use the Scale They Are Given: Label-Free Equivariance Training for Metric Physical Reasoning

    Sep 1, 2026Kaizhen Tan, Yang Feng, Heqing Du +3Physical ReasoningVLM Adaptation

  3. OCR-MetaReasoning Benchmark: Evaluating the Meta-Reasoning Ability of MLLMs in Text-Rich Image Understanding

    Aug 31, 2026Gengxu Li, Yuan Wu, Yi ChangVisual ReasoningMultimodal Reasoning

  4. LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning

    Aug 13, 2026Yupan Ding, Jing Xiao, Zhenyuan Zhang +4Remote Sensing Image UnderstandingRemote Sensing VQA

  5. UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations

    Aug 13, 2026Peng Li, Qianqian Xu, Shilong Bao +2Pedestrian Intention PredictionIntelligent Transportation Systems

  6. Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

    Aug 12, 2026Vladyslava Rudas, Dmytro KuzmenkoVLM EvaluationRobot Safety

  7. SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

    Aug 12, 2026Zile Zhou, Huining Yuan, Weichen Zhang +2Visual Spatial ReasoningProcess Reward Models

  8. JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

    Aug 12, 2026Ran Li, Huiguo He, Jiahuan Cao +3VLM EvaluationVLM Reasoning

  9. Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

    Aug 12, 2026Xikai Sun, Kebin Liu, Haotian Wang +3Video ReasoningVLM Reasoning

  10. CARE: Confidence-Aware Reasoning for Reliable Medical VQA

    Aug 11, 2026Yuetian Du, Yucheng Wang, Zhenyuan Chen +9Medical VQAMedical VLMs

  11. Where To Look? : Causal Tracing of Vision Encoders in VLM

    Aug 11, 2026Naren Kumar S, Tirth Bhatt, Mayank SinghLarge Vision-Language ModelsVLM Interpretability

  12. Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

    Aug 10, 2026Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian +4Geometric Representation LearningVision-Language Grounding

  13. MedPixel: A Unified Pixel-Language Model for Medical Reasoning and Segmentation

    Aug 10, 2026Haoyu Yang, Meixing Shi, Zengjie Chen +5Medical VLMsVLM Reasoning

  14. Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

    Aug 10, 2026Jiahao Shao, Yuanbo Yang, Yiyi Liao +3Tool Use in VLMsEfficient VLM Inference

  15. Verifiably grounded machine interpretation of lunar geology

    Aug 10, 2026Tom Sander, Kay Wohlfarth, Christian WöhlerVLM Reasoning

  16. BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

    Aug 7, 2026Saim Rehman, Muhammad ShafiqueVLM EvaluationVLM Robustness

  17. Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

    Aug 7, 2026Chen Ling, Hanqian Li, Dongnan Liu +9Cross-Modal LearningVisual Reasoning

  18. Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding

    Aug 6, 2026Ming Wang, Yuqing Zhang, Tingna Xie +5Creativity AssessmentMultimodal Large Language Models

  19. ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge Graph Completion

    Aug 6, 2026Jiafan Li, Mengxue Yang, Jiaqi Zhu +3VLM ReasoningMultimodal KGs

  20. OPD-V: Visual On-Policy Self-Distillation with Modality Balance

    Aug 5, 2026Aniri, Jinhe Bi, Peng Liao +5Modality ImbalanceOn-Policy Self-Distillation

  21. ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

    Aug 5, 2026Lei Peng, Shuai Lv, Wei HuVLM ReasoningVisually Grounded Reasoning

  22. TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

    Aug 4, 2026Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman +4Efficient VLM InferenceClustering

  23. SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification

    Aug 4, 2026Feixiang Liu, Likun Wang, Qiang Qiu +3Visual Spatial ReasoningVision-Language Grounding

  24. Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

    Aug 4, 2026Haoqian Kang, Liupeng Li, Kuofeng Gao +5Efficient Multimodal InferenceMultimodal Large Language Models

  25. DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning

    Aug 4, 2026Le Xiang, Zhicheng Guan, Hong Chen +5Visual Question AnsweringMultimodal Large Language Models

  26. Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

    Aug 4, 2026Tianbao Jiang, Weicong Ni, Gerard de Melo +1Large Vision-Language ModelsVLM Reasoning

  27. MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

    Aug 3, 2026Ambarish Govindarajulu Kaliamurthi, Kaikai LiuVLMs for Autonomous DrivingEfficient VLM Inference

  28. Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

    Aug 3, 2026Wenxiao Fan, Jingling Fu, Fang Li +9Vision-Language ModelsVLM Reasoning

  29. SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

    Aug 3, 2026Jing Wu, Jianhua Wu, Jiayi Guan +5Vision-Language ModelsVisual Spatial Reasoning