VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs

    May 12, 2026Shuo Ni, Tong Wang, Jing Zhang +5VLM EvaluationRemote Sensing Image Understanding

  2. Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model

    May 12, 2026Chenfeng Wang, Wei He, Xuhan Zhu +10Visual ReasoningLatent Visual Reasoning

  3. Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training

    May 12, 2026Qihuang Zhong, Liang Ding, Wenjie Xuan +3Multimodal Large Language ModelsMultimodal Reasoning

  4. UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs

    May 12, 2026Houcheng Jiang, Jiajun Fu, Junfeng Fang +4Efficient Multimodal InferenceMultimodal Large Language Models

  5. Allegory of the Cave: Measurement-Grounded Vision-Language Learning

    May 12, 2026Kepeng Xu, Li Xu, Gang He +1Large Vision-Language ModelsVision-Language Grounding

  6. SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images

    May 12, 2026Zishan Liu, Ruoxi Zang, Yanglin Zhang +5Visual Spatial Reasoning3D Spatial Reasoning

  7. Instruct-ICL: Instruction-Guided In-Context Learning for Post-Disaster Damage Assessment

    May 12, 2026Armin Zarbaft, Ehsan Karimi, Nhut Le +1Disaster Damage AssessmentLLM Prompting

  8. Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?

    May 11, 2026Maximilian Triebel, Marco Menner, Dominik HelfensteinVLM EvaluationPhysical Reasoning

  9. C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving

    May 11, 2026Kefei Tian, Yuansheng Lian, Kai Yang +2VLM RobustnessCounterfactual Evaluation of VLMs

  10. DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving

    May 11, 2026Lingjun Zhang, Changjie Wu, Linzhe Shi +6World Model LearningEnd-to-End Autonomous Driving

  11. AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation

    May 11, 2026Xi Jiang, Yinjie Zhao, Zesheng Yang +1Tool-Using Vision-Language AgentsVLM Reasoning

  12. V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

    May 11, 2026Zhiwei Ning, Xuanang Gao, Jiaxi Cao +6Large Vision-Language ModelsMultimodal Reasoning

  13. ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

    May 11, 2026Tingshu Mou, Jiabo He, Renying Wang +5Visual Spatial Reasoning3D Spatial Reasoning

  14. Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models

    May 11, 2026Minh Khoi Nguyen, Dai Lam Le, Amir Reza Jafari +8HealthcareHallucination Detection

  15. The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

    May 11, 2026Hao Liu, Jicheng LiuVLM EvaluationVision-Language Grounding

  16. Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

    May 10, 2026Xuan Gong, Hanbo Huang, Hao Zheng +4Vision-Language ModelsVision-Language Grounding

  17. GeoSym127K: Scalable Symbolically-verifiable Synthesis for Multimodal Geometric Reasoning

    May 10, 2026Jinhao Jing, Zheng Ma, Jinwei Liang +9Mathematical Reasoning BenchmarksSynthetic Data Generation

  18. SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs

    May 10, 2026Bo Gu, Zhikang Zhang, Zizhuang Wei +33D Spatial ReasoningVLM Reasoning

  19. Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning

    May 10, 2026Lin Li, Jiawei Huang, Qihao Quan +7Multivariate Time Series ClassificationTime Series Classification

  20. LiteMedCoT-VL: Parameter-Efficient Adaptation for Medical Visual Question Answering

    May 10, 2026Runze Ma, Shunbo Jia, Haonan Lyu +2CoT DistillationHealthcare

  21. Reinforcing Multimodal Reasoning Against Visual Degradation

    May 10, 2026Rui Liu, Dian Yu, Haolin Liu +6VLM RobustnessImage Corruption Robustness

  22. CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization

    May 9, 2026Ziyang Ding, Linjian Meng, Yiming Wu +3Visual ReasoningLatent Visual Reasoning

  23. CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

    May 9, 2026Joowon Kim, Seungho Shin, Joonhyung Park +1Video GenerationVideo Reasoning

  24. EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics

    May 9, 2026Van-Loc Nguyen, AprilPyone MaungMaung, Minh-Triet Tran +1Image Forgery DetectionDigital Image Forensics

  25. ZAYA1-VL-8B Technical Report

    May 8, 2026Hassan Shapourian, Kasra Hejazi, Olabode M. Sule +1Vision-Language ModelsMixture-of-Experts Language Models