VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

    Jul 21, 2026Zhongyao Yang, Haoyu Li, Yu Yan +3VLMs for Autonomous DrivingCoT Reasoning

  2. ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

    Jul 20, 2026Keuntae Kim, Beomseok Lee, Hyunwoo Kim +1VLM ReasoningDiffusion Language Model Decoding

  3. FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images

    Jul 18, 2026Yi Yang, Xiaokun Zhang, Yuxuan Li +3Remote Sensing Image UnderstandingVision-Language Models

  4. How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

    Jul 17, 2026Navya Gupta, Bingjie Xu, Avinash Anand +2Visual Question AnsweringVLM Interpretability

  5. AI vs Human Expert Reasoning: Assessing Agreements in Building Typology Predictions based on Street View Imagery

    Jul 16, 2026Zahratu Shabrina, Muhammad Asa, Jin Rui +2VLM EvaluationVLM Reasoning

  6. SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning

    Jul 15, 2026Shiyu Yuan, Sourav Sanjukta Bhabesh, Zhe Wang +3Visual ReasoningSynthetic Data Generation

  7. GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

    Jul 15, 2026Kaicong Huang, Weiheng Oh, Ruimin KeZero-Shot LearningVision-Language Grounding

  8. CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

    Jul 14, 2026Lin Peng, Cong Wan, Zeyu Guo +2VLM EvaluationVisual Reasoning

  9. MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku

    Jul 14, 2026Pedro Orvalho, Guillem Alenyà, Felip ManyàVision-Language ModelsVLM Reasoning

  10. DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs

    Jul 14, 2026Rongxin Gao, Yuzhi Huang, Dongxuan Liu +8Spatiotemporal ReasoningVisual Object Tracking

  11. IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

    Jul 14, 2026Jinjian Wu, Jiaqi Tang, Wei Wei +5Tool Use in VLMsVLM Reasoning

  12. AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from Circuit Schematic

    Jul 13, 2026Zhe Xiao, Longfei Li, Xu He +3Electronic Design AutomationVLM Reasoning

  13. SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning

    Jul 13, 2026Mingyuan Wu, Jingcheng Yang, Shengyi Qian +11Vision-Language ModelsMultimodal Reasoning

  14. Mixture of Cognitive Experts in Large Vision-Language Models

    Jul 12, 2026Robert Wijaya, Ngai-Man CheungVision-Language ModelsLarge Vision-Language Models

  15. PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning

    Jul 11, 2026Wenyuan Wang, Lianyu Hu, Hao Wang +1Memory-Augmented VLMsPhysical Reasoning

  16. WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding

    Jul 11, 2026Xianzhi Ma, Shujun Wang, Xiaohan Li +3Remote Sensing Image UnderstandingVision-Language Models

  17. Test-Time Scaling for Small VLMs on Multilingual Visual MCQ

    Jul 10, 2026Spiros Baxevanakis, Peng-Jian YangVisual Question AnsweringTest-Time Scaling for VLMs

  18. OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

    Jul 9, 2026Qian Jiang, Zhecheng Shi, Jingpu Yang +2VLM EvaluationMedical VLMs

  19. HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

    Jul 8, 2026Feng He, Zhenting Wang, Qifan Wang +4VLM EvaluationVLM Hallucination

  20. When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs

    Jul 8, 2026Tanay Sodha, Aditya Sharma, Ramya Hebbalaguppe +2Vision-Language ModelsVLM Adaptation

  21. BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning

    Jul 8, 2026Jiacheng Yang, Tongying Xiao, Yunkai Dang +7Vision-Language ModelsVLM Reasoning

  22. Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

    Jul 7, 2026Han-Jun Ko, Jr-Jen Chen, Haobo Yuan +4Physical ReasoningVLM Reasoning

  23. Progressive Reasoning with Primitive Correction for Compositional Zero-Shot Learning

    Jul 7, 2026Ziyi Chen, Haoyan Shi, Sunhan Xu +1Zero-Shot LearningVLM Reasoning

  24. Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning

    Jul 7, 2026Yake Wei, Yuan Wang, Fengyun Rao +2Vision-Language GroundingVLM Reasoning

  25. DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation

    Jul 6, 2026Ruizhe Zeng, Siyu Cao, Lu Zhang +1Text-Guided Image SegmentationVLM Reasoning

  26. RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

    Jul 6, 2026Shuangyu Xie, Kaiyuan Chen, Ziyang Chen +8VLM EvaluationEmbodied QA

  27. CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

    Jul 5, 2026Zhaohong Liu, Hao Ye, Xianlin Zhang +1VLMs for Autonomous DrivingEfficient VLM Inference

  28. ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

    Jul 3, 2026Peiming Li, Yifan Wang, Xiaotian Zhang +4Multimodal Large Language ModelsLatent Visual Reasoning