VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

    Jan 25, 2026Zhuohong Chen, Zhengxian Wu, Zirui Liao +6Multimodal RAGVisual Question Answering

  2. AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

    Jan 20, 2026Aahana Basappa, Pranay Goel, Anusri Karra +3Reasoning EvaluationMultimodal Large Language Models

  3. CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

    Jan 12, 2026Chaoyu Li, Fei Tao, Pooyan FazliTest-Time Scaling for VLMsTest-Time Scaling

  4. VLM-CAD: VLM-Optimized Collaborative Agent Design Workflow for Analog Circuit Sizing

    Jan 12, 2026Guanyuan Pan, Shuai Wang, Yugui Lin +4Bayesian OptimizationElectronic Design Automation

  5. Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning

    Jan 6, 2026Guoqiang Liang, Jianyi Wang, Zhonghua Wu +2VLM RobustnessVLM Reasoning

  6. MUSON: A Reasoning-oriented Multimodal Dataset for Socially Compliant Navigation in Urban Environments

    Dec 28, 2025Zhuonan Liu, Xinyu Zhang, Zishuo Wang +8VLM EvaluationSocial Robot Navigation

  7. RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing

    Dec 18, 2025Tianyuan Qu, Lei Ke, Xiaohang Zhan +6Text-Guided Image EditingVLM Reasoning

  8. CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates

    Dec 11, 2025Shresth Grover, Priyank Pathak, Akash Kumar +1VLM ReasoningVisually Grounded Reasoning

  9. See, Think, Learn: A Self-Taught Multimodal Reasoner

    Dec 2, 2025Sourabh Sharma, Sonam Gupta, SadbhawnaSelf-TrainingVLM Reasoning

  10. Understanding the Effects of Distractors on Reasoning Vision-Language Models

    Nov 26, 2025Jiyun Bae, Hyunjong Ok, Sangwoo Mo +1VLM EvaluationVisual Question Answering

  11. Vision-Language Memory for Spatial Reasoning

    Nov 25, 2025Zuntao Liu, Yi Du, Taimeng Fu +3Memory-Augmented VLMsVision-Language Models

  12. MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images

    Nov 24, 2025Qirui Wang, Jingyi He, Yining Pan +3Spatial Reasoning BenchmarksVisual Spatial Reasoning

  13. Thinking Ahead: Foresight Intelligence in MLLMs and World Model

    Nov 24, 2025Zhantao Gong, Liaoyuan Fan, Qing Guo +3VLM EvaluationVLM Adaptation

  14. Contrastive vision-language learning with paraphrasing and negation

    Nov 20, 2025Kwun Ho Ngan, Saman Sadeghi Afgeh, Joe Townsend +1VLM RobustnessVLM Reasoning

  15. Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models

    Nov 18, 2025Zehao Liu, Weijieying Ren, Jipeng Zhang +4VLM RobustnessMedical Diagnosis

  16. Critical or Compliant? The Double-Edged Sword of Reasoning in Chain-of-Thought Explanations

    Nov 15, 2025Eunkyu Park, Wesley Hanwen Deng, Vasudha Varadarajan +4VLM ReasoningMultimodal CoT Reasoning

  17. From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

    Nov 14, 2025Yu Zhao, Ying Zhang, Xuhui Sui +4Visual Question AnsweringCoT Distillation

  18. AERMANI-VLM: Structured Prompting and Reasoning for Aerial Manipulation with Vision Language Models

    Nov 3, 2025Sarthak Mishra, Rishabh Dev Yadav, Avirup Das +3Aerial RoboticsStructured Prompting

  19. Explain Before You Answer: A Survey on Compositional Visual Reasoning

    Aug 24, 2025Fucai Ke, Joy Hsu, Zhixi Cai +10Compositional ReasoningVisual Reasoning

  20. Mitigating Cross-Image Information Leakage in Multi-Image Understanding with Large Vision-Language Models

    Aug 19, 2025Yeji Park, Minyoung Lee, Sanghyuk Chun +1Large Vision-Language ModelsVLM Reasoning

  21. TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding

    Aug 11, 2025Chaohong Guo, Xun Mo, Yongwei Nie +3Temporal Video GroundingVision-Language Models

  22. Position: Reasoning After Perception Means Reasoning Without Vision

    Jul 21, 2025Hongcheng Gao, Zihao Huang, Jingyi Tang +12Visual ReasoningVLM Reasoning

  23. What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning

    Jun 1, 2025Zhaotian Weng, Haoxuan Li, Xin Eric Wang +2VLM EvaluationVLM Reasoning

  24. REVEAL: Robust Evolution of Vision-Language Models for Explainable AI-Video Detection

    Feb 20, 2025Yun-Yun Tsai, Qingyuan Liu, Ruijian Zha +4Tool Use in VLMsVision-Language Models

  25. ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models

    Feb 13, 2025Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma +31Visual ReasoningVLM Reasoning

  26. Do Vision-Language Models Understand Visual Persuasiveness? A Diagnosis via Visual Persuasive Factors

    Date pendingGyuwon Park, Hyounghun KimVLM EvaluationVLM Reasoning

  27. Learning to Think Like a Cartoon Captionist: Incongruity-Resolution Supervision for Multimodal Humor Understanding

    Date pendingHatice Merve Vural, Doga Kukul, Ege Erdem Ozlu +4VLM ReasoningMultimodal CoT Reasoning