VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. AnchorReasoning: A Visual Grounding and Causal Reasoning Dataset in Long-Tail Autonomous Driving Scenarios

    Sep 23, 2026Zhipeng Bao, Wenjie Zhao, Tianle Zhu +4Autonomous Driving DatasetsAutonomous Driving

  2. NV-Reason-CT: 3D Visual Language Model for CT Analysis

    Sep 23, 2026Andriy Myronenko, Dong Yang, Yucheng Tang +13Radiology Report GenerationRadiology VLMs

  3. Hierarchical Floorplan-Guided Vision-Language Exploration for Embodied Question Answering

    Sep 22, 2026Albert Gassol Puigjaner, Kostas AlexisEmbodied NavigationEmbodied QA

  4. X-Planner: Event-Structured Task Planning for Embodied Intelligence

    Sep 21, 2026Howard Lu, Shalfun Li, Porter Pan +30Robot Task PlanningVLM Reasoning

  5. INTCORT: Training-Free Spatial Reasoning Enhancement for Vision-Language Models via Input Transformations and Confidence Routing

    Sep 21, 2026Haoran Sun, Jingqi Xu, Yanhui Li +3Visual Spatial ReasoningVLM Reasoning

  6. Look Where It Counts: A Free, Label-Free Visual Evidence Signal for Fine-Grained Vision-Language Reasoning

    Sep 21, 2026Santi Ram Tiwari, Nihal Naik, Devbrat Pandey +1Vision-Language GroundingVLM Reasoning

  7. Pay More Attention To Text In High-Resolution MLLMs

    Sep 20, 2026Zhongkuan Mao, Wenzhuo Zhao, Xianjie Liu +7Visual Question AnsweringVision-Language Grounding

  8. Uni-LaDiR: Latent Diffusion Unifies Multimodal Reasoning

    Sep 17, 2026Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang +3Unified Multimodal ModelsMultimodal Reasoning

  9. The Mirage of Calibrated Confidence: Trajectory-Independence of Verbalized Confidence in Vision-Language Models

    Sep 16, 2026Jisoo Yang, Jaeho Han, Trung X. Pham +1VLM EvaluationConfidence Estimation in Language Models

  10. Reasoning with Image Generation

    Sep 14, 2026Nishad Singhi, Hector Garcia Rodriguez, Aditya Arora +2Tool Use in VLMsVLM Reasoning

  11. Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning

    Sep 14, 2026Mantek Singh, Jeshwanth Challagundla, Siddharth Raina +1CoT DistillationVLM Distillation

  12. From Model Patterns to Abstract Semantics in Compositional Zero-Shot Learning

    Sep 14, 2026Weize Li, Zhicheng Zhao, Fei SuZero-Shot LearningVLM Reasoning

  13. C2^2Nav: Compare Before You Commit for Zero-Shot Vision-and-Language Navigation

    Sep 14, 2026Runtian Zheng, Congpeng Zhang, Ying LiuVision-Language NavigationVLM Reasoning

  14. ChitraMiti: Benchmarking Visual Grounding and Modality Reliance in Bengali Geometric Reasoning

    Sep 14, 2026Khan Raiyan Ibne Reza, Sanjana Aktar Maria, Sumaiya Tabassum Nimi +1Mathematical Reasoning BenchmarksMultilingual VLM Evaluation

  15. Func-R1: Incentivizing Mathematical Function Reasoning in Multimodal Large Language Models

    Sep 13, 2026Mingze Yin, Xiaohan Wang, Dian Li +8Multimodal Large Language ModelsMathematical Reasoning

  16. From Visual Feedback to Textual Reviews: A Multi-Agent Vision-Language Framework for Image-Grounded Review Assistance

    Sep 13, 2026Utsav Kumar Nareti, Ayush Bansal, Kumari Priya +4Grounded Text GenerationVLM Reasoning

  17. New Evidence, Same Choice: Testing Physical Experiment Selection in Vision Language Models

    Sep 12, 2026Sourajit Saha, Shubhashis Roy Dipta, Nobin Sarwar +4VLM EvaluationVLM Reasoning

  18. From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models

    Sep 12, 2026Meng Luo, Yicheng Liu, Jiahao Wang +5Video GenerationVLM Reasoning

  19. Routing by Reasoning Need: Trajectory-Aware Decoding Control for Diffusion Vision-Language Models

    Sep 12, 2026Yixiang Liu, Zhongxing Xu, Zhonghua Wang +1Diffusion Language Model InferenceVLM Reasoning

  20. MindTopo: Can Foundation Models Reason in Topological Space?

    Sep 12, 2026Yunfei Ge, Anbang Liu, Qineng Wang +9Spatial Reasoning BenchmarksAI Agent Benchmarks

  21. Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking

    Sep 11, 2026Parinthapat Pengpun, Simran Khanuja, Graham NeubigMultimodal GroundingVLM Reasoning

  22. From Pixels to Hierarchical Sequences: Quadtree Mask Encoding for Vision-Language Binary Change Detection

    Sep 9, 2026Xiao An, Ruikang Zhang, Chen Zhong +4Vision-Language ModelsRemote Sensing Change Detection

  23. CS-CLIP: Compositional Scene Graph-guided CLIP for Robust Compositional Reasoning

    Sep 8, 2026SeongJun Jeong, Minjoon Jung, Woo Suk Choi +2VLM RobustnessContrastive Learning

  24. BanglaMemeX: Advancing Cultural Metaphoric Image Interpretation in Bangla with a Multimodal Explainable Dataset

    Sep 7, 2026Md. Sadman Sakib, Zisan Mahmud, Md. Fahim Arefin +1Figurative Language UnderstandingMultilingual VLM Evaluation

  25. A visual large language foundational model for medical image recognition using clinician-contributed online resources

    Sep 7, 2026Lingxuan Hou, Yuhua Xie, Yue Hu +14Medical VQAMedical VLMs

  26. CulturalMenuBench: Probing the Knowledge-Application Gap in Multimodal Culinary Reasoning

    Sep 3, 2026Bo Zeng, Linfeng Gao, Peiqin Lin +9Multimodal ReasoningMultilingual VLM Evaluation

  27. Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models

    Sep 3, 2026Xingming Long, Yu Liu, Zhiwei Yang +7Tool Use in VLMsTool-Using Vision-Language Agents

  28. Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis

    Sep 1, 2026Minsik Choi, Geewook Kim, Young Geun KimVision-Language ModelsVLM Adaptation