VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. Disentangling Visual and Factual Correctness in LVLMs' Visualization Literacy

    Jun 2, 2026Soohyun Lee, Jaeyoung Kim, Seokhyeon Park +5VLM EvaluationData Visualization

  2. Readable Yet Unpredictable: Rotated-Outcome Prediction in Vision-Language Models

    Jun 1, 2026Lexin Wang, Shenghua Liu, Yiwei Wang +2VLM EvaluationVLM Reasoning

  3. InsightVQA: High-Dimensional Emotion-Cognitive Visual Question Answering Benchmark

    Jun 1, 2026Shiyu Wang, Ziyu Liu, Chaoyi Yu +6VLM EvaluationVisual Question Answering

  4. Disentanglement-Based Equivariant Learning for Compositional VQA

    Jun 1, 2026Zhou Du, Zhaoquan Yuan, Xiao Wu +1Visual Question AnsweringDisentangled Representation Learning

  5. TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL

    Jun 1, 2026Tianze Yang, Yucheng Shi, Ruitong Sun +3Reinforcement LearningVLM Reasoning

  6. Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning

    May 31, 2026Garvin Guo, Yu Chen, Xiang Wang +4VLM EvaluationVLM Interpretability

  7. Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning

    May 31, 2026Jixuan He, Xueting Li, Chieh Hubert Lin +13D Spatial ReasoningVLM Reasoning

  8. Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion

    May 30, 2026Shivam Singh, Saptarshi Majumder, Pratik Prabhanjan Brahma +2Vision-Language GroundingVideo Reasoning

  9. Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding

    May 30, 2026Hee Suk Yoon, Eunseop Yoon, Jaehyun Jang +6Cross-Modal Knowledge DistillationVLM Distillation

  10. DeepLatent: Think with Images via Parallel Latent Visual Reasoning

    May 30, 2026Dongchen Lu, Zhimo Li, Mao Shu +1Latent Visual ReasoningVLM Reasoning

  11. nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving

    May 29, 2026Zhiyu Huang, Johnson Liu, Rui Song +13Autonomous Driving DatasetsAutonomous Driving Benchmarks

  12. VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning

    May 29, 2026Hengbo Xu, Shengjie Jin, Yanbiao Ma +1Efficient Multimodal InferenceVisual Attention

  13. Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

    May 29, 2026Yuhan Wang, Shuochen Chang, Yalin Feng +8Multi-Agent CollaborationVLM Reasoning

  14. ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models

    May 28, 2026Zihu Wang, Karthik Somayaji N. S, Peng LiVisual ReasoningLarge Vision-Language Models

  15. Tiny but Trusted: Efficient Vision-Language Reasoning for Time-Series Anomaly Detection

    May 28, 2026Xiaona Zhou, Muntasir Wahed, Tianjiao Yu +2Interpretable Anomaly DetectionAnomaly Localization

  16. Unveiling the Visual Counting Bottleneck in Vision-Language Models

    May 28, 2026Xingzhou Pang, Yifan Hou, Junling Wang +1Object CountingLatent Visual Reasoning

  17. FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection

    May 28, 2026Leqi Zhu, Junyan Ye, Kaiqing Lin +3Explainable Deepfake DetectionCoT Reasoning

  18. Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning

    May 28, 2026Yaowu Fan, Tao Han, Dazhao Du +2Tool-Using Vision-Language AgentsVLM Reasoning

  19. ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving

    May 27, 2026Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit +1VLMs for Autonomous DrivingAutonomous Driving Safety Evaluation

  20. The Abstraction Gap in Vision-Language Causal Reasoning

    May 27, 2026Chinh Hoang, Mohammad Rashedul HasanVLM EvaluationCausal Reasoning in Language Models

  21. Self-Prophetic Decoding to Unlock Visual Search in LVLMs

    May 27, 2026Zhendong He, Qiyuan Dai, Guanbin Li +2Large Vision-Language ModelsVLM Reasoning

  22. Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning

    May 27, 2026Yang Zhang, Xiaoshuai Sun, Rui Zhao +5Active PerceptionMultimodal Reasoning

  23. MACReD: A Multi-Agent Collaborative Reasoning Framework for Reaction Diagram Parsing

    May 27, 2026Chuang Tang, Chenhao Lin, Yin Xu +5VLM ReasoningMulti-Agent Reasoning

  24. Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning

    May 27, 2026Xuanzhao Dong, Wenhui Zhu, Peijie Qiu +11Visual Question AnsweringTool-Using Vision-Language Agents