VLM Reasoning

VLM: Vision-Language Model

Momentum

70 papers in the last four weeks, up 250% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 541

All topics
CardsList
  1. CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models

    May 19, 2026Hsiang-Wei Huang, Junbin Lu, Kuang-Ming Chen +3VLM Evaluation3D Spatial Reasoning

  2. GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards

    May 19, 2026Kyeongjin Ahn, Seungeon Lee, Krishna P. Gummadi +1Self-Play RLGeospatial Reasoning

  3. CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition

    May 19, 2026Hongji Yang, Songlian Li, Yucheng Zhou +4Video Diffusion ModelsRL for Video Generation

  4. FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

    May 19, 2026Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh +2VLM EvaluationTemporal Video Grounding

  5. Pseudocode-Guided Structured Reasoning for Automating Reliable Inference in Vision-Language Models

    May 19, 2026Weicong Ni, Tianbao Jiang, Linlin WangVLM RobustnessObject Hallucination in VLMs

  6. Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation

    May 19, 2026Junjie Wang, Xinghua Lou, Jason Li +8Image GenerationCompositional T2I Generation

  7. PERL: Parameter Efficient Reasoning in CLIP Latent Space

    May 18, 2026Simone Carnemolla, Salvatore Calcagno, Daniela Giordano +2VLM AdaptationFew-Shot Learning

  8. What's Holding Back Latent Visual Reasoning?

    May 18, 2026André G. Viveiros, Nuno Gonçalves, André F. T. Martins +1Vision-Language ModelsLatent Visual Reasoning

  9. SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation

    May 17, 2026Jingzhi Huang, Junkai Huang, Wenxuan Song +4Visual Spatial ReasoningVision-Language Navigation

  10. ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding

    May 17, 2026Mingyang Rao, Kehua Feng, Zhihui Zhu +4Vision-Language ModelsVLM Reasoning

  11. Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

    May 16, 2026Peng Cui, Boyao Yang, Jun ZhuMultimodal RobustnessVLM Reasoning

  12. Thinking with Patterns: Breaking the Perceptual Bottleneck in Visual Planning via Pattern Induction

    May 16, 2026Yichang Jian, Boyuan Xiao, Zhenyuan Huang +2Efficient VLM InferenceLatent Visual Reasoning

  13. Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination

    May 15, 2026Chufan Shi, Cheng Yang, Yaokang Wu +4VLM EvaluationVLM Robustness

  14. REC-RL: Referring expression counting via Gaussian and range-based reward optimization

    May 15, 2026Hui Liu, Yunlai Teng, Kunlong Bai +4VLM ReasoningRL for VLMs

  15. VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following

    May 15, 2026Hyesoo Hong, Minsoo Kim, Wonje Jeung +3VLM EvaluationVisual Navigation

  16. DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation

    May 15, 2026Jaehun Jung, Hyunwoo Kim, Brandon Cui +4VLM DistillationVLM Reasoning

  17. ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both

    May 14, 2026Ziyu Guo, Rain Liu, Xinyan Chen +1Visual ReasoningLarge Vision-Language Models

  18. Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action

    May 14, 2026Yi Zhang, Yinda Chen, Che Liu +26Action-Conditioned Video GenerationUnified Multimodal Models

  19. On the Cultural Anachronism and Temporal Reasoning in Vision Language Models

    May 14, 2026Mukul Ranjan, Prince Jha, Khushboo Kumari +1VLM EvaluationVLM Reasoning

  20. LATERN: Test-Time Context-Aware Explainable Video Anomaly Detection

    May 14, 2026Mitchell Piehl, Muchao YeInterpretable Anomaly DetectionVLM Reasoning

  21. Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA

    May 14, 2026Guanhua Chen, Yutong Yao, Shenghe Sun +5Visual Question AnsweringMultimodal Reasoning

  22. Exploring Vision-Language Models for Online Signature Verification: A Zero-Shot Capability Study

    May 14, 2026Marta Robledo-Moreno, Ruben Vera-Rodriguez, Ruben Tolosana +1VLM EvaluationZero-Shot Learning

  23. SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization

    May 14, 2026Posheng Chen, Powen Cheng, Gueter Josmy Faure +2VLM EvaluationVisual Spatial Reasoning

  24. Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

    May 13, 2026Haozhe Wang, Qixin Xu, Changpeng Wang +4Multimodal ReasoningVLM Reasoning

  25. CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning

    May 13, 2026Tengda Guo, Jie Leng, Hanlei Li +6Process Reward ModelsVisual Reasoning

  26. Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models

    May 13, 2026Yiran Ling, Qing Lian, Jinghang Li +6Robotic ControlRobot Policy Learning

  27. PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning

    May 13, 2026Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong +6VLM ReasoningReinforcement Learning with Verifiable Rewards

  28. Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

    May 13, 2026Chao Hao, Jun Xu, Ji Du +6Text-Guided Image SegmentationPromptable Image Segmentation

  29. 3D Primitives are a Spatial Language for VLMs

    May 12, 2026Junze Liu, Kun Qian, Florian Dubost +8Spatial Reasoning Benchmarks3D Spatial Reasoning

  30. Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models

    May 12, 2026Yanting Miao, Yutao Sun, Dexin Wang +8Multimodal Large Language ModelsLatent Visual Reasoning