Multimodal CoT Reasoning

CoT: Chain-of-Thought

Momentum

6 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 99

All topics
CardsList
  1. UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs

    May 12, 2026Houcheng Jiang, Jiajun Fu, Junfeng Fang +4Efficient Multimodal InferenceMultimodal Large Language Models

  2. OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models

    May 12, 2026Yuanhao Yue, Chengyu Wang, Yuanjie Lyu +2VLM DistillationMultimodal Reasoning

  3. Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

    May 11, 2026Xuanchen Li, Yuheng Lu, Chenrui Cui +6Cross-Modal LearningMultimodal QA

  4. Do multimodal models imagine electric sheep?

    May 10, 2026Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes +2Visual Spatial ReasoningWorld Model Learning

  5. Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

    May 10, 2026Xuan Gong, Hanbo Huang, Hao Zheng +4Vision-Language ModelsVision-Language Grounding

  6. Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation

    May 5, 2026Quanxing Xu, Ling Zhou, Xian Zhong +3Multimodal RAGVisual Question Answering

  7. Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts

    May 3, 2026Hongkun Pan, Yuwei Wu, Wanyi Hong +8Data VisualizationMultimodal CoT Reasoning

  8. CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation

    Apr 29, 2026Sonali Sharma, Jin Long, George Shih +7Chest X-Ray ClassificationMedical Image Analysis

  9. UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks

    Apr 25, 2026Jason Nguyen, Ameet Rao, Alexander Chang +2Multimodal Large Language ModelsVideo QA

  10. ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

    Apr 23, 2026Jingpei Wu, Xiao Han, Weixiang Shen +3Process Reward ModelsMultimodal QA

  11. Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry

    Apr 22, 2026Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin +4Visual Question AnsweringPlant Disease Classification

  12. V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Multimodal ReasoningReinforcement Learning with Verifiable Rewards

  13. SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark

    Apr 22, 2026Gui Wang, YongSong Zhou, Kaijun Deng +4Spatiotemporal ReasoningHealthcare

  14. Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

    Apr 21, 2026Jing Jin, Hao Liu, Yan Bai +9Reasoning EvaluationMultimodal Reasoning

  15. A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

    Apr 21, 2026Shuai Wang, Hongyi Zhu, Jia-Hong Huang +6Multimodal RAGMultimodal Grounding

  16. Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

    Apr 20, 2026Xiang He, Chenxing Li, Jinting Wang +5RL for Language Model ReasoningAudio Reasoning

  17. SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning

    Apr 19, 2026Yian Li, Yang Jiao, Bin Zhu +4Visual Spatial ReasoningUnified Multimodal Models

  18. Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement

    Apr 18, 2026Xudong Li, Jiaxi Tan, Ziyin Zhou +6Tool Use in VLMsMultimodal CoT Reasoning

  19. Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs

    Apr 17, 2026Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian +1Spatial Reasoning BenchmarksVisual Spatial Reasoning

  20. Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding

    Apr 16, 2026Zhixuan Wu, Quanxing Zha, Teng Wang +6Video ReasoningMultimodal CoT Reasoning

  21. UniRect-CoT: Enhancing Generation in Unified Multimodal Models via Reflective Rectification with Inherent Understanding

    Apr 15, 2026Yibo Jiang, Tao Wu, Rui Jiang +4Diffusion Model GuidanceUnified Multimodal Models

  22. M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

    Jan 13, 2026Juntao Jiang, Jiangning Zhang, Yali Bi +7Medical VLMsMultimodal CoT Reasoning

  23. Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

    Dec 16, 2025Yankai Jiang, Yujie Zhang, Peng Zhang +5Image SegmentationTool Use in VLMs

  24. See, Think, Learn: A Self-Taught Multimodal Reasoner

    Dec 2, 2025Sourabh Sharma, Sonam Gupta, SadbhawnaSelf-TrainingVLM Reasoning

  25. VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

    Nov 21, 2025Lingxiao Li, Yifan Wang, Xinyan Gao +3Visual Spatial ReasoningVisual Reasoning