Multimodal CoT Reasoning

CoT: Chain-of-Thought

Momentum

6 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 99

All topics
CardsList
  1. Latent Visual States for Efficient Multimodal Reasoning

    Jun 23, 2026Xiuwei Chen, Wentao Hu, Yongxin Wang +8Efficient Multimodal InferenceLarge Vision-Language Models

  2. Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME

    Jun 22, 2026Zhichao Fan, Yanhang Li, Zexin ZhuangVLM EvaluationVideo QA

  3. Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

    Jun 21, 2026Zhuoran Jin, Kejian Zhu, Hongbang Yuan +5Multimodal ReasoningVLM Reasoning

  4. MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning

    Jun 16, 2026Wanshi Xu, Haokun Zhao, Haidong Yuan +2Multimodal ReasoningMultimodal Reward Modeling

  5. Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations

    Jun 15, 2026Zhiqiang Zhou, Junliang Dai, Xu lingVLM InterpretabilityMultimodal CoT Reasoning

  6. NeRD: Neuro-Symbolic Rule Distillation for Efficient Ontology-Grounded Chain-of-Thought in Medical Image Diagnosis

    Jun 14, 2026Hongxi Yang, Yiwen Jiang, Siyuan Yan +8Medical Image ClassificationMultimodal CoT Reasoning

  7. CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

    Jun 12, 2026Jiayue Cao, Zhicong Lu, Xuehan Sun +6Multimodal Reward ModelingVLM Reasoning

  8. SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

    Jun 10, 2026Chao Lei, Yanbei Jiang, Markus Hiller +4Visual Spatial ReasoningReinforcement Learning with Verifiable Rewards

  9. ReasonRec: A Reasoning-Augmented Multimodal Agent for Unified Recommendation

    Jun 8, 2026Yihua Zhang, Mingfu Liang, Jiyan Yang +11Efficient Multimodal InferenceMultimodal CoT Reasoning

  10. Optical Reasoning: Rethinking Images as an Expressive Reasoning Medium Beyond Text

    Jun 8, 2026Yutong Bian, Dongjie Cheng, Heming Xia +2Visual ReasoningMultimodal Reasoning

  11. CRANE: Knowledge Editing for Reasoning MLLMs

    Jun 8, 2026Han Huang, Hao Wang, Mengqi Zhang +3Knowledge EditingKnowledge Conflicts in Language Models

  12. TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

    Jun 7, 2026Lianyu Hu, Xiaoyu Ma, Zeqin Liao +1Multimodal Large Language ModelsMultimodal Reasoning

  13. VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning

    Jun 4, 2026Shufan Zhang, Ziyue Lin, Bairun Wang +4Video ReasoningVLM Reasoning

  14. CR-Seg: Attention-Guided and CoT-Enhanced Coarse-to-Refined Reasoning Segmentation

    Jun 2, 2026Yifan Cao, Xiaocui Yang, Faxian Wan +3Text-Guided Image SegmentationPromptable Image Segmentation

  15. Spectral-Progressive Thought Flow for Lightweight Multimodal Reasoning

    Jun 1, 2026Yixian Shen, Zhiheng Yang, Qi Bi +6Efficient Multimodal InferenceVisual Spatial Reasoning

  16. Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs

    May 31, 2026Wentao Mo, Yang LiuCoT Distillation3D Spatial Reasoning

  17. Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

    May 27, 2026Jiawei Kong, Hao Fang, Shunxiang Liao +5Multimodal GroundingDirect Preference Optimization

  18. How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

    May 26, 2026Qian Yang, Ankur Sikarwar, Huy Le +4Visual Spatial ReasoningUnified Multimodal Models

  19. InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward

    May 26, 2026Zhiwei Ning, Wenwen Tong, Xiangli Kong +12Multimodal ReasoningVLM Reasoning

  20. MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning

    May 25, 2026Aritra Dutta, Somak AdityaVision-Language ModelsEfficient VLM Inference

  21. Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents

    May 25, 2026Dong-Hee Kim, Reuben Tan, Donghyun KimTool Use in VLMsAgentic Reasoning

  22. GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

    May 25, 2026Yingji Zhang, Yong Dai, André FreitasLatent Visual ReasoningMathematical Reasoning

  23. ETCHR: Editing To Clarify and Harness Reasoning

    May 22, 2026Beichen Zhang, Yuhong Liu, Jinsong Li +3Tool Use in VLMsMultimodal Reasoning

  24. LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

    May 21, 2026Yifan Dai, Zhenhua Wu, Bohan Zeng +18Cross-Modal LearningAudio-Visual Understanding

  25. ProCrit: Self-Elicited Multi-Perspective Reasoning with Critic-Guided Revision for Multimodal Sarcasm Detection

    May 20, 2026Yingjia Xu, Jiulong Wu, Bowen Zhang +3LLM Self-CorrectionMultimodal CoT Reasoning

  26. EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

    May 19, 2026Yang Dai, Dian Jiao, Tianwei Lin +1Egocentric Video QACoT Reasoning

  27. Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks

    May 18, 2026Yajing Zhou, Xiangyu KongAudio-Visual UnderstandingVisual Spatial Reasoning