Multimodal CoT Reasoning

CoT: Chain-of-Thought

Momentum

6 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 99

All topics
CardsList
  1. OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

    Oct 1, 2026Haibo Wang, Jiteng Mu, Jialu Li +5Audio-Visual UnderstandingRL for Language Model Reasoning

  2. MG-Thinker: Bi-Axial Self-Reflection for Multi-Image Reasoning Grounding

    Sep 29, 2026Heyu Huang, Chi Chen, Zonghao Guo +3Multimodal GroundingMultimodal CoT Reasoning

  3. Reasoning with Image Generation

    Sep 14, 2026Nishad Singhi, Hector Garcia Rodriguez, Aditya Arora +2Tool Use in VLMsVLM Reasoning

  4. Reason What Matters: Retrieval-Grounded Reasoning for Universal Multimodal Embeddings

    Sep 14, 2026Mingzhou Jiang, Peixi Wu, Hang Cheng +7Multimodal IREfficient Multimodal Inference

  5. Beyond Generation and Accuracy: Diagnosing and Enhancing Visual Chain-of-Thought for Geometry Problem Solving

    Sep 11, 2026Zhitong Dong, Jicai Pan, Yingguo Gao +3Mathematical ReasoningMultimodal CoT Reasoning

  6. Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

    Aug 31, 2026Jiani Guo, Junjie Wang, Jie Wu +5RL for Language Model ReasoningCredit Assignment in RL

  7. VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

    Aug 11, 2026Rohit Sinha, Kunal Tilaganji, Tanuja Ganu +3Multimodal Large Language ModelsMultimodal CoT Reasoning

  8. Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

    Aug 5, 2026Yang Yang, Jiawei Chen, Tairan Chen +1Multimodal GroundingVisual Spatial Reasoning

  9. CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

    Aug 3, 2026Xuehang Guo, Pingyue Zhang, Ruiyi Zhang +6Data VisualizationChart QA

  10. AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

    Aug 3, 2026Jingqi Tian, Haoji Zhang, Lin Chen +7Efficient VLM InferenceRL for Language Model Reasoning

  11. Talked Out of the Truth: Sycophancy in the Reasoning Chains of Multimodal Models

    Jul 30, 2026Mahir Numayeer Islam, Gakuto Okuyama, Nikolaus Siauw +3LLM SycophancyMultimodal CoT Reasoning

  12. See2Think: Do Multimodal Models Really Use Intermediate Visual States?

    Jul 29, 2026Siyu Yan, Zhuoran Yan, Haiying Xu +10Visual ReasoningMultimodal Reasoning

  13. Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

    Jul 27, 2026Tianyi Gao, Han Fang, Tianyi Ding +9Multimodal GroundingMultimodal Large Language Models

  14. Offline-Online Curriculum RL for Multimodal Reasoning

    Jul 26, 2026Wendi Deng, Hang Du, Guoshun Nan +11Reinforcement LearningRL for Language Model Reasoning

  15. EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

    Jul 24, 2026Hao Yang, Jin Wang, Xuejie ZhangContent ModerationVLM Reasoning

  16. Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

    Jul 24, 2026Hao Yang, Jin Wang, Xuejie ZhangVLM DistillationMultimodal QA

  17. Constraint-Anchored Reasoning Traces

    Jul 18, 2026Zehua Cheng, Wei Dai, Jiahao SunVisual Question AnsweringLLM Grounding

  18. DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

    Jul 9, 2026Pengjie Wang, Linger Deng, Zujia Zhang +6Efficient Multimodal InferenceUnified Multimodal Models

  19. Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

    Jul 7, 2026Zhiwei Yang, Yuanchen Wu, Nan Zhang +3Multimodal Large Language ModelsMultimodal CoT Reasoning

  20. EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization

    Jul 6, 2026Youngkil Song, Yoonjae Baek, Dongwon Kim +3Temporal Video GroundingMultimodal CoT Reasoning

  21. CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

    Jun 30, 2026Lianyu Hu, Shengqian Qin, Zeqin Liao +4Efficient Multimodal InferenceEfficient Language Model Reasoning

  22. OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning

    Jun 29, 2026Haocong He, Chenfei Liao, Zichen Wen +13Visual Spatial ReasoningMultimodal Large Language Models

  23. MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy

    Jun 26, 2026Zhiyuan Han, Beier Zhu, Wenwen Tong +8RL for Language Model ReasoningMultimodal Large Language Models

  24. CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs

    Jun 25, 2026Hashmat Shadab Malik, Anees Ur Rehman Hashmi, Numan Saeed +3Radiology Report Generation3D Medical Imaging

  25. Latent Visual States for Efficient Multimodal Reasoning

    Jun 23, 2026Xiuwei Chen, Wentao Hu, Yongxin Wang +8Efficient Multimodal InferenceLarge Vision-Language Models

  26. Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME

    Jun 22, 2026Zhichao Fan, Yanhang Li, Zexin ZhuangVLM EvaluationVideo QA

  27. Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

    Jun 21, 2026Zhuoran Jin, Kejian Zhu, Hongbang Yuan +5Multimodal ReasoningVLM Reasoning

  28. MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning

    Jun 16, 2026Wanshi Xu, Haokun Zhao, Haidong Yuan +2Multimodal ReasoningMultimodal Reward Modeling

  29. Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations

    Jun 15, 2026Zhiqiang Zhou, Junliang Dai, Xu lingVLM InterpretabilityMultimodal CoT Reasoning

  30. NeRD: Neuro-Symbolic Rule Distillation for Efficient Ontology-Grounded Chain-of-Thought in Medical Image Diagnosis

    Jun 14, 2026Hongxi Yang, Yiwen Jiang, Siyuan Yan +8Medical Image ClassificationMultimodal CoT Reasoning

  31. CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

    Jun 12, 2026Jiayue Cao, Zhicong Lu, Xuehan Sun +6Multimodal Reward ModelingVLM Reasoning

  32. SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

    Jun 10, 2026Chao Lei, Yanbei Jiang, Markus Hiller +4Visual Spatial ReasoningReinforcement Learning with Verifiable Rewards

  33. ReasonRec: A Reasoning-Augmented Multimodal Agent for Unified Recommendation

    Jun 8, 2026Yihua Zhang, Mingfu Liang, Jiyan Yang +11Efficient Multimodal InferenceMultimodal CoT Reasoning

  34. Optical Reasoning: Rethinking Images as an Expressive Reasoning Medium Beyond Text

    Jun 8, 2026Yutong Bian, Dongjie Cheng, Heming Xia +2Visual ReasoningMultimodal Reasoning

  35. CRANE: Knowledge Editing for Reasoning MLLMs

    Jun 8, 2026Han Huang, Hao Wang, Mengqi Zhang +3Knowledge EditingKnowledge Conflicts in Language Models

  36. TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

    Jun 7, 2026Lianyu Hu, Xiaoyu Ma, Zeqin Liao +1Multimodal Large Language ModelsMultimodal Reasoning

  37. VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning

    Jun 4, 2026Shufan Zhang, Ziyue Lin, Bairun Wang +4Video ReasoningVLM Reasoning

  38. CR-Seg: Attention-Guided and CoT-Enhanced Coarse-to-Refined Reasoning Segmentation

    Jun 2, 2026Yifan Cao, Xiaocui Yang, Faxian Wan +3Text-Guided Image SegmentationPromptable Image Segmentation

  39. Spectral-Progressive Thought Flow for Lightweight Multimodal Reasoning

    Jun 1, 2026Yixian Shen, Zhiheng Yang, Qi Bi +6Efficient Multimodal InferenceVisual Spatial Reasoning

  40. Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs

    May 31, 2026Wentao Mo, Yang LiuCoT Distillation3D Spatial Reasoning

  41. Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

    May 27, 2026Jiawei Kong, Hao Fang, Shunxiang Liao +5Multimodal GroundingDirect Preference Optimization

  42. How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

    May 26, 2026Qian Yang, Ankur Sikarwar, Huy Le +4Visual Spatial ReasoningUnified Multimodal Models

  43. InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward

    May 26, 2026Zhiwei Ning, Wenwen Tong, Xiangli Kong +12Multimodal ReasoningVLM Reasoning

  44. MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning

    May 25, 2026Aritra Dutta, Somak AdityaVision-Language ModelsEfficient VLM Inference

  45. Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents

    May 25, 2026Dong-Hee Kim, Reuben Tan, Donghyun KimTool Use in VLMsAgentic Reasoning

  46. GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

    May 25, 2026Yingji Zhang, Yong Dai, André FreitasLatent Visual ReasoningMathematical Reasoning

  47. ETCHR: Editing To Clarify and Harness Reasoning

    May 22, 2026Beichen Zhang, Yuhong Liu, Jinsong Li +3Tool Use in VLMsMultimodal Reasoning

  48. LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

    May 21, 2026Yifan Dai, Zhenhua Wu, Bohan Zeng +18Cross-Modal LearningAudio-Visual Understanding

  49. ProCrit: Self-Elicited Multi-Perspective Reasoning with Critic-Guided Revision for Multimodal Sarcasm Detection

    May 20, 2026Yingjia Xu, Jiulong Wu, Bowen Zhang +3LLM Self-CorrectionMultimodal CoT Reasoning

  50. EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

    May 19, 2026Yang Dai, Dian Jiao, Tianwei Lin +1Egocentric Video QACoT Reasoning

  51. Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks

    May 18, 2026Yajing Zhou, Xiangyu KongAudio-Visual UnderstandingVisual Spatial Reasoning