Multimodal CoT Reasoning

CoT: Chain-of-Thought

Momentum

6 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 99

All topics
CardsList
  1. OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

    Oct 1, 2026Haibo Wang, Jiteng Mu, Jialu Li +5Audio-Visual UnderstandingRL for Language Model Reasoning

  2. MG-Thinker: Bi-Axial Self-Reflection for Multi-Image Reasoning Grounding

    Sep 29, 2026Heyu Huang, Chi Chen, Zonghao Guo +3Multimodal GroundingMultimodal CoT Reasoning

  3. Reasoning with Image Generation

    Sep 14, 2026Nishad Singhi, Hector Garcia Rodriguez, Aditya Arora +2Tool Use in VLMsVLM Reasoning

  4. Reason What Matters: Retrieval-Grounded Reasoning for Universal Multimodal Embeddings

    Sep 14, 2026Mingzhou Jiang, Peixi Wu, Hang Cheng +7Multimodal IREfficient Multimodal Inference

  5. Beyond Generation and Accuracy: Diagnosing and Enhancing Visual Chain-of-Thought for Geometry Problem Solving

    Sep 11, 2026Zhitong Dong, Jicai Pan, Yingguo Gao +3Mathematical ReasoningMultimodal CoT Reasoning

  6. Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

    Aug 31, 2026Jiani Guo, Junjie Wang, Jie Wu +5RL for Language Model ReasoningCredit Assignment in RL

  7. VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

    Aug 11, 2026Rohit Sinha, Kunal Tilaganji, Tanuja Ganu +3Multimodal Large Language ModelsMultimodal CoT Reasoning

  8. Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

    Aug 5, 2026Yang Yang, Jiawei Chen, Tairan Chen +1Multimodal GroundingVisual Spatial Reasoning

  9. CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

    Aug 3, 2026Xuehang Guo, Pingyue Zhang, Ruiyi Zhang +6Data VisualizationChart QA

  10. AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

    Aug 3, 2026Jingqi Tian, Haoji Zhang, Lin Chen +7Efficient VLM InferenceRL for Language Model Reasoning

  11. Talked Out of the Truth: Sycophancy in the Reasoning Chains of Multimodal Models

    Jul 30, 2026Mahir Numayeer Islam, Gakuto Okuyama, Nikolaus Siauw +3LLM SycophancyMultimodal CoT Reasoning

  12. See2Think: Do Multimodal Models Really Use Intermediate Visual States?

    Jul 29, 2026Siyu Yan, Zhuoran Yan, Haiying Xu +10Visual ReasoningMultimodal Reasoning

  13. Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

    Jul 27, 2026Tianyi Gao, Han Fang, Tianyi Ding +9Multimodal GroundingMultimodal Large Language Models

  14. Offline-Online Curriculum RL for Multimodal Reasoning

    Jul 26, 2026Wendi Deng, Hang Du, Guoshun Nan +11Reinforcement LearningRL for Language Model Reasoning

  15. EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

    Jul 24, 2026Hao Yang, Jin Wang, Xuejie ZhangContent ModerationVLM Reasoning

  16. Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

    Jul 24, 2026Hao Yang, Jin Wang, Xuejie ZhangVLM DistillationMultimodal QA

  17. Constraint-Anchored Reasoning Traces

    Jul 18, 2026Zehua Cheng, Wei Dai, Jiahao SunVisual Question AnsweringLLM Grounding

  18. DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

    Jul 9, 2026Pengjie Wang, Linger Deng, Zujia Zhang +6Efficient Multimodal InferenceUnified Multimodal Models

  19. Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

    Jul 7, 2026Zhiwei Yang, Yuanchen Wu, Nan Zhang +3Multimodal Large Language ModelsMultimodal CoT Reasoning

  20. EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization

    Jul 6, 2026Youngkil Song, Yoonjae Baek, Dongwon Kim +3Temporal Video GroundingMultimodal CoT Reasoning

  21. CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

    Jun 30, 2026Lianyu Hu, Shengqian Qin, Zeqin Liao +4Efficient Multimodal InferenceEfficient Language Model Reasoning

  22. OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning

    Jun 29, 2026Haocong He, Chenfei Liao, Zichen Wen +13Visual Spatial ReasoningMultimodal Large Language Models

  23. MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy

    Jun 26, 2026Zhiyuan Han, Beier Zhu, Wenwen Tong +8RL for Language Model ReasoningMultimodal Large Language Models

  24. CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs

    Jun 25, 2026Hashmat Shadab Malik, Anees Ur Rehman Hashmi, Numan Saeed +3Radiology Report Generation3D Medical Imaging