Multimodal Reasoning

Latest papers 314

All topics
CardsList
  1. GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods

    Jun 2, 2026Sujay Belsare, Sudarshan Nikhil, Sushant Kumar +2Multimodal ReasoningMultimodal Model Interpretability

  2. World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

    Jun 2, 2026Yucheng Zhou, Wei Tao, Yiwen Guo +1On-Policy Self-DistillationWorld Models

  3. CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection

    Jun 2, 2026Jinjie Shen, Yaxiong Wang, Yujiao Wu +5Fake News DetectionMultimodal Large Language Models

  4. MUSE: A Unified Agentic Harness for MLLMs

    Jun 2, 2026Jianglin Lu, Hailing Wang, Xu Ma +4Multimodal ReasoningMultimodal Agents

  5. Spectral-Progressive Thought Flow for Lightweight Multimodal Reasoning

    Jun 1, 2026Yixian Shen, Zhiheng Yang, Qi Bi +6Efficient Multimodal InferenceVisual Spatial Reasoning

  6. Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

    Jun 1, 2026Garvin Guo, Donglei Yu, Yu Chen +6Tool-Use EvaluationLLM Agent Evaluation

  7. Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

    May 31, 2026Wanlong Fang, Tianle Zhang, Wen Tao +1Multimodal GroundingMultimodal Large Language Models

  8. CASTLE2026 Team WDL Technical Report

    May 30, 2026Zhengyang Li, Zhenglin Du, Yi Wen +3Multimodal RAGEgocentric Video QA

  9. Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs

    May 30, 2026Mona Gandhi, KJ Joseph, Srinivasan Parthasarathy +1VLM EvaluationVLM Interpretability

  10. VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning

    May 29, 2026Hengbo Xu, Shengjie Jin, Yanbiao Ma +1Efficient Multimodal InferenceVisual Attention

  11. FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning

    May 29, 2026Mingyang Mao, Bhargav Rishi Medisetti, Utkarsh Grover +4HealthcareClinical Decision Support

  12. StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning

    May 29, 2026Xixiang He, Baiqi Wu, Xingming Li +4VLM EvaluationVisual Reasoning

  13. MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization

    May 28, 2026Anisha Saha, Varsha Suresh, Teodora Kamova +3VLM RobustnessMultimodal Reasoning

  14. OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

    May 28, 2026Wanhao Liu, Jiaqing Xie, Qian Tan +10Benchmark DesignScientific QA

  15. DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning

    May 28, 2026Junzhe Zhang, Huixuan Zhang, Guirong Wang +5Counterfactual EvaluationCounterfactual Reasoning in Language Models

  16. VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

    May 27, 2026Yuting Xu, Jiayi Tian, Jian Liang +4Multimodal ReasoningAI Agent Benchmarks

  17. CyberJurors: A Multi-Agent Simulation Task for E-Commerce Disputes Verdict

    May 27, 2026Yanhui Sun, Wu Liu, Haifeng Ming +3Multimodal ReasoningLLM Decision-Making

  18. Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning

    May 27, 2026Yang Zhang, Xiaoshuai Sun, Rui Zhao +5Active PerceptionMultimodal Reasoning

  19. Touch-R1: Reinforcing Touch Reasoning in MLLMs

    May 26, 2026Yingxin Lai, Yafei Zhou, Fucai Zhu +2Tactile SensingMultimodal Large Language Models

  20. LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?

    May 26, 2026Xiaohan Wang, Mingze Yin, Yilin Zhao +2Mathematical Reasoning BenchmarksEducational Assessment

  21. InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward

    May 26, 2026Zhiwei Ning, Wenwen Tong, Xiangli Kong +12Multimodal ReasoningVLM Reasoning

  22. MULTISEISMO: A Multimodal Seismic Dataset and Model for Cross-Modal Seismic Understanding

    May 25, 2026Sai Munikoti, Ian Stewart, Chengping Chai +4Multimodal ReasoningSeismology

  23. AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution

    May 25, 2026Zehao Wang, Yihan Zeng, Zidong Gong +5RL for Language Model ReasoningMultimodal Large Language Models

  24. Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning

    May 25, 2026Fanhu Zeng, Zhicong Luo, Zefan Wang +3Visual ReasoningMultimodal Reasoning

  25. AOEPT: Breaking the Implicit Modality-Reduction Bottleneck in Modality-Missing Prompt Tuning

    May 24, 2026Jian Lang, Rongpei Hong, Ting Zhong +1Missing-Modality LearningMultimodal Reasoning