Multimodal Reasoning

Latest papers 314

All topics
CardsList
  1. V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Multimodal ReasoningReinforcement Learning with Verifiable Rewards

  2. ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence

    Apr 22, 2026Menghe Ma, Siqing Wei, Yuecheng Xing +5Optical Music RecognitionMultimodal Reasoning

  3. HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

    Apr 22, 2026Tao Cheng, Shi-Zhe Chen, Hao Zhang +3Multimodal Large Language ModelsMultimodal Reasoning

  4. Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

    Apr 21, 2026Jing Jin, Hao Liu, Yan Bai +9Reasoning EvaluationMultimodal Reasoning

  5. How Far Are Video Models from True Multimodal Reasoning?

    Apr 21, 2026Xiaotian Zhang, Jianhui Wei, Yuan Wang +9Multimodal ReasoningVideo Reasoning

  6. A Multi-Agent Framework with Structured Reasoning and Reflective Refinement for Multimodal Empathetic Response Generation

    Apr 21, 2026Liping Wang, Cheng Ye, Weidong Chen +3LLM Self-RefinementMultimodal Reasoning

  7. DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

    Apr 20, 2026Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao +3Cross-Modal LearningVisual Question Answering

  8. Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

    Apr 20, 2026Samuel G. Balter, Ethan Jerzak, Connor T. JerzakMultimodal Large Language ModelsMultimodal Reasoning

  9. Retrieval-Augmented Multimodal Model for Fake News Detection

    Apr 20, 2026Yiheng Li, Weihai Lu, Hanyi Yu +1Fake News DetectionText Classification

  10. AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

    Apr 17, 2026Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza +5Cross-Modal LearningAudio-Visual Understanding

  11. Real-Time Visual Attribution Streaming in Thinking Model

    Apr 17, 2026Seil Kang, Woojung Han, Junhyeok Kim +3VLM InterpretabilityMultimodal Reasoning

  12. Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions

    Apr 17, 2026Ze Dong, Hao Shi, Zejia Gao +3Multimodal RobustnessEgocentric Video Understanding

  13. Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning

    Apr 17, 2026Xiaoyu Yang, En Yu, Wei Duan +1Multimodal RobustnessMultimodal Large Language Models

  14. PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation

    Apr 17, 2026Shuyan Ke, Yifan Mei, Changli Wu +4Image SegmentationRemote Sensing Image Segmentation

  15. Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

    Apr 16, 2026Nishanth Madhusudhan, Vikas Yadav, Alexandre LacosteMultimodal QAMultimodal Reasoning

  16. Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

    Apr 16, 2026Ziyang Luo, Nian Liu, Junwei HanMultimodal Large Language ModelsMultimodal Reasoning

  17. Unified Multimodal Uncertain Inference

    Apr 9, 2026Dengjia Zhang, Alexander Martin, William Jurayj +3Probability CalibrationMultimodal Reasoning

  18. RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection

    Apr 8, 2026Hui Li, Peien Ding, Jun Li +5Multimodal RAGFake News Detection

  19. MG2^2-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

    Apr 4, 2026Sijun Dai, Qiang Huang, Xiaoxing You +1Cross-Modal LearningMultimodal RAG

  20. BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

    Mar 30, 2026Taeyun Roh, Suhyeong Park, Dongyoung Lee +4Vision-Language ModelsMultimodal QA

  21. GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing

    Mar 12, 2026Mingxin Liu, Ziqian Fan, Zhaokai Wang +13Image Editing EvaluationText-Guided Image Editing

  22. EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

    Feb 27, 2026Yiyang Fang, Wenke Huang, Pei Fu +5Multimodal Large Language ModelsMultimodal Reasoning

  23. OmniGAIA: Towards Native Omni-Modal AI Agents

    Feb 26, 2026Xiaoxi Li, Wenxiang Jiao, Jiarui Jin +10Multimodal ReasoningAI Agent Benchmarks

  24. LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

    Feb 15, 2026Shufan Li, Yuchen Zhu, Jiuxiang Gu +6Unified Multimodal ModelsMultimodal Reasoning

  25. ARK: A Dual-Axis Multimodal Retrieval Benchmark along Reasoning and Knowledge

    Feb 10, 2026Yijie Lin, Guofeng Ding, Haochen Zhou +3Multimodal IRVisual Spatial Reasoning

  26. UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

    Feb 9, 2026Cheng Yang, Chufan Shi, Bo Shui +7Unified Multimodal ModelsImage Generation

  27. Social Caption: Evaluating Social Understanding in Multimodal Models

    Jan 21, 2026Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe +1Multimodal Large Language ModelsMultimodal Reasoning