Multimodal Reasoning

Latest papers 314

All topics
CardsList
  1. SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

    May 10, 2026Kun Xiang, Terry Jingchen Zhang, Zirong Liu +15Cross-Modal LearningMultimodal Grounding

  2. Earth Science Foundation Models: From Perception to Reasoning and Discovery

    May 9, 2026Xiangyu Zhao, Bo Liu, Yuehan Zhang +9AI for ScienceGeospatial Foundation Models

  3. UniShield: Unified Face Attack Detection via KG-Informed Multimodal Reasoning

    May 9, 2026Hongrui Li, Yichen Shi, Hongyang Wang +4Multimodal ReasoningFace Presentation Attack Detection

  4. Structured Role-Aware Policy Optimization for Multimodal Reasoning

    May 8, 2026Bingqing Jiang, Difan ZouToken-Level Credit AssignmentMultimodal Reasoning

  5. OmicsLM: A Multimodal Large Language Model for Multi-Sample Omics Reasoning

    May 7, 2026Maciej Sypetkowski, Joanna Krawczyk, Łukasz Smoliński +4Multimodal Large Language ModelsQuestion Answering

  6. TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity

    May 7, 2026Zheyuan Yang, Liqiang Shang, Junjie Chen +6Multimodal RobustnessMultimodal Reasoning

  7. Causal Probing for Internal Visual Representations in Multimodal Large Language Models

    May 7, 2026Zehao Deng, Tianjie Ju, Zheng Wu +5Multimodal Large Language ModelsVLM Interpretability

  8. AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification

    May 7, 2026Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu +7Multimodal ReasoningMultimodal Model Evaluation

  9. SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs

    May 7, 2026Hyobin Park, Taeseop Kim, Dong-Geol ChoiAI for ScienceSelf-Play RL

  10. ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

    May 5, 2026Honglei Zhang, Yuting Chen, Chenpeng Hu +2Audio ReasoningAudio Understanding

  11. DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

    May 2, 2026Jincheng Lou, Ruohan Xu, Jiapeng Li +6Multi-Agent LLM SystemsElectronic Design Automation

  12. Segment-Aligned Policy Optimization for Multi-Modal Reasoning

    May 2, 2026Lei Gao, Zhuoming Li, Mengxi Jia +4RL for Language Model ReasoningPolicy Optimization

  13. Valley3: Scaling Omni Foundation Models for E-commerce

    May 2, 2026Zeyu Chen, Guanghao Zhou, Min Yang +6Unified Multimodal ModelsMultimodal Pretraining

  14. WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild

    May 1, 2026Junzhe Huang, Xiaoxiao Sun, Yan Yang +6Visual Question AnsweringTable QA

  15. MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

    May 1, 2026Harshit Rajgarhia, Shuubham Ojha, Asif Shaik +4Audio QAHealthcare

  16. LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations

    May 1, 2026Huangbiao Xu, Huanqi Wu, Xiao Ke +1Missing-Modality LearningMultimodal Reasoning

  17. Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

    Apr 30, 2026Sudong Wang, Weiquan Huang, Xiaomin Yu +9Multimodal Large Language ModelsMultimodal Reasoning

  18. Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation

    Apr 30, 2026Jing Zhang, Wentao Jiang, Tao Huang +8Medical Image AnalysisMultimodal Reasoning

  19. MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection

    Apr 30, 2026Weihai Lu, Zhejun Zhao, Yanshu Li +1Multimodal ReasoningMultimodal Classification

  20. Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning

    Apr 27, 2026Zhicheng Zhang, Wentao Gu, Weicheng Wang +5Audio-Visual UnderstandingTree Search

  21. DeepTaxon: An Interpretable Retrieval-Augmented Multimodal Framework for Unified Species Identification and Discovery

    Apr 27, 2026Jiawei Wang, Ming Lei, Yaning Yang +8Retrieval-Augmented ClassificationAI-Assisted Scientific Research

  22. ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

    Apr 26, 2026Zichun Guo, Yuling Shi, Wenhao Zeng +6Image ReconstructionMultimodal Large Language Models

  23. Multimodal QUD: Inquisitive Questions from Scientific Figures

    Apr 26, 2026Yating Wu, William Rudman, Venkata S Govindarajan +2Multimodal GroundingScientific QA

  24. StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning

    Apr 25, 2026Xuanyue Zhong, Yuqiang Xie, Guanqun Bi +2Temporal Video GroundingVideo Understanding

  25. Context Unrolling in Omni Models

    Apr 23, 2026Ceyuan Yang, Zhijie Lin, Yang Zhao +16Cross-Modal LearningUnified Multimodal Models

  26. OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model

    Apr 22, 2026Qiguang Chen, Chengyu Luan, Jiajun Wu +7VLM EvaluationVisual Reasoning