Multimodal Large Language Models

Also known as MLLM

Latest papers 684

All topics
CardsList
  1. A Nash Equilibrium Framework For Training-Free Multimodal Step Verification

    May 19, 2026Rohit Sinha, Kunal Tilaganji, Tanuja Ganu +3Multi-View ConsistencyGame Theory

  2. AffectVerse: Emotional World Models for Multimodal Affective Computing

    May 19, 2026Bo Zhao, Fanghua Ye, Yixin Ji +3Cross-Modal LearningMultimodal Large Language Models

  3. Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning

    May 19, 2026Qinghe Ma, Zhen Zhao, Yiming Wu +3Multimodal Large Language ModelsMultimodal Reasoning

  4. LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue

    May 19, 2026Chaoyue Li, Yongxue Xu, Jie Feng +1Spatiotemporal ReasoningMultimodal Large Language Models

  5. MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems

    May 19, 2026Quanxing Xu, Yuhao Tian, Ling Zhou +4Visual Question AnsweringAutomated Software Testing

  6. Modality-Decoupled Online Recursive Editing

    May 19, 2026Siyuan Li, Youyuan Zhang, Fangming Liu +1Continual Learning for LLMsMultimodal Large Language Models

  7. Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination

    May 19, 2026Jinrui Jiang, Zhangtai Wu, Zhen Wu +1Hallucination in Language ModelsMultimodal Large Language Models

  8. Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

    May 18, 2026Qianhao Yuan, Jie Lou, Xing Yu +4Multimodal Large Language ModelsOn-Policy Distillation

  9. Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models

    May 18, 2026Kunyu Peng, Zhikun Zhou, Kailun Yang +9Visual Spatial ReasoningMulti-Robot Systems

  10. RAVE: Re-Allocating Visual Attention in Large Multimodal Models

    May 18, 2026Xi Leng, Xinhong Ma, Ziqiang Dong +4Visual AttentionSelf-Attention

  11. Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks

    May 18, 2026Yajing Zhou, Xiangyu KongAudio-Visual UnderstandingVisual Spatial Reasoning

  12. Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs

    May 18, 2026Jun-Yu Pan, Yansen Wang, Enze Zhang +3EEG DecodingEEG-Based Visual Decoding

  13. Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

    May 18, 2026Xinpeng Dong, Min Zhang, Kairong Han +3Object Hallucination in VLMsMultimodal Large Language Models

  14. Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction

    May 18, 2026Jiahe Guo, Xiangran Guo, Jiaxuan Chen +6Multimodal Large Language ModelsLLM Safety

  15. A More Word-like Image Tokenization for MLLMs

    May 18, 2026Hyun Lee, Hyemin Jeong, Yejin Kim +4Image TokenizationEfficient VLM Inference

  16. DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

    May 18, 2026Wenzhuo Xu, Zhipeng Wei, Zonghao Ying +4Multimodal Large Language ModelsLLM Safety

  17. Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

    May 17, 2026Chaoqun He, Mingyang Xiang, Yingjing Xu +5Multimodal Large Language ModelsMultimodal Agents

  18. EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning

    May 17, 2026Zeyu Wang, Chang Liu, Eduardus Tjitrahardja +22Multimodal Large Language ModelsEgocentric Video Understanding

  19. CatalyticMLLM: A Graph-Text Multimodal Large Language Model for Catalytic Materials

    May 17, 2026Yanjie Li, Jian Xu, Xu-Yao Zhang +4Multimodal Large Language ModelsMaterials Property Prediction

  20. Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages

    May 16, 2026Firoj Alam, Shammur Absar Chowdhury, Enamul Hoque PrinceCross-Modal AlignmentMultimodal Large Language Models

  21. Navigating the Emotion Tree: Hierarchical Hyperbolic RAG for Multimodal Emotion Recognition

    May 16, 2026Zeheng Wang, Bo Zhao, Yijie Zhu +6Multimodal RAGHierarchical Classification

  22. Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models

    May 15, 2026Cheng Zhang, Yuer Liu, Zhiyu Zhou +2Feature AttributionMultimodal Large Language Models

  23. ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

    May 15, 2026Jiahui Guang, Haiyan Wang, Yingjie Zhu +4VLM UnlearningMultimodal Large Language Models

  24. Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

    May 13, 2026Trung Nguyen Quang, Yiming Gao, Fanyi Pu +3Multimodal GroundingMultimodal Large Language Models