Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination

    May 19, 2026Jinrui Jiang, Zhangtai Wu, Zhen Wu +1Hallucination in Language ModelsMultimodal Large Language Models

  2. Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

    May 18, 2026Qianhao Yuan, Jie Lou, Xing Yu +4Multimodal Large Language ModelsOn-Policy Distillation

  3. Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models

    May 18, 2026Kunyu Peng, Zhikun Zhou, Kailun Yang +9Visual Spatial ReasoningMulti-Robot Systems

  4. RAVE: Re-Allocating Visual Attention in Large Multimodal Models

    May 18, 2026Xi Leng, Xinhong Ma, Ziqiang Dong +4Visual AttentionSelf-Attention

  5. Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks

    May 18, 2026Yajing Zhou, Xiangyu KongAudio-Visual UnderstandingVisual Spatial Reasoning

  6. Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs

    May 18, 2026Jun-Yu Pan, Yansen Wang, Enze Zhang +3EEG DecodingEEG-Based Visual Decoding

  7. Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

    May 18, 2026Xinpeng Dong, Min Zhang, Kairong Han +3Object Hallucination in VLMsMultimodal Large Language Models

  8. Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction

    May 18, 2026Jiahe Guo, Xiangran Guo, Jiaxuan Chen +6Multimodal Large Language ModelsLLM Safety

  9. A More Word-like Image Tokenization for MLLMs

    May 18, 2026Hyun Lee, Hyemin Jeong, Yejin Kim +4Image TokenizationEfficient VLM Inference

  10. DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

    May 18, 2026Wenzhuo Xu, Zhipeng Wei, Zonghao Ying +4Multimodal Large Language ModelsLLM Safety

  11. Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

    May 17, 2026Chaoqun He, Mingyang Xiang, Yingjing Xu +5Multimodal Large Language ModelsMultimodal Agents

  12. EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning

    May 17, 2026Zeyu Wang, Chang Liu, Eduardus Tjitrahardja +22Multimodal Large Language ModelsEgocentric Video Understanding

  13. CatalyticMLLM: A Graph-Text Multimodal Large Language Model for Catalytic Materials

    May 17, 2026Yanjie Li, Jian Xu, Xu-Yao Zhang +4Multimodal Large Language ModelsMaterials Property Prediction

  14. Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages

    May 16, 2026Firoj Alam, Shammur Absar Chowdhury, Enamul Hoque PrinceCross-Modal AlignmentMultimodal Large Language Models

  15. Navigating the Emotion Tree: Hierarchical Hyperbolic RAG for Multimodal Emotion Recognition

    May 16, 2026Zeheng Wang, Bo Zhao, Yijie Zhu +6Multimodal RAGHierarchical Classification

  16. Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models

    May 15, 2026Cheng Zhang, Yuer Liu, Zhiyu Zhou +2Feature AttributionMultimodal Large Language Models

  17. ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

    May 15, 2026Jiahui Guang, Haiyan Wang, Yingjie Zhu +4VLM UnlearningMultimodal Large Language Models

  18. Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

    May 13, 2026Trung Nguyen Quang, Yiming Gao, Fanyi Pu +3Multimodal GroundingMultimodal Large Language Models

  19. MILM: Large Language Models for Multimodal Irregular Time Series with Informative Sampling

    May 13, 2026Hsing-Huan Chung, Shijun Li, Yoav Wald +3Irregular Time-Series ModelingHealthcare

  20. Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

    May 13, 2026Qinwu Xu, Yifan Jiang, Haoyu RenMultimodal GroundingCoT Reasoning

  21. DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging

    May 13, 2026Zijing Wang, Mingyang Wang, Ercong Nie +6Multilingual Language ModelsMultimodal Large Language Models

  22. Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

    May 13, 2026Chao Hao, Jun Xu, Ji Du +6Text-Guided Image SegmentationPromptable Image Segmentation