Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

    May 25, 2026Bonan Ding, Umair Nawaz, Ufaq Khan +5Cross-Modal LearningMultimodal Large Language Models

  2. Prism: A Plug-in Reproducible Infrastructure for Scalable Multimodal Continual Instruction Tuning

    May 25, 2026Jun-Tao Tang, Yu-Cheng Shi, Zhen-Hao Xie +1Continual Learning for LLMsMultimodal Large Language Models

  3. AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution

    May 25, 2026Zehao Wang, Yihan Zeng, Zidong Gong +5RL for Language Model ReasoningMultimodal Large Language Models

  4. StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs

    May 25, 2026Yang Luo, Xinran Liu, Tiantian Ji +3Adversarial Attacks on VLMsLanguage Model Safety Evaluation

  5. MetaphorVU: Towards Metaphorical Video Understanding

    May 25, 2026Zhuoqun Li, Boxi Cao, Guiping Jiang +13VLM EvaluationFigurative Language Understanding

  6. BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

    May 25, 2026Zili Zhang, Chengxu Yang, Shenglong Zhang +8Deep Learning OptimizationMultimodal Large Language Models

  7. Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence

    May 25, 2026Yufei Zheng, Xuhan Zhu, Zide Liu +9Visual Spatial ReasoningMetric Depth Estimation

  8. Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models

    May 24, 2026Zhipeng Ye, Jiaqi Huang, Feng Jiang +5Efficient Multimodal InferenceMultimodal Large Language Models

  9. EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy

    May 23, 2026Jinzhao Li, Yinuo Chen, Dongxu Piao +9Spatial Reasoning BenchmarksLLM Evaluation

  10. Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

    May 22, 2026Haoyuan Wang, Xiaohao Liu, Jiajie Su +2Multimodal RobustnessAdversarial Robustness

  11. ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

    May 22, 2026Fen Wang, Zekai Shao, Qiman Kang +5Data VisualizationMultimodal Large Language Models

  12. Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis

    May 21, 2026Tomaso Trinci, Henrique Piñeiro Monteagudo, Leonardo TaccariMultimodal Large Language ModelsAutonomous Driving

  13. Do Factual Recall Mechanisms Carry over from Text to Speech in Multimodal Language Models?

    May 21, 2026Luca Modica, Filip Landin, Mehrdad Farahani +3Multimodal Large Language ModelsFactual Knowledge in Language Models

  14. Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

    May 21, 2026Changyuan Tian, Zhicong Lu, Huaxing Liu +7Multimodal Large Language ModelsMultimodal Reasoning

  15. LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

    May 21, 2026Yifan Dai, Zhenhua Wu, Bohan Zeng +18Cross-Modal LearningAudio-Visual Understanding

  16. MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

    May 21, 2026Dazhao Du, Liao Duan, Jian Liu +5Temporal Video GroundingMultimodal Large Language Models

  17. Seizure-Semiology-Suite (S3): A Clinically Multimodal Dataset, Benchmark, and Models for Seizure Semiology Understanding

    May 21, 2026Lina Zhang, Tonmoy Monsoor, Peizheng Li +23Video UnderstandingMultimodal Large Language Models

  18. Multimodal LLMs under Pairwise Modalities

    May 20, 2026Yan Li, Yunlong Deng, Yuewen Sun +3Cross-Modal LearningRepresentation Identifiability

  19. Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs

    May 20, 2026Leitao Yuan, Qinghua Mao, Daizong Liu +5Adversarial Attacks on VLMsMultimodal Large Language Models

  20. Stage-adaptive Token Selection for Efficient Omni-modal LLMs

    May 19, 2026Zijie Xin, Jie Yang, Ruixiang Zhao +4Efficient Multimodal InferenceMultimodal Large Language Models

  21. A Nash Equilibrium Framework For Training-Free Multimodal Step Verification

    May 19, 2026Rohit Sinha, Kunal Tilaganji, Tanuja Ganu +3Multi-View ConsistencyGame Theory

  22. AffectVerse: Emotional World Models for Multimodal Affective Computing

    May 19, 2026Bo Zhao, Fanghua Ye, Yixin Ji +3Cross-Modal LearningMultimodal Large Language Models

  23. Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning

    May 19, 2026Qinghe Ma, Zhen Zhao, Yiming Wu +3Multimodal Large Language ModelsMultimodal Reasoning

  24. LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue

    May 19, 2026Chaoyue Li, Yongxue Xu, Jie Feng +1Spatiotemporal ReasoningMultimodal Large Language Models

  25. MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems

    May 19, 2026Quanxing Xu, Yuhao Tian, Ling Zhou +4Visual Question AnsweringAutomated Software Testing

  26. Modality-Decoupled Online Recursive Editing

    May 19, 2026Siyuan Li, Youyuan Zhang, Fangming Liu +1Continual Learning for LLMsMultimodal Large Language Models