Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

    Jul 17, 2026Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19Audio-Visual UnderstandingMultimodal Large Language Models

  2. IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models

    Jul 17, 2026Xiuyuan Zhu, Ke Lu, Hao Wu +4Cross-Modal Knowledge DistillationMultimodal Large Language Models

  3. SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

    Jul 17, 2026Bibesh Pyakurel, M. G. Sarwar MurshedBiometric IdentificationMultimodal Large Language Models

  4. Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

    Jul 16, 2026Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu +6Visual Question AnsweringVisual Spatial Reasoning

  5. Assessing AI in Introductory Physics Problem Solving

    Jul 15, 2026Amir Bralin, N. Sanjay RebelloLLM EvaluationMultimodal Large Language Models

  6. Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild

    Jul 15, 2026Ting Lei, Jialin Liu, Zhu Xu +2Multimodal Large Language ModelsMultimodal Agents

  7. Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

    Jul 15, 2026Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang +53D Spatial Reasoning3D Medical Imaging

  8. Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

    Jul 15, 2026Zhixiao Zheng, Zheren Fu, Zhiyuan Yao +3Multimodal GroundingMultimodal Large Language Models

  9. Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

    Jul 14, 2026Kaiwen Zheng, Junchen Fu, Wenhao Deng +3Efficient Multimodal InferenceMultimodal Large Language Models

  10. Segregate, Refine, Integrate: Decomposing Multimodal Fusion for Sentiment Analysis

    Jul 14, 2026Alexios Filippakopoulos, Elias Kallioras, Nikolaos Xiros +2Cross-Modal Representation LearningMultimodal Large Language Models

  11. Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning

    Jul 13, 2026Jing Liu, Chenxuanyin Zou, Jiayang Ren +5Multimodal Federated LearningGenerative Replay

  12. Lesioned Multimodal Language Models Reproduce Aphasic Picture-Naming Patterns

    Jul 13, 2026Yong Yang, Xiang Guan, Sophie Arheix-Parras +7Multimodal Large Language ModelsLanguage Modeling

  13. Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis

    Jul 11, 2026Shihao Yuan, Yuanze Li, Ruyi Zhang +2VLM AdaptationMultimodal Large Language Models

  14. Multimodal Reward Hacking in Reinforcement Learning

    Jul 10, 2026Jiayu Yao, Yiwei Wang, Anmeng Zhang +5Multimodal Large Language ModelsMultimodal Reward Modeling

  15. Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

    Jul 9, 2026Dominick Reilly, Qiyu Wu, Hiromi Wakaki +2Missing-Modality LearningCross-Modal Representation Learning

  16. Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

    Jul 9, 2026Yiyang Fang, Pei Fu, Jinjie Li +7Efficient Multimodal InferenceRL for Language Model Reasoning

  17. GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

    Jul 8, 2026Kartik Bali, Mahish K. Guru, Christian J Cyron +1Multimodal GroundingMultimodal Large Language Models

  18. GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model

    Jul 8, 2026Peter Bohm, Saimunur Rahman, Abdelwahed Khamis +3VLM AdaptationRobot Navigation

  19. POPS: Recovering Unlearned Multi-Modality Knowledge in MLLMs with Prompt-Optimized Parameter Shaking

    Jul 7, 2026Zhangheng LI, Jianing Zhu, Junyuan Hong +4Multimodal Large Language ModelsPrivacy Leakage in Language Models

  20. Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

    Jul 7, 2026Zhiwei Yang, Yuanchen Wu, Nan Zhang +3Multimodal Large Language ModelsMultimodal CoT Reasoning

  21. BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension

    Jul 6, 2026Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed +8Document UnderstandingLLM Evaluation

  22. Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis

    Jul 6, 2026Zhipeng Xu, Zulong Chen, Qing Liu +6Synthetic Data GenerationDocument Information Extraction

  23. Attending to Multimodal Generation One Token at a Time

    Jul 4, 2026Varun Gupta, Vineet Gandhi, Makarand TapaswiMultimodal Large Language ModelsMultimodal Generation