Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Group Preference Collapse in Personalized Multimodal Large Language Models

    Jun 12, 2026Fan Lyu, Wenqi Zhang, Joost van de WeijerMultimodal Large Language ModelsPersonalized Language Models

  2. IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products

    Jun 12, 2026Haonan Qi, Jin Cao, Yongqi Zhang +9Multimodal Large Language ModelsMultimodal Model Evaluation

  3. When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

    Jun 12, 2026Yinfeng Wang, Zhiyuan Yao, Zheren Fu +2VLM RobustnessMultimodal Large Language Models

  4. MLUBench: A Benchmark for Lifelong Unlearning Evaluation in MLLMs

    Jun 11, 2026He Li, Haoang Chi, Qizhou Wang +6VLM UnlearningMultimodal Large Language Models

  5. GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models

    Jun 10, 2026Garvita Allabadi, Matteo Sodano, Roberto Estevão +4Multimodal ICLMultimodal Large Language Models

  6. Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening

    Jun 10, 2026Qingfeng Zhang, Yuanxiong Guo, Yanmin GongAlzheimer's DiseaseMultimodal Large Language Models

  7. LLM-Powered Personalized Glycemic Assessment in Type 2 Diabetes with Wearable Sensor Data

    Jun 10, 2026Yifan Gao, Yanmin Gong, Yun Shi +1Type 1 DiabetesTime Series Forecasting

  8. How Seemingly Inconsequential Design Choices Dictate Performance of LLMs in Pathology

    Jun 10, 2026Kian R. Weihrauch, Thomas A. Buckley, William Lotter +1Multimodal Large Language ModelsHistopathology Image Classification

  9. MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification

    Jun 10, 2026Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang +3Multimodal Large Language Models

  10. Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

    Jun 10, 2026Biao Tang, Xu Chen, Shuxiang Gou +3Multimodal Large Language ModelsLong-Video Understanding

  11. Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

    Jun 10, 2026Tianhao Chen, Yuheng Wu, Kelu Yao +3KV CachingMultimodal Large Language Models

  12. Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

    Jun 10, 2026Michal Chudoba, Sergey Alyaev, Petra Galuscakova +1LLM Fine-TuningMultimodal Large Language Models

  13. Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning

    Jun 10, 2026Zhirui Chen, Ziwei Chen, Ling ShaoMemory-Augmented Language ModelsMultimodal ICL

  14. Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning

    Jun 10, 2026Enhan Zhao, Wei Wu, Yuanrui Zhang +23D Spatial ReasoningSynthetic Data Generation

  15. DeceptionX: Explainable Deception Detection with Multimodal Large Language Models

    Jun 9, 2026Jiayu Zhang, Shuo Ye, Jiajian Huang +7Multimodal Large Language ModelsMultimodal Reasoning

  16. Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

    Jun 9, 2026Miaoxin Cai, Guanqun Wang, Wei Zhang +6Remote Sensing Image UnderstandingMultimodal Grounding

  17. CoCoSI: Collaborative Cognitive Map Construction for Spatial Intelligence

    Jun 9, 2026Yiming Zhang, Ruoxuan Cao, Zhihang ZhongMultimodal Large Language ModelsMulti-Agent LLMs

  18. From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs

    Jun 8, 2026Wish Suharitdamrong, Muhammad Awais, Xiatian Zhu +1Efficient Multimodal InferenceMultimodal Large Language Models

  19. Reason Twice: Segmentation via Candidate Discovery and Comparative Reasoning

    Jun 8, 2026Xinyan Gao, Haoran Hao, Xiangyu YueImage SegmentationText-Guided Image Segmentation

  20. Symbolic and Abstractive Reasoning with Complex Visual Queries

    Jun 8, 2026Yichi Zhang, Jingdian Lu, Zhuo Chen +4Visual ReasoningSynthetic Data Generation

  21. Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation

    Jun 8, 2026Siyuan Liu, Jinyang WuEfficient Multimodal InferenceMultimodal Large Language Models

  22. Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges

    Jun 8, 2026Tiejin Chen, Pingzhi Li, Kaixiong Zhou +2Multimodal Large Language ModelsPrivacy Leakage in Language Models

  23. CRANE: Knowledge Editing for Reasoning MLLMs

    Jun 8, 2026Han Huang, Hao Wang, Mengqi Zhang +3Knowledge EditingKnowledge Conflicts in Language Models

  24. NutriMLLM: Multimodal Large Language Models for Dietary Micronutrient Analysis

    Jun 8, 2026Runze Yan, Minxiao Wang, Jiaying Lu +3Multimodal Large Language Models

  25. TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

    Jun 7, 2026Lianyu Hu, Xiaoyu Ma, Zeqin Liao +1Multimodal Large Language ModelsMultimodal Reasoning

  26. When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

    Jun 6, 2026Yiheng Wang, Yueqian Lin, Lichen Zhu +3Multimodal Large Language ModelsQuestion Answering