Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. MILM: Large Language Models for Multimodal Irregular Time Series with Informative Sampling

    May 13, 2026Hsing-Huan Chung, Shijun Li, Yoav Wald +3Irregular Time-Series ModelingHealthcare

  2. Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

    May 13, 2026Qinwu Xu, Yifan Jiang, Haoyu RenMultimodal GroundingCoT Reasoning

  3. DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging

    May 13, 2026Zijing Wang, Mingyang Wang, Ercong Nie +6Multilingual Language ModelsMultimodal Large Language Models

  4. Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

    May 13, 2026Chao Hao, Jun Xu, Ji Du +6Text-Guided Image SegmentationPromptable Image Segmentation

  5. Beyond Localization: A Comprehensive Benchmark of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images

    May 12, 2026Yuangong Chen, Wai Keung Wong, Jiaxing Li +2Spatial Reasoning BenchmarksVisual Spatial Reasoning

  6. Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models

    May 12, 2026Yanting Miao, Yutao Sun, Dexin Wang +8Multimodal Large Language ModelsLatent Visual Reasoning

  7. Towards Automated Air Traffic Safety Assessment Around Non-Towered Airports Using Large Language Models

    May 12, 2026Torsten Darrell, Mahyar Ghazanfari, Jordan Kam +3Air Traffic ManagementMultimodal Large Language Models

  8. OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

    May 12, 2026Yuchen Deng, Zidang Cai, Hai-Tao Zheng +3Audio-Visual UnderstandingEfficient Multimodal Inference

  9. Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training

    May 12, 2026Qihuang Zhong, Liang Ding, Wenjie Xuan +3Multimodal Large Language ModelsMultimodal Reasoning

  10. UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs

    May 12, 2026Houcheng Jiang, Jiajun Fu, Junfeng Fang +4Efficient Multimodal InferenceMultimodal Large Language Models

  11. SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

    May 12, 2026Xinyi Zeng, Xue Yang, Jingyuan Zhang +5Adversarial Attacks on VLMsMultimodal Robustness

  12. Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

    May 12, 2026Abid Ali, Diego Molla-Aliod, Usman NaseemLLM EvaluationMultimodal Large Language Models

  13. Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration

    May 12, 2026Mingtao Xian, Yifeng Yang, Qinying Gu +2Multimodal Large Language ModelsCross-Modal Retrieval

  14. When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs

    May 12, 2026Fanpu Cao, Xin Zou, Xuming Hu +1Hallucination Detection in VLMsHallucination in Language Models

  15. LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs

    May 12, 2026Jingfeng Chen, Jiawen Qian, Wendi Deng +5Efficient VLM InferenceMultimodal Large Language Models

  16. LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

    May 11, 2026Xueqi Cheng, Yushun DongEfficient Multimodal InferenceMultimodal Large Language Models

  17. Personal Visual Context Learning in Large Multimodal Models

    May 11, 2026Zihui Xue, Ami Baid, Sangho Kim +2Vision-Language ModelsMultimodal Large Language Models

  18. Count Anything at Any Granularity

    May 11, 2026Chang Liu, Haoning Wu, Weidi XieObject CountingMultimodal Large Language Models

  19. Probing Cross-modal Information Hubs in Audio-Visual LLMs

    May 11, 2026Jihoo Jung, Chaeyoung Jung, Ji-Hoon Kim +1Cross-Modal LearningMultimodal Large Language Models

  20. Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning

    May 11, 2026Tao Hu, Da-Wei ZhouCross-Modal LearningContinual Learning for LLMs

  21. Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model

    May 11, 2026David F. Ramirez, Tim Overman, Kristen Jaskie +1Remote Sensing Image UnderstandingVisual Question Answering

  22. Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

    May 11, 2026Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada +7LLM AuditingMultimodal Large Language Models

  23. Phoenix-VL 1.5 Medium Technical Report

    May 11, 2026Team Phoenix, :, Arka Ray +30Multilingual Language ModelsDomain Adaptation

  24. SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation

    May 11, 2026Longteng Guo, Xuanxu Lin, Dongze Hao +5Multimodal Large Language ModelsScientific QA

  25. MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph

    May 11, 2026Manyu Li, Ruian He, Chenxi Ma +2Multimodal RAGVisual Question Answering

  26. ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

    May 11, 2026Tingshu Mou, Jiabo He, Renying Wang +5Visual Spatial Reasoning3D Spatial Reasoning