Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models

    Apr 18, 2026Biao Wu, Yiwu Zhong, Meng Fang +1Multimodal Large Language ModelsData Selection

  2. MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation

    Apr 18, 2026Bo Li, Ningyuan Deng, Tianyu Dong +3Fine-TuningVLM Adaptation

  3. PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging

    Apr 18, 2026Zibo Shao, Baochen Xiong, Xiaoshan Yang +4Cross-Modal LearningCross-Modal Alignment

  4. Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

    Apr 17, 2026Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti +2Spatial Reasoning BenchmarksVisual Spatial Reasoning

  5. MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

    Apr 17, 2026Manh Luong, Tamas Abraham, Junae Kim +6LLM Safety BenchmarksLanguage Model Safety Evaluation

  6. M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models

    Apr 17, 2026Joongmin Shin, Jeongbae Park, Jaehyung Seo +1Multimodal RAGDocument Chunking

  7. Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning

    Apr 17, 2026Xiaoyu Yang, En Yu, Wei Duan +1Multimodal RobustnessMultimodal Large Language Models

  8. Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

    Apr 16, 2026Ziyang Luo, Nian Liu, Junwei HanMultimodal Large Language ModelsMultimodal Reasoning

  9. FiRe: Fine-grained Multimodal Reasoning for Enhanced Image Generation

    Apr 15, 2026Yongjin Kim, Yoonjin Oh, Yerin Kim +5Controllable Image GenerationCompositional T2I Generation

  10. Can LLMs Reason About Attention? Towards Zero-Shot Analysis of Multimodal Classroom Behavior

    Apr 3, 2026Nolan Platt, Sehrish Nizamani, Alp Tural +5Multimodal Large Language Models

  11. ReLope: From Hidden-State Probing to a Decision Module for Multimodal LLM Routing

    Mar 25, 2026Yaopei Zeng, Congchao Wang, Blake JianHang Chen +1Multimodal Large Language ModelsLLM Routing

  12. HumanOmni-Speaker: Identifying Who said What and When

    Mar 23, 2026Detao Bai, Zhiheng Ma, Xihan WeiAudio-Visual UnderstandingVisual Speaker Recognition

  13. ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

    Mar 19, 2026Thomas De Min, Subhankar Roy, Stéphane Lathuilière +2Multimodal Large Language ModelsAI Agent Benchmarks

  14. HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

    Mar 19, 2026Dan Ben-Ami, Gabriele Serussi, Kobi Cohen +1Multimodal Large Language ModelsMultimodal QA

  15. CoMMET: A Psychologically Grounded Benchmark for Evaluating Theory of Mind in Multimodal LLMs

    Mar 12, 2026Ruirui Chen, Weifeng Jiang, Chengwei Qin +3Moral Reasoning in Language ModelsTheory of Mind

  16. Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding

    Mar 11, 2026Lin Chen, Bolin Ni, Qi Yang +5Multimodal Large Language ModelsLong-Context Modeling

  17. EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning

    Mar 10, 2026Chengjun Yu, Xuhan Zhu, Chaoqun Du +4Multimodal Large Language ModelsEgocentric Video Understanding

  18. Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches

    Mar 3, 2026Anum Afzal, Yuki Saito, Hiroya Takamura +5Language Model DecodingMultimodal Large Language Models

  19. EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

    Feb 27, 2026Yiyang Fang, Wenke Huang, Pei Fu +5Multimodal Large Language ModelsMultimodal Reasoning

  20. BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning

    Feb 25, 2026Mingi Kim, Yongjun Kim, Jungwoo Kang +1Multimodal Large Language Models

  21. Re-purposing Multimodal Large Language Models for Audio-Text Retrieval

    Feb 20, 2026Jilan Xu, Carl Thomé, Danijela Horak +2Multimodal Large Language ModelsAudio Understanding

  22. Beyond Pixels: A Vector-to-Graph Framework for Reliable Schematic Auditing

    Feb 12, 2026Chengwei Ma, Zhen Tian, Zhou Zhou +5Multimodal Large Language ModelsMultimodal Model Evaluation

  23. Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models

    Feb 6, 2026Haoyu Zhang, Zhipeng Li, Yiwen Guo +1Multimodal Large Language ModelsAudio-Driven Facial Animation