Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Reliability-Prioritized Fine-Grained Generation in Multimodal Large

    Jun 28, 2026Xiaomeng Fan, Wei Wu, Yuwei Wu +9Direct Preference OptimizationMultimodal Large Language Models

  2. Enhancing Part-Level Point Grounding for Any Open-Source MLLMs

    Jun 28, 2026Jin-Cheng Jhang, Fu-En Wang, Xin Yang +4Multimodal Large Language ModelsVision-Language Grounding

  3. Low-cost concept-based localized explanations: How far can we get with training-free approaches?

    Jun 27, 2026Darian Fernández-Gutiérrez, Rafael Bello, Marilyn Bello +1VLM EvaluationZero-Shot Learning

  4. Personalizing MLLMs via Reinforced Multimodal Reference Game

    Jun 27, 2026Deepayan Das, Davide Talon, Yiming Wang +2Multimodal Large Language ModelsPersonalized Language Models

  5. RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

    Jun 26, 2026Yelin Wang, Zijia Song, Shuo Ye +6Remote Sensing Image UnderstandingVLM Adaptation

  6. Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

    Jun 26, 2026Hohin Kwan, Hongyu Li, Ray Zhang +5VLM EvaluationMultimodal Large Language Models

  7. MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy

    Jun 26, 2026Zhiyuan Han, Beier Zhu, Wenwen Tong +8RL for Language Model ReasoningMultimodal Large Language Models

  8. Fine-tuning a multimodal large language model for clinician-grade autism behavioral scoring from short home videos

    Jun 25, 2026Mohammadmahdi Honarmand, Parnian Azizian, Aaron Kline +9Autism Spectrum DisorderLLM Fine-Tuning

  9. Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models

    Jun 25, 2026Shravan Venkatraman, Ritesh Thawkar, Omkar Thawakar +4Multimodal Large Language ModelsVLM Reasoning

  10. TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

    Jun 25, 2026Tinghao Wang, Yichen Guo, Rui Huang +11Efficient VLM InferenceMultimodal Large Language Models

  11. Event-Aware Instructed Assistant for Referring Video Segmentation

    Jun 25, 2026Jinyu Liu, Henghui Ding, Shuting He +1Referring Video Object SegmentationMultimodal Large Language Models

  12. Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

    Jun 25, 2026Mengzhao Wang, Yanli Ji, Wangmeng Zuo +2Efficient Multimodal InferenceKV Caching

  13. DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

    Jun 25, 2026Geng Li, Yuxin PengVisual ReasoningMultimodal Large Language Models

  14. What We are Missing in Multimodal LLM Evaluation?

    Jun 24, 2026Po-han Li, Shenghui Chen, Sandeep Chinchali +1Spatiotemporal ReasoningMultimodal Large Language Models

  15. From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

    Jun 24, 2026Haoxiang Sun, Tao Wang, Li Yuan +2Vision-Language ModelsMultimodal Large Language Models

  16. ShutterMuse: Capture-Time Photography Guidance with MLLMs

    Jun 24, 2026Jiayu Li, Yixiao Fang, Tianyu Hu +5VLM EvaluationMultimodal Large Language Models

  17. Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding

    Jun 24, 2026Baiyang Song, Yuli Lin, Qiong Wu +5Streaming Video UnderstandingMultimodal Large Language Models

  18. Are We There Yet? Exploring the Capabilities of MLLMs in Assistive AI Applications

    Jun 23, 2026Shayon Dasgupta, Avijit Dasgupta, C. V. JawaharVLM EvaluationScene Text Recognition

  19. IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

    Jun 23, 2026Zixuan Li, Haokun Lin, Yicheng Xiao +10T2I GenerationMultimodal Large Language Models

  20. ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

    Jun 23, 2026Zhentao Guo, Chen Duan, Tongkun Guan +3Multimodal Large Language ModelsVideo QA

  21. Curvature-Guided Mixing for MLLM Adaptation

    Jun 23, 2026Jinglong Yang, Jiaxuan He, Wenjian Huang +2VLM AdaptationMultimodal Large Language Models

  22. ActiveScope: Actively Seeking and Correcting Perception for MLLMs

    Jun 23, 2026Yajing Wang, Chao Bi, Junshu Sun +4Multimodal Large Language ModelsVision-Language Grounding

  23. AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

    Jun 23, 2026Yijing Chen, Wenhui Tan, Xiaoyi Yu +7Audio-Visual UnderstandingMultimodal Large Language Models

  24. Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling

    Jun 23, 2026Kun Zhang, Chenxin Fang, Tao Chen +4Efficient Multimodal InferenceMultimodal Large Language Models

  25. Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

    Jun 23, 2026Bin Chen, Yuxiang Cai, Yadan Luo +3Efficient Multimodal InferenceMultimodal Large Language Models

  26. Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

    Jun 23, 2026Zengjie Chen, Yuxiang Cai, Jingcai Guo +3Efficient VLM InferenceMultimodal Large Language Models