Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. UniData: Universal Multimodal Instruction Generation Pipeline

    Oct 8, 2026Jiaqi Tang, Yi-Feng Wu, Yuting Zhang +12Synthetic Data Generation for Language ModelsMultimodal Generation

  2. From Pixel to Coding: Evaluating the Figure Reproduction Capabilities of MLLMs

    Oct 7, 2026Zijian Chen, Zhengyu Chen, Bohan Liang +7Multimodal Large Language ModelsMultimodal Model Evaluation

  3. TiTok: Audio-Visual LLM for Multi-Segment Temporal Grounding

    Oct 7, 2026Eunji Shin, Dahyun Choi, Seungyeon Jo +2Multimodal GroundingMultimodal Large Language Models

  4. RSJEV: Discriminative Remote Sensing Scene Classification with Multimodal Large Language Models

    Oct 6, 2026Dongchen Si, Di Wang, Mingzhen Xu +3Remote Sensing Image UnderstandingEfficient Multimodal Inference

  5. DIPrune: Task-Aware Token Pruning with Dual Importance for Efficient Multimodal Language Models

    Oct 6, 2026Shuo Yang, Changbai Li, Linlin Yang +6Multimodal Large Language ModelsToken Pruning

  6. VisionWeave: Weaving Elastic Visual Representations as a Native Capability of MLLMs

    Oct 6, 2026Yuan Feng, Qize Yang, Ruizhe Chen +9Efficient Multimodal InferenceMultimodal Large Language Models

  7. Two Vectors Replace In-Context Demos: Structured Task Adaptation via Embeddings

    Oct 6, 2026Xi Ding, Naichen Shi, Jiawei ZhangMultimodal ICLTask Vectors

  8. Harnessing Multimodal Large Language Models for Training-Free Human-Object Interaction Detection

    Oct 5, 2026Zhaolin Cai, Huiyu Duan, Liu Yang +5Multimodal Large Language ModelsActive Visual Perception

  9. Human-Like Attention? A Psychophysical Comparison of Visual Search in Humans and MLLMs

    Oct 4, 2026Renchi Zhang, Joost C. F. de Winter, Dimitra Dodou +2Multimodal Large Language ModelsVisual Search

  10. A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models

    Oct 4, 2026Yilin Yang, Jun-Tao Tang, Kengyi Wang +3VLM EvaluationMultimodal Large Language Models

  11. OmniConfess: Eliciting Token Confessions to Mitigate Omni-Modal Hallucination

    Oct 2, 2026Huiqiang Rong, Haoran Luo, Hui Feng +4Multimodal Large Language ModelsMultimodal Hallucination

  12. OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

    Oct 1, 2026Haibo Wang, Jiteng Mu, Jialu Li +5Audio-Visual UnderstandingRL for Language Model Reasoning

  13. Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes

    Oct 1, 2026Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc +2VLM DistillationMultimodal Large Language Models

  14. MWOP: Modality-aware Width-wise Operation Pruning for Efficient MLLMs

    Oct 1, 2026Xudong Wang, Hao Wu, Haozhe Hu +5LLM PruningEfficient VLM Inference

  15. HAWK: Rethinking Multimodal Drafting for Speculative Decoding

    Sep 30, 2026Wenhan Yang, Anirudh Rao, Ashwin ChandraEfficient Multimodal InferenceVLM Distillation

  16. Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis

    Sep 30, 2026Tian Xia, Minghao Liu, Yiqing Liang +2Medical DiagnosisMultimodal Large Language Models

  17. MM-FinEval: A Multi-Task Multimodal Benchmark for Real-World Financial Forecasting

    Sep 29, 2026Dong Shu, Yanguang Liu, Huopu Zhang +4Financial ForecastingMultimodal Large Language Models

  18. Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding

    Sep 29, 2026Jiayu Ying, Qijian Tian, Ruijie Xu +4Visual Question AnsweringMultimodal Large Language Models

  19. Why MLLMs Struggle to Count: Overcoming Individuation and Aggregation Bottlenecks with ConvStack

    Sep 29, 2026Liwei Che, Yihao Quan, Sen Fang +4Object CountingMultimodal Large Language Models

  20. OmniRoute: Mapping Temporal Semantic Evidence to Audio-Visual Token Budgets for Efficient Omnimodal Large Language Models

    Sep 29, 2026Yuchen Deng, Zidang Cai, Feidiao Yang +4Efficient Multimodal InferenceAudio Token Compression

  21. Calibrate the Decisions That Change the Future: On-Policy Post-Training Quantization for Multimodal Large Language Models

    Sep 29, 2026Wenxiao Fan, Jingling Fu, Lichen Ma +6LLM QuantizationVLM Quantization

  22. Seeing What Should Be Heard: Diagnosing and Repairing Cross-Modal Shortcuts in Omni-Modal LLMs

    Sep 29, 2026Yueran Ma, Ronghao LinAudio QAMultimodal Large Language Models

  23. Decoding Affective Nuances: Enhancing MLLMs via Hierarchical Emotion Reasoning and Contrastive Discriminative Pruning

    Sep 29, 2026Cheng Ye, Weidong Chen, Zhaobo Qi +2Multimodal Large Language ModelsMultimodal Emotion Recognition

  24. AdaKerNet: Neural Kernel Decoding for Task-Adaptive Prediction with Multimodal Large Models

    Sep 28, 2026Konstantinos D. Polyzos, Eleni Oikonomou, Tara JavidiMultimodal Large Language ModelsKernel Methods

  25. Render Before Reading: Visual Rendering as a Prompt Injection Defense

    Sep 28, 2026Jie Zhang, Andrei Baroian, Jan N. van Rijn +2Multimodal Large Language ModelsModality Gap in VLMs

  26. SPIDER: Multi-Layer Semantic Token Pruning and Adaptive Sub-Layer Skipping in Multimodal Large Language Models

    Sep 28, 2026Tianxiang Chen, Zhentao Tan, Zi Ye +9Efficient Multimodal InferenceTransformer