Multimodal Large Language Models

Also known as MLLM

Latest papers 669

All topics
CardsList
  1. RSJEV: Discriminative Remote Sensing Scene Classification with Multimodal Large Language Models

    Oct 6, 2026Dongchen Si, Di Wang, Mingzhen Xu +3Remote Sensing Image UnderstandingEfficient Multimodal Inference

  2. DIPrune: Task-Aware Token Pruning with Dual Importance for Efficient Multimodal Language Models

    Oct 6, 2026Shuo Yang, Changbai Li, Linlin Yang +6Multimodal Large Language ModelsToken Pruning

  3. VisionWeave: Weaving Elastic Visual Representations as a Native Capability of MLLMs

    Oct 6, 2026Yuan Feng, Qize Yang, Ruizhe Chen +9Efficient Multimodal InferenceMultimodal Large Language Models

  4. Two Vectors Replace In-Context Demos: Structured Task Adaptation via Embeddings

    Oct 6, 2026Xi Ding, Naichen Shi, Jiawei ZhangMultimodal ICLTask Vectors

  5. Harnessing Multimodal Large Language Models for Training-Free Human-Object Interaction Detection

    Oct 5, 2026Zhaolin Cai, Huiyu Duan, Liu Yang +5Multimodal Large Language ModelsActive Visual Perception

  6. Human-Like Attention? A Psychophysical Comparison of Visual Search in Humans and MLLMs

    Oct 4, 2026Renchi Zhang, Joost C. F. de Winter, Dimitra Dodou +2Multimodal Large Language ModelsVisual Search

  7. A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models

    Oct 4, 2026Yilin Yang, Jun-Tao Tang, Kengyi Wang +3VLM EvaluationMultimodal Large Language Models

  8. OmniConfess: Eliciting Token Confessions to Mitigate Omni-Modal Hallucination

    Oct 2, 2026Huiqiang Rong, Haoran Luo, Hui Feng +4Multimodal Large Language ModelsMultimodal Hallucination

  9. OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

    Oct 1, 2026Haibo Wang, Jiteng Mu, Jialu Li +5Audio-Visual UnderstandingRL for Language Model Reasoning

  10. Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes

    Oct 1, 2026Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc +2VLM DistillationMultimodal Large Language Models

  11. MWOP: Modality-aware Width-wise Operation Pruning for Efficient MLLMs

    Oct 1, 2026Xudong Wang, Hao Wu, Haozhe Hu +5LLM PruningEfficient VLM Inference

  12. HAWK: Rethinking Multimodal Drafting for Speculative Decoding

    Sep 30, 2026Wenhan Yang, Anirudh Rao, Ashwin ChandraEfficient Multimodal InferenceVLM Distillation

  13. Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis

    Sep 30, 2026Tian Xia, Minghao Liu, Yiqing Liang +2Medical DiagnosisMultimodal Large Language Models

  14. MM-FinEval: A Multi-Task Multimodal Benchmark for Real-World Financial Forecasting

    Sep 29, 2026Dong Shu, Yanguang Liu, Huopu Zhang +4Financial ForecastingMultimodal Large Language Models

  15. Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding

    Sep 29, 2026Jiayu Ying, Qijian Tian, Ruijie Xu +4Visual Question AnsweringMultimodal Large Language Models

  16. Why MLLMs Struggle to Count: Overcoming Individuation and Aggregation Bottlenecks with ConvStack

    Sep 29, 2026Liwei Che, Yihao Quan, Sen Fang +4Object CountingMultimodal Large Language Models

  17. OmniRoute: Mapping Temporal Semantic Evidence to Audio-Visual Token Budgets for Efficient Omnimodal Large Language Models

    Sep 29, 2026Yuchen Deng, Zidang Cai, Feidiao Yang +4Efficient Multimodal InferenceAudio Token Compression

  18. Calibrate the Decisions That Change the Future: On-Policy Post-Training Quantization for Multimodal Large Language Models

    Sep 29, 2026Wenxiao Fan, Jingling Fu, Lichen Ma +6LLM QuantizationVLM Quantization

  19. Seeing What Should Be Heard: Diagnosing and Repairing Cross-Modal Shortcuts in Omni-Modal LLMs

    Sep 29, 2026Yueran Ma, Ronghao LinAudio QAMultimodal Large Language Models

  20. Decoding Affective Nuances: Enhancing MLLMs via Hierarchical Emotion Reasoning and Contrastive Discriminative Pruning

    Sep 29, 2026Cheng Ye, Weidong Chen, Zhaobo Qi +2Multimodal Large Language ModelsMultimodal Emotion Recognition

  21. AdaKerNet: Neural Kernel Decoding for Task-Adaptive Prediction with Multimodal Large Models

    Sep 28, 2026Konstantinos D. Polyzos, Eleni Oikonomou, Tara JavidiMultimodal Large Language ModelsKernel Methods

  22. Render Before Reading: Visual Rendering as a Prompt Injection Defense

    Sep 28, 2026Jie Zhang, Andrei Baroian, Jan N. van Rijn +2Multimodal Large Language ModelsModality Gap in VLMs

  23. SPIDER: Multi-Layer Semantic Token Pruning and Adaptive Sub-Layer Skipping in Multimodal Large Language Models

    Sep 28, 2026Tianxiang Chen, Zhentao Tan, Zi Ye +9Efficient Multimodal InferenceTransformer

  24. Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models

    Sep 28, 2026Jingdi lei, Junxian Li, Di Zhang +3Efficient Multimodal InferenceMultimodal Large Language Models

  25. OmniTide: Co-Designing Algorithms and Systems for Efficient On-Device Omni-LLM Streaming

    Sep 28, 2026Zongshang Shen, Wangsong Yin, Daliang Xu +2Efficient Multimodal InferenceOn-Device Language Model Inference

  26. Counterfactual Attention Policy Distillation for Temporal Video Grounding

    Sep 28, 2026Shaobo Ju, Haiyang Yu, Xuecheng Wu +5Temporal Video GroundingVLM Distillation

  27. MiCo: Mutual Information Coverage Optimization through Semantic Erasure Modeling for Efficient MLLM Inference

    Sep 28, 2026Tinghao Wang, Yichen Guo, Qizhe Zhang +11Efficient Multimodal InferenceMultimodal Large Language Models

  28. Uncovering Ordinal-Matching Bias in Audio-Visual LLMs

    Sep 28, 2026Jihoo Jung, Youngjoon Jang, Hyebin Cho +2Audio-Visual UnderstandingMultimodal Large Language Models

  29. PhysFieldBench: Can Multimodal Models Understand Physical Fields?

    Sep 28, 2026Yuezhou Ma, Huikun Weng, Jialong Wu +5Physical ReasoningMultimodal Large Language Models

  30. MetaSampling: Making Frame Samplers Efficient for Long-Video Question Answering

    Sep 27, 2026Ashim Dahal, Bikramjit BanerjeeMultimodal Large Language ModelsAdaptive Sampling

  31. One Attack to Fool Them All: Highly Transferable Black-Box Adversarial Attacks on Frontier MLLMs

    Sep 27, 2026Sen Nie, Jie Zhang, Zhongqi Wang +2Adversarial Attacks on VLMsAdversarial Attacks on LLMs

  32. Learning Multimodal Embeddings with Evidence-Aligned Readout

    Sep 27, 2026Zirong Chen, Fuda Ye, Enjun Du +8Multimodal Large Language ModelsMultimodal Embedding

  33. IVT-Guard: All-in-One Reasoning Model for AI-Generated Content Detection

    Sep 27, 2026Hongwei Niu, Yunpeng Luo, Hanjun Li +6AI-Generated Text DetectionMultimodal Large Language Models

  34. The Alignment Illusion in Multimodal Large Language Models

    Sep 24, 2026Hong-Han Wang, Yuntao Wang, Hu DingRepresentational Similarity AnalysisMultimodal Large Language Models

  35. Mind What Matters for Reasoning: Aligning Cross-Modal Attention via Selective Probability Mass Concentration

    Sep 24, 2026Jiaqi Deng, Zonghan Wu, Zhan Heng +3Multimodal GroundingMultimodal Large Language Models

  36. MoVISA: Multi-Token Reasoning for Video Object Segmentation

    Sep 24, 2026Ruining Zhao, Ho Kei Cheng, Alexander G SchwingVideo Object SegmentationReferring Video Object Segmentation

  37. DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs

    Sep 23, 2026Yingxuan Zhuang, Miao Pan, Wangjie Gan +6Multimodal Large Language ModelsVLM Hallucination Mitigation

  38. Pistis Technical Report

    Sep 23, 2026Heyun Chen, Xiaohan Lan, Jiaxi Li +17Multimodal Large Language ModelsMultimodal Reasoning

  39. BAS-OPD: Budget-Aware Selective On-Policy Self-Distillation for Fine-Grained Multimodal Perception

    Sep 22, 2026Zihan Chen, Hengguang Zhou, Yuan Kang +5VLM DistillationMultimodal Large Language Models

  40. LingLan: An Advancing Traditional Chinese Medicine Diagnosis LLM with Multimodal Data

    Sep 22, 2026Zheng Chen, Zhicheng Du, Haoxuan Li +2Medical DiagnosisMultimodal Large Language Models

  41. SLICEChat: Progressive In-Encoder Token Pruning for Whole-Slide Pathology Language Models

    Sep 21, 2026Ali Kerem Bozkurt, Baris Cem Bakay, Ibrahim Kulac +3Efficient Multimodal InferenceMultimodal Large Language Models

  42. Representation-guided in-context learning for medical image interpretation with multimodal large language models

    Sep 21, 2026Minda Zhao, Fangyu Hu, Yan Luo +8Medical Image AnalysisMultimodal Large Language Models

  43. Layer-Aware Position Embeddings for Visual Token Pruning in Multimodal Large Language Models

    Sep 20, 2026Yahong Wang, Zhangkai Ni, Juncheng Wu +3Efficient Multimodal InferenceMultimodal Large Language Models

  44. Fingerprinting Multimodal Large Language Models

    Sep 17, 2026Chao Huang, Meng Tong, Kejiang ChenLLM AuditingLanguage Model Fingerprinting

  45. QCPruner: Query-Conditioned Population Coverage for Visual Token Pruning

    Sep 17, 2026Shengli He, Yongchao Liang, Roumeng He +4Multimodal Large Language ModelsVisual Token Pruning

  46. Learn Before You Judge: Progressive Knowledge-to-Decision Alignment for Explainable Hateful Meme Detection

    Sep 17, 2026Bo Xu, Chenyuan Wang, Xinyu Chen +5Multimodal Large Language ModelsHate Speech Detection

  47. Multi-modal Knowledge Preserving Adapter for Embedding Backward Compatibility

    Sep 15, 2026Jaeseok Byun, Gukyeong Kwon, Han-Kai Hsu +4Multimodal Large Language ModelsAdapter Tuning

  48. RegRet: Enhancing Region-Level Retrieval in Large Multimodal Models

    Sep 15, 2026Xun Liang, Honghui Yang, Weihang Pan +6Multimodal IRMultimodal Large Language Models

  49. ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training

    Sep 15, 2026Zhihao Zhang, Mingqi Wu, Qiaole Dong +15Fine-TuningMultimodal Large Language Models

  50. A multimodal large language model for evidence-based autism spectrum disorder screening

    Sep 15, 2026Jun Chen, Qi Zhao, Yunliang Jiang +8Autism Spectrum DisorderMultimodal Large Language Models