Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?

    Jul 31, 2026Wenzhuo Zhao, Xiuzhi Li, Zhongkuan Mao +6VLM EvaluationSalient Object Detection

  2. CAER: Conflict-Aware Evidence Routing with Dual Prefix Experts for Multimodal Large Language Models

    Jul 31, 2026Zixuan Liu, Juntao Cai, Xiaoxu Cai +2Mixture of ExpertsMultimodal Large Language Models

  3. SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

    Jul 31, 2026Jian Yu, Fei Shen, Cong Wang +5Multimodal RobustnessMultimodal Large Language Models

  4. Performance of large language models in the optical diagnosis of colorectal polyps

    Jul 31, 2026Joshua C. Vences, William T. Tran, Nikko Gimpaya +15EndoscopyMultimodal Large Language Models

  5. Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

    Jul 30, 2026Jie Ma, Zhike Qiu, Jie Gao +4Efficient Multimodal InferenceMultimodal Large Language Models

  6. MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware

    Jul 30, 2026Xianpeng Zhang, Jiahua Yang, Dongyu Chen +7Multimodal Large Language ModelsMultimodal Model Evaluation

  7. FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval

    Jul 30, 2026Bohan Hou, Haoqiang Lin, Xuemeng Song +4Fine-Grained Image RetrievalMultimodal Large Language Models

  8. One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

    Jul 30, 2026Enyi Shi, Fei Shen, Chuancheng Shi +4VLM RobustnessMultimodal Large Language Models

  9. MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

    Jul 30, 2026Jinpeng Hu, Erqiang Wang, Shan Wang +4Mental HealthMultimodal Large Language Models

  10. Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis

    Jul 30, 2026Wei Chen, Junkai Li, Tongguan Wang +4Multimodal Large Language ModelsMultimodal Classification

  11. Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

    Jul 30, 2026Fexiang Liu, Shiye Wang, Qiang Qiu +1VLM EvaluationMultimodal Large Language Models

  12. MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models

    Jul 30, 2026Wenjie Zhu, Yabin Zhang, Wenjun Zeng +1VLM RobustnessMultimodal Large Language Models

  13. Progressive Multimodal Alignment for Continual Instruction Tuning

    Jul 29, 2026Duzhen Zhang, Yahan Yu, Qiaoyi Su +2Cross-Modal AlignmentMultimodal Large Language Models

  14. Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs

    Jul 29, 2026Vahidin Hasic, Chao Wang, Luis C. Garcia-Peraza-Herrera +2Multimodal Large Language ModelsMultimodal Model Interpretability

  15. Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs

    Jul 29, 2026Farhan Farsi, Shayan Bali, Mohammad Heydari Rad +2Gender Bias in Language ModelsMultimodal Large Language Models

  16. Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

    Jul 28, 2026Jiaang Li, Chengzu Li, Zhaochong An +4VLM EvaluationMultimodal Large Language Models

  17. SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

    Jul 28, 2026Yuchen Wang, Qihui Zhu, Yang Liu +2Efficient Multimodal InferenceMultimodal Large Language Models

  18. OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

    Jul 28, 2026Haoyang Huang, Wenjie Huang, Tianqi Xu +14Efficient Multimodal InferenceAudio Token Compression

  19. FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding

    Jul 28, 2026Ghazal Kaviani, Ghassan AlRegibEfficient Multimodal InferenceMultimodal Large Language Models

  20. Rethinking CD: A Reproducibility Study and Extension on the Ineffectiveness of Contrastive Decoding at Mitigating Object Hallucinations in MLLMs

    Jul 28, 2026Arnav Bendre, Guneesh Gupta, Kavish Grover +2Object Hallucination in VLMsMultimodal Large Language Models

  21. LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos

    Jul 27, 2026Ce Zhang, Jinxi He, Katia Sycara +1Multimodal Large Language ModelsLong-Video Understanding

  22. Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

    Jul 27, 2026Xi Li, Shu Zhao, Xiaohan Zou +6Adversarial Attacks on VLMsMultimodal Large Language Models

  23. RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models

    Jul 27, 2026Qihui Zhu, Yuchen Wang, Zijian Wen +7Multimodal Large Language ModelsSelf-Distillation

  24. Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

    Jul 27, 2026Tianyi Gao, Han Fang, Tianyi Ding +9Multimodal GroundingMultimodal Large Language Models

  25. Disentangling Semantic Attention from Structural Bias in the Attention Manifold

    Jul 27, 2026Pengkun Jiao, Bin Zhu, Jingjing Chen +1Object Hallucination in VLMsMultimodal Large Language Models