Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models

    Sep 28, 2026Jingdi lei, Junxian Li, Di Zhang +3Efficient Multimodal InferenceMultimodal Large Language Models

  2. OmniTide: Co-Designing Algorithms and Systems for Efficient On-Device Omni-LLM Streaming

    Sep 28, 2026Zongshang Shen, Wangsong Yin, Daliang Xu +2Efficient Multimodal InferenceOn-Device Language Model Inference

  3. Counterfactual Attention Policy Distillation for Temporal Video Grounding

    Sep 28, 2026Shaobo Ju, Haiyang Yu, Xuecheng Wu +5Temporal Video GroundingVLM Distillation

  4. MiCo: Mutual Information Coverage Optimization through Semantic Erasure Modeling for Efficient MLLM Inference

    Sep 28, 2026Tinghao Wang, Yichen Guo, Qizhe Zhang +11Efficient Multimodal InferenceMultimodal Large Language Models

  5. Uncovering Ordinal-Matching Bias in Audio-Visual LLMs

    Sep 28, 2026Jihoo Jung, Youngjoon Jang, Hyebin Cho +2Audio-Visual UnderstandingMultimodal Large Language Models

  6. PhysFieldBench: Can Multimodal Models Understand Physical Fields?

    Sep 28, 2026Yuezhou Ma, Huikun Weng, Jialong Wu +5Physical ReasoningMultimodal Large Language Models

  7. MetaSampling: Making Frame Samplers Efficient for Long-Video Question Answering

    Sep 27, 2026Ashim Dahal, Bikramjit BanerjeeMultimodal Large Language ModelsAdaptive Sampling

  8. One Attack to Fool Them All: Highly Transferable Black-Box Adversarial Attacks on Frontier MLLMs

    Sep 27, 2026Sen Nie, Jie Zhang, Zhongqi Wang +2Adversarial Attacks on VLMsAdversarial Attacks on LLMs

  9. Learning Multimodal Embeddings with Evidence-Aligned Readout

    Sep 27, 2026Zirong Chen, Fuda Ye, Enjun Du +8Multimodal Large Language ModelsMultimodal Embedding

  10. IVT-Guard: All-in-One Reasoning Model for AI-Generated Content Detection

    Sep 27, 2026Hongwei Niu, Yunpeng Luo, Hanjun Li +6AI-Generated Text DetectionMultimodal Large Language Models

  11. The Alignment Illusion in Multimodal Large Language Models

    Sep 24, 2026Hong-Han Wang, Yuntao Wang, Hu DingRepresentational Similarity AnalysisMultimodal Large Language Models

  12. Mind What Matters for Reasoning: Aligning Cross-Modal Attention via Selective Probability Mass Concentration

    Sep 24, 2026Jiaqi Deng, Zonghan Wu, Zhan Heng +3Multimodal GroundingMultimodal Large Language Models

  13. MoVISA: Multi-Token Reasoning for Video Object Segmentation

    Sep 24, 2026Ruining Zhao, Ho Kei Cheng, Alexander G SchwingVideo Object SegmentationReferring Video Object Segmentation

  14. DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs

    Sep 23, 2026Yingxuan Zhuang, Miao Pan, Wangjie Gan +6Multimodal Large Language ModelsVLM Hallucination Mitigation

  15. Pistis Technical Report

    Sep 23, 2026Heyun Chen, Xiaohan Lan, Jiaxi Li +17Multimodal Large Language ModelsMultimodal Reasoning

  16. BAS-OPD: Budget-Aware Selective On-Policy Self-Distillation for Fine-Grained Multimodal Perception

    Sep 22, 2026Zihan Chen, Hengguang Zhou, Yuan Kang +5VLM DistillationMultimodal Large Language Models

  17. LingLan: An Advancing Traditional Chinese Medicine Diagnosis LLM with Multimodal Data

    Sep 22, 2026Zheng Chen, Zhicheng Du, Haoxuan Li +2Medical DiagnosisMultimodal Large Language Models

  18. SLICEChat: Progressive In-Encoder Token Pruning for Whole-Slide Pathology Language Models

    Sep 21, 2026Ali Kerem Bozkurt, Baris Cem Bakay, Ibrahim Kulac +3Efficient Multimodal InferenceMultimodal Large Language Models

  19. Representation-guided in-context learning for medical image interpretation with multimodal large language models

    Sep 21, 2026Minda Zhao, Fangyu Hu, Yan Luo +8Medical Image AnalysisMultimodal Large Language Models

  20. Layer-Aware Position Embeddings for Visual Token Pruning in Multimodal Large Language Models

    Sep 20, 2026Yahong Wang, Zhangkai Ni, Juncheng Wu +3Efficient Multimodal InferenceMultimodal Large Language Models

  21. Fingerprinting Multimodal Large Language Models

    Sep 17, 2026Chao Huang, Meng Tong, Kejiang ChenLLM AuditingLanguage Model Fingerprinting

  22. QCPruner: Query-Conditioned Population Coverage for Visual Token Pruning

    Sep 17, 2026Shengli He, Yongchao Liang, Roumeng He +4Multimodal Large Language ModelsVisual Token Pruning

  23. Learn Before You Judge: Progressive Knowledge-to-Decision Alignment for Explainable Hateful Meme Detection

    Sep 17, 2026Bo Xu, Chenyuan Wang, Xinyu Chen +5Multimodal Large Language ModelsHate Speech Detection

  24. Multi-modal Knowledge Preserving Adapter for Embedding Backward Compatibility

    Sep 15, 2026Jaeseok Byun, Gukyeong Kwon, Han-Kai Hsu +4Multimodal Large Language ModelsAdapter Tuning