Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs

    Aug 31, 2026Jingyi He, Sanghwan Kim, Zeynep AkataEfficient Multimodal InferenceMultimodal Large Language Models

  2. TUE-Detector: A Tool-Using Expert MLLM-Based Detector for AI-Generated Videos

    Aug 31, 2026Yichen Wu, Haoxuan Qu, Yongxing Dai +5Multimodal Large Language ModelsDeepfake Detection

  3. Foundation and Multimodal Large Language Models for Face Presentation and Morph Attack Detection

    Aug 30, 2026Hatef Otroshi Shahreza, Asif Hussain Khan, Peter Lorenz +2Image Forgery DetectionVision Foundation Model Adaptation

  4. Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning

    Aug 29, 2026Zhaolu Kang, Meixin Wu, Yu Xue +6Multimodal RobustnessMultimodal Large Language Models

  5. Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

    Aug 13, 2026Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera +1Supervised Fine-TuningMultimodal Large Language Models

  6. TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos

    Aug 13, 2026Yifan Mei, Qingling Shi, Changli Wu +3Sports Video AnalysisMultimodal Large Language Models

  7. Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

    Aug 13, 2026Xinming Wang, Weinong Wang, Hongming Yang +13RL for Language ModelsLLM Alignment

  8. MAG: MAnifold Guided Semi-Supervised Multi-modal In-Context Learning

    Aug 13, 2026Zirui Cheng, Xun Xu, Tiankai Chen +7In-Context Example SelectionMultimodal ICL

  9. Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

    Aug 12, 2026Byungoh Ko, Jinyoung Park, Jongha Kim +3Direct Preference OptimizationObject Hallucination in VLMs

  10. AWARe: Mitigating Catastrophic Forgetting via Activation-Weighted Adaptive REtention

    Aug 12, 2026Juncheng Liao, Jinfan Lv, Guoming Wang +3Continual Learning for LLMsLLM Fine-Tuning

  11. Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

    Aug 12, 2026Haoyu Zhang, Shuoxun Zhang, Peng Ye +5Visual Question AnsweringMulti-Agent LLM Systems

  12. LEMUR: Latent Entropy-aware Multimodal Unlearning via Visual-anchored Reasoning Redirection

    Aug 12, 2026Xinhao Zhong, Yuxia Qiao, Junhao Li +3VLM UnlearningMultimodal Large Language Models

  13. MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

    Aug 11, 2026Changhao Xiang, Shangyu Xing, Zhen Wu +2Multimodal GroundingMultimodal Pretraining

  14. VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

    Aug 11, 2026Rohit Sinha, Kunal Tilaganji, Tanuja Ganu +3Multimodal Large Language ModelsMultimodal CoT Reasoning

  15. Hallucination-Free GUI Grounding via Regression-Free Layout-Aware Matching

    Aug 10, 2026Yuke Li, Xuehan HouGUI GroundingMultimodal Large Language Models

  16. Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models

    Aug 10, 2026Puneet Mathur, Manan Suri, Dinesh ManochaEfficient Multimodal InferenceMultimodal Memory

  17. Improving Generalization Robustness of Multimodal RLVR

    Aug 9, 2026Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng +11Multimodal RobustnessMultimodal Large Language Models

  18. Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

    Aug 9, 2026Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim +1Efficient Multimodal InferenceAudio Token Compression

  19. FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models

    Aug 9, 2026Kaili Zheng, Kaiwen Wang, Xun Zhu +3Multimodal Large Language ModelsAction Quality Assessment

  20. Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation

    Aug 9, 2026Kaichen Zhang, Wei Huang, Keming Wu +2Efficient Multimodal InferenceMultimodal Large Language Models

  21. NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs

    Aug 8, 2026Jiayue Jin, Jingwei Zhang, Chen Wang +2Multimodal Large Language ModelsMultimodal Instruction Tuning

  22. TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents

    Aug 8, 2026Zhongheng Zhou, Yi Sun, Huiguo He +6Multimodal Large Language ModelsOptical Character Recognition

  23. An AI4AI Framework for Visual Token Pruning

    Aug 7, 2026Zhen Liu, Wenli Huang, Wei Song +3Automated Algorithm DiscoveryEfficient VLM Inference

  24. LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

    Aug 7, 2026Ivan Majic, Zexian Huang, Franziska Hübl +5Cross-Modal AlignmentMultimodal Large Language Models

  25. Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

    Aug 7, 2026Chen Ling, Hanqian Li, Dongnan Liu +9Cross-Modal LearningVisual Reasoning