Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

    Jul 4, 2026Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain +2Sign Language TranslationMultimodal Large Language Models

  2. OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

    Jul 3, 2026Shijie Cao, Qingyu Zhang, Boxi Yu +6Efficient Multimodal InferenceMultimodal Large Language Models

  3. GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

    Jul 3, 2026Fang Liu, Jinpeng Chen, Ke Xu +7VLM EvaluationStreaming Video Understanding

  4. CL-Anomaly: Layer-Adaptive Mixture-of-Experts with Multimodal Large Language Model for Continual Learning in Anomaly Detection

    Jul 3, 2026Wen Dong, Zhao Wang, Shuangqing Zhang +5Mixture of ExpertsMultimodal Large Language Models

  5. ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

    Jul 3, 2026Peiming Li, Yifan Wang, Xiaotian Zhang +4Multimodal Large Language ModelsLatent Visual Reasoning

  6. Gemma 4 Technical Report

    Jul 2, 2026Gemma Team, Sherif El Abd, Vaibhav Aggarwal +298Efficient Multimodal InferenceUnified Multimodal Models

  7. K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

    Jul 2, 2026Khush Attarde, Yusuf Ali, Megha Thukral +3Video UnderstandingMultimodal Large Language Models

  8. EAGLE-360: Embodied Active Global-to-Local Exploration in 360∘^\circ

    Jul 2, 2026Jingtao Xu, Zizhuo Lin, Jianwen Sun +2Multimodal Large Language Models

  9. InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories

    Jul 2, 2026Qianyu Chen, Ziteng Feng, Canran Xiao +1Continual Learning for LLMsMemory-Efficient Fine-Tuning

  10. Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing

    Jul 2, 2026Siyuan Li, Youyuan Zhang, Ruitong Liu +2Knowledge EditingMultimodal Large Language Models

  11. Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation

    Jul 1, 2026Jaehyun Jang, Eunseop Yoon, Hee Suk Yoon +3Cross-Modal Knowledge DistillationVLM Distillation

  12. Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

    Jul 1, 2026Shijie Li, Yilin Gao, Siyuan Yang +7Multimodal Large Language ModelsLatent Visual Reasoning

  13. Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

    Jul 1, 2026Yoonhyung Park, Minji Kim, Sungwon Moon +1Visuo-Tactile Representation LearningMultimodal Large Language Models

  14. Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners

    Jun 30, 2026Yunhan Wang, Eshika Khandelwal, Edson Araujo +3Multimodal Large Language ModelsFew-Shot Prompting

  15. ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

    Jun 30, 2026Yuhao Wang, Mu Qiao, Haiwen Diao +5Efficient VLM InferenceMultimodal Large Language Models

  16. Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference

    Jun 30, 2026Zhaoyang Luo, Runmin Dong, Miao Yang +4Efficient VLM InferenceMultimodal Large Language Models

  17. UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

    Jun 30, 2026Yaozhi Zheng, Yilei Jiang, Manyuan Zhang +5RL for Code GenerationReinforcement Learning

  18. MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

    Jun 30, 2026Zhongyang Li, Yaqian Li, Faming Fang +6Multimodal Large Language ModelsMultimodal Fusion

  19. Learning to Deny: Action Denial in Multimodal Large Language Models

    Jun 30, 2026Raiyaan Abdullah, Shehreen Azad, Yogesh Singh RawatMultimodal Large Language ModelsCausal Reasoning in Videos

  20. OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning

    Jun 29, 2026Haocong He, Chenfei Liao, Zichen Wen +13Visual Spatial ReasoningMultimodal Large Language Models

  21. Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

    Jun 29, 2026Kai Jiang, Ruishu Zhu, Siqi Huang +2Visual Question AnsweringMultimodal Large Language Models

  22. MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

    Jun 29, 2026Yuxuan Fan, Gyusik Seo, Jing Hao +3Audio-Visual UnderstandingMultimodal Large Language Models

  23. Making Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework

    Jun 29, 2026Yuchen He, Peizhi Ying, Liqi Cheng +4Document Information ExtractionMultimodal Large Language Models

  24. How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

    Jun 29, 2026William Orwig, Roger E. BeatyCreativity AssessmentLLM-as-a-Judge