Multimodal Large Language Models

Also known as MLLM

Latest papers 684

All topics
CardsList
  1. OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

    May 26, 2026Guangzhi Sun, Yixuan Li, Yudong Yang +1Streaming Video UnderstandingMultimodal Large Language Models

  2. Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

    May 26, 2026Partho Ghose, Al Bashir, Prem Raj +1Agricultural Image AnalysisVLM Hallucination

  3. Touch-R1: Reinforcing Touch Reasoning in MLLMs

    May 26, 2026Yingxin Lai, Yafei Zhou, Fucai Zhu +2Tactile SensingMultimodal Large Language Models

  4. Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning

    May 26, 2026Junkai Chen, Yuhao He, Junxiang You +3VLM UnlearningMultimodal Large Language Models

  5. LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?

    May 26, 2026Xiaohan Wang, Mingze Yin, Yilin Zhao +2Mathematical Reasoning BenchmarksEducational Assessment

  6. OnceSelect: Reusable Data Selection for Efficient Multimodal Instruction Tuning

    May 26, 2026Mingkang Dong, Muxin Pu, Hongyi Cai +5Instruction-Tuning Data SelectionMultimodal Large Language Models

  7. Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

    May 25, 2026Bonan Ding, Umair Nawaz, Ufaq Khan +5Cross-Modal LearningMultimodal Large Language Models

  8. Prism: A Plug-in Reproducible Infrastructure for Scalable Multimodal Continual Instruction Tuning

    May 25, 2026Jun-Tao Tang, Yu-Cheng Shi, Zhen-Hao Xie +1Continual Learning for LLMsMultimodal Large Language Models

  9. AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution

    May 25, 2026Zehao Wang, Yihan Zeng, Zidong Gong +5RL for Language Model ReasoningMultimodal Large Language Models

  10. StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs

    May 25, 2026Yang Luo, Xinran Liu, Tiantian Ji +3Adversarial Attacks on VLMsLanguage Model Safety Evaluation

  11. MetaphorVU: Towards Metaphorical Video Understanding

    May 25, 2026Zhuoqun Li, Boxi Cao, Guiping Jiang +13VLM EvaluationFigurative Language Understanding

  12. BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

    May 25, 2026Zili Zhang, Chengxu Yang, Shenglong Zhang +8Deep Learning OptimizationMultimodal Large Language Models

  13. Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence

    May 25, 2026Yufei Zheng, Xuhan Zhu, Zide Liu +9Visual Spatial ReasoningMetric Depth Estimation

  14. Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models

    May 24, 2026Zhipeng Ye, Jiaqi Huang, Feng Jiang +5Efficient Multimodal InferenceMultimodal Large Language Models

  15. EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy

    May 23, 2026Jinzhao Li, Yinuo Chen, Dongxu Piao +9Spatial Reasoning BenchmarksLLM Evaluation

  16. Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

    May 22, 2026Haoyuan Wang, Xiaohao Liu, Jiajie Su +2Multimodal RobustnessAdversarial Robustness

  17. ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

    May 22, 2026Fen Wang, Zekai Shao, Qiman Kang +5Data VisualizationMultimodal Large Language Models

  18. Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis

    May 21, 2026Tomaso Trinci, Henrique Piñeiro Monteagudo, Leonardo TaccariMultimodal Large Language ModelsAutonomous Driving

  19. Do Factual Recall Mechanisms Carry over from Text to Speech in Multimodal Language Models?

    May 21, 2026Luca Modica, Filip Landin, Mehrdad Farahani +3Multimodal Large Language ModelsFactual Knowledge in Language Models

  20. Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

    May 21, 2026Changyuan Tian, Zhicong Lu, Huaxing Liu +7Multimodal Large Language ModelsMultimodal Reasoning

  21. LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

    May 21, 2026Yifan Dai, Zhenhua Wu, Bohan Zeng +18Cross-Modal LearningAudio-Visual Understanding

  22. MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

    May 21, 2026Dazhao Du, Liao Duan, Jian Liu +5Temporal Video GroundingMultimodal Large Language Models

  23. Seizure-Semiology-Suite (S3): A Clinically Multimodal Dataset, Benchmark, and Models for Seizure Semiology Understanding

    May 21, 2026Lina Zhang, Tonmoy Monsoor, Peizheng Li +23Video UnderstandingMultimodal Large Language Models

  24. Multimodal LLMs under Pairwise Modalities

    May 20, 2026Yan Li, Yunlong Deng, Yuewen Sun +3Cross-Modal LearningRepresentation Identifiability

  25. Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs

    May 20, 2026Leitao Yuan, Qinghua Mao, Daizong Liu +5Adversarial Attacks on VLMsMultimodal Large Language Models

  26. Stage-adaptive Token Selection for Efficient Omni-modal LLMs

    May 19, 2026Zijie Xin, Jie Yang, Ruixiang Zhao +4Efficient Multimodal InferenceMultimodal Large Language Models