Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

    May 11, 2026Yeongtak Oh, Dongwook Lee, Sangkwon Park +2Multimodal GroundingMultimodal Large Language Models

  2. Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment

    May 11, 2026Haobo Wang, Xiaorong Ma, Weiqi Luo +2Adversarial Attacks on VLMsMultimodal Large Language Models

  3. Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent

    May 10, 2026Yihong Tang, Kehai Chen, Xuefeng Bai +1Multimodal Large Language ModelsMultimodal Agents

  4. Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs

    May 10, 2026Jiafeng Liang, Zhihao Zhu, Zihan Zhang +7Causal DiscoveryMultimodal Large Language Models

  5. DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

    May 10, 2026Rui Liu, Dian Yu, Zhenwen Liang +6Multimodal Large Language ModelsMultimodal Reward Modeling

  6. Reinforcing Multimodal Reasoning Against Visual Degradation

    May 10, 2026Rui Liu, Dian Yu, Haolin Liu +6VLM RobustnessImage Corruption Robustness

  7. Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

    May 9, 2026Jucheng Hu, Zhangquan Chen, Yulin Chen +9Multimodal Large Language ModelsMultimodal Foundation Models

  8. LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?

    May 9, 2026Kechen Fang, Yihua Qin, Chongyi Wang +3Efficient VLM InferenceMultimodal Large Language Models

  9. Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

    May 9, 2026Tri Cao, Khoi Le, Thong Nguyen +7VLM EvaluationObject Hallucination in VLMs

  10. EmoS: A High-Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding

    May 9, 2026Pengze Guo, Jingxi Liang, Zhiwen Xie +2Multimodal Large Language ModelsMultimodal Emotion Recognition

  11. PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models

    May 9, 2026Jiahui Guang, Zexun Zhan, Zhenlin Xu +5VLM EvaluationVLM Unlearning

  12. SalesSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

    May 8, 2026Yada Pruksachatkun, Elaine Wan, Lyanna Chen +2RL for Language ModelsLarge Language Model-Based Role-Play Simulation

  13. Anisotropic Modality Align

    May 8, 2026Xiaomin Yu, Yijiang Li, Yuhui Zhang +8Cross-Modal LearningCross-Modal Alignment

  14. WeatherSyn: An Instruction Tuning MLLM For Weather Forecasting Report Generation

    May 8, 2026Zinan Zheng, Yang Liu, Nuo Chen +3Multimodal Large Language ModelsWeather Forecasting

  15. Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning

    May 8, 2026Jin Cui, Xinyue Long, Xunyong Zhang +5Visual Spatial ReasoningVisual Reasoning

  16. Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment

    May 7, 2026Yuchen Guo, Junli Gong, Yao Lu +3Infrared-Visible Image FusionLearning to Rank

  17. MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes

    May 7, 2026Maximillian Chen, Xuanming Zhang, Michael Peng +3Tool-Augmented Language Model AgentsMultimodal Large Language Models

  18. CrossCult-KIBench: A Benchmark for Cross-Cultural Knowledge Insertion in MLLMs

    May 7, 2026Zhen Zeng, Leijiang Gu, Feng Li +2Knowledge Augmentation for Language ModelsMultimodal Large Language Models

  19. Uncovering Entity Identity Confusion in Multimodal Knowledge Editing

    May 7, 2026Shu Wu, Xiaotian Ye, Xinyu Mou +3Multimodal GroundingMultimodal Large Language Models

  20. OmicsLM: A Multimodal Large Language Model for Multi-Sample Omics Reasoning

    May 7, 2026Maciej Sypetkowski, Joanna Krawczyk, Łukasz Smoliński +4Multimodal Large Language ModelsQuestion Answering

  21. ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models

    May 7, 2026Yuhang Wang, Wenjie Mei, Junkai Zhang +3Privacy-Preserving Language ModelsMultimodal Large Language Models

  22. Null Space Constrained Contrastive Visual Forgetting for MLLM Unlearning

    May 7, 2026Yuhang Wang, Zhenxing Niu, Haoxuan Ji +3VLM UnlearningMultimodal Large Language Models

  23. Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

    May 7, 2026Md Farhamdur Reza, Richeng Jin, Tianfu Wu +1Multimodal Large Language ModelsJailbreak Attacks

  24. Causal Probing for Internal Visual Representations in Multimodal Large Language Models

    May 7, 2026Zehao Deng, Tianjie Ju, Zheng Wu +5Multimodal Large Language ModelsVLM Interpretability

  25. Spatial Priming Outperforms Semantic Prompting: A Grid-Based Approach to Improving LLM Accuracy on Chart Data Extraction

    May 6, 2026Andrei Lazarev, Dmitrii Sedov, Alexander GalkinLLM PromptingDocument Information Extraction

  26. Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models

    May 6, 2026Huatian Zhang, Zhendong Mao, Lei Zhang +1LLM AlignmentDirect Preference Optimization