Multimodal Large Language Models

Also known as MLLM

Latest papers 684

All topics
CardsList
  1. CRANE: Knowledge Editing for Reasoning MLLMs

    Jun 8, 2026Han Huang, Hao Wang, Mengqi Zhang +3Knowledge EditingKnowledge Conflicts in Language Models

  2. NutriMLLM: Multimodal Large Language Models for Dietary Micronutrient Analysis

    Jun 8, 2026Runze Yan, Minxiao Wang, Jiaying Lu +3Multimodal Large Language Models

  3. TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

    Jun 7, 2026Lianyu Hu, Xiaoyu Ma, Zeqin Liao +1Multimodal Large Language ModelsMultimodal Reasoning

  4. When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

    Jun 6, 2026Yiheng Wang, Yueqian Lin, Lichen Zhu +3Multimodal Large Language ModelsQuestion Answering

  5. Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

    Jun 6, 2026Jiaqi Tang, Jianmin Chen, Youyang Zhai +6VLM RobustnessImage Corruption Robustness

  6. Seeing Without Exposing: Adaptive Privacy Control for Open-World, Context-Hungry MLLMs

    Jun 5, 2026Siyuan Xu, Yibing Liu, Peilin Chen +3Privacy-Preserving Language ModelsMultimodal Large Language Models

  7. Textual Supervision Enhances Geospatial Representations in Vision-Language Models

    Jun 5, 2026Marcelo Sartori Locatelli, Fernando Tonucci, Jea Kwon +5Vision-Language ModelsGeospatial Representation Learning

  8. When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing

    Jun 5, 2026Siyuan Xu, Yibing Liu, Peilin Chen +3Image Editing EvaluationText-Guided Image Editing

  9. Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads

    Jun 4, 2026Ruoxi Sun, Quantong Qiu, Juntao Li +3Multimodal Large Language ModelsVLM Interpretability

  10. LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video

    Jun 4, 2026Shiqiang Lang, Jing Liu, Haoyang He +6Visual Spatial ReasoningMultimodal Large Language Models

  11. WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark

    Jun 4, 2026Yida Yin, Harish Krishnakumar, Chung Peng Lee +9Multimodal Large Language ModelsMultimodal Reasoning

  12. Brick-Composer: Using MLLMs for Assembly with Diverse Bricks

    Jun 3, 2026Jiateng Liu, Bingxuan Li, Zhenhailong Wang +8Visual Spatial ReasoningBenchmark Construction

  13. UniCAD: A Unified Benchmark and Universal Model for Multi-Modal Multi-Task CAD

    Jun 3, 2026Jingyuan Chen, Sheng Jin, Haopeng Sun +23D ReconstructionMultimodal Large Language Models

  14. Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

    Jun 3, 2026SooHwan Eom, Jay Shim, Gwanhyeong Koo +4MambaEfficient VLM Inference

  15. A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

    Jun 3, 2026Huangchen Xu, Yuan Wu, Yi ChangMultimodal Large Language ModelsMultimodal Model Evaluation

  16. Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning

    Jun 3, 2026Niloufar Alipour Talemi, Hossein Kashiani, Fatemeh AfghahEfficient Multimodal InferenceMultimodal ICL

  17. From Symbolic to Geometric: Enabling Spatial Reasoning in Large Language Models

    Jun 3, 2026Chen Chu, Bita Azarijoo, Li Xiong +2Spatial Reasoning BenchmarksMultimodal Large Language Models

  18. FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

    Jun 2, 2026Eshika Khandelwal, Jingjing Pan, Mingfang Zhang +3Multimodal GroundingVideo Object Detection

  19. Benchmarking Visual State Tracking in Multimodal Video Understanding

    Jun 2, 2026Sihyun Yu, Nanye Ma, Pinzhi Huang +8Multimodal Large Language ModelsVideo Reasoning

  20. Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

    Jun 2, 2026Hashmat Shadab Malik, Muzammal Naseer, Salman KhanMultilingual Language Model EvaluationAdversarial Attacks on VLMs

  21. Investigating Adversarial Robustness of Multi-modal Large Language Models

    Jun 2, 2026Hashmat Shadab Malik, Muzammal Naseer, Salman KhanAdversarial TrainingVLM Robustness

  22. DMT-CBT: Longitudinal Therapeutic State Modeling for CBT Counseling

    Jun 2, 2026Chang Liu, Shuyi Zhang, Changsheng Ma +3Mental Health CounselingMultimodal Large Language Models

  23. CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection

    Jun 2, 2026Jinjie Shen, Yaxiong Wang, Yujiao Wu +5Fake News DetectionMultimodal Large Language Models