Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

    Jun 6, 2026Jiaqi Tang, Jianmin Chen, Youyang Zhai +6VLM RobustnessImage Corruption Robustness

  2. Seeing Without Exposing: Adaptive Privacy Control for Open-World, Context-Hungry MLLMs

    Jun 5, 2026Siyuan Xu, Yibing Liu, Peilin Chen +3Privacy-Preserving Language ModelsMultimodal Large Language Models

  3. Textual Supervision Enhances Geospatial Representations in Vision-Language Models

    Jun 5, 2026Marcelo Sartori Locatelli, Fernando Tonucci, Jea Kwon +5Vision-Language ModelsGeospatial Representation Learning

  4. When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing

    Jun 5, 2026Siyuan Xu, Yibing Liu, Peilin Chen +3Image Editing EvaluationText-Guided Image Editing

  5. Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads

    Jun 4, 2026Ruoxi Sun, Quantong Qiu, Juntao Li +3Multimodal Large Language ModelsVLM Interpretability

  6. LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video

    Jun 4, 2026Shiqiang Lang, Jing Liu, Haoyang He +6Visual Spatial ReasoningMultimodal Large Language Models

  7. WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark

    Jun 4, 2026Yida Yin, Harish Krishnakumar, Chung Peng Lee +9Multimodal Large Language ModelsMultimodal Reasoning

  8. Brick-Composer: Using MLLMs for Assembly with Diverse Bricks

    Jun 3, 2026Jiateng Liu, Bingxuan Li, Zhenhailong Wang +8Visual Spatial ReasoningBenchmark Construction

  9. UniCAD: A Unified Benchmark and Universal Model for Multi-Modal Multi-Task CAD

    Jun 3, 2026Jingyuan Chen, Sheng Jin, Haopeng Sun +23D ReconstructionMultimodal Large Language Models

  10. Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

    Jun 3, 2026SooHwan Eom, Jay Shim, Gwanhyeong Koo +4MambaEfficient VLM Inference

  11. A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

    Jun 3, 2026Huangchen Xu, Yuan Wu, Yi ChangMultimodal Large Language ModelsMultimodal Model Evaluation

  12. Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning

    Jun 3, 2026Niloufar Alipour Talemi, Hossein Kashiani, Fatemeh AfghahEfficient Multimodal InferenceMultimodal ICL

  13. From Symbolic to Geometric: Enabling Spatial Reasoning in Large Language Models

    Jun 3, 2026Chen Chu, Bita Azarijoo, Li Xiong +2Spatial Reasoning BenchmarksMultimodal Large Language Models

  14. FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

    Jun 2, 2026Eshika Khandelwal, Jingjing Pan, Mingfang Zhang +3Multimodal GroundingVideo Object Detection

  15. Benchmarking Visual State Tracking in Multimodal Video Understanding

    Jun 2, 2026Sihyun Yu, Nanye Ma, Pinzhi Huang +8Multimodal Large Language ModelsVideo Reasoning

  16. Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

    Jun 2, 2026Hashmat Shadab Malik, Muzammal Naseer, Salman KhanMultilingual Language Model EvaluationAdversarial Attacks on VLMs

  17. Investigating Adversarial Robustness of Multi-modal Large Language Models

    Jun 2, 2026Hashmat Shadab Malik, Muzammal Naseer, Salman KhanAdversarial TrainingVLM Robustness

  18. DMT-CBT: Longitudinal Therapeutic State Modeling for CBT Counseling

    Jun 2, 2026Chang Liu, Shuyi Zhang, Changsheng Ma +3Mental Health CounselingMultimodal Large Language Models

  19. CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection

    Jun 2, 2026Jinjie Shen, Yaxiong Wang, Yujiao Wu +5Fake News DetectionMultimodal Large Language Models

  20. AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

    Jun 1, 2026Yaoting Wang, Ziyi Zhang, Wenming Tu +10Audio-Visual UnderstandingMultimodal Robustness

  21. ToolFG: Towards Well-Grounded Fine-Grained Image Classification

    Jun 1, 2026Yu Xue, Haoxuan Qu, Zhuoling Li +4Tool Use in VLMsMultimodal Large Language Models

  22. Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

    Jun 1, 2026Chuang Ma, Qianying Liu, Tomoyuki Obuchi +6VLM RobustnessVisual Spatial Reasoning

  23. Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference

    Jun 1, 2026Hyeonwoo Cho, Donghyeon Baek, Yewon Kim +1Efficient Multimodal InferenceMultimodal Large Language Models

  24. SPACE: Source-free Proxy Anchor Concept Erasure for MLLMs

    Jun 1, 2026Zhijing Zhang, Jiaqi Ding, Qianshan Wei +5VLM UnlearningMultimodal Large Language Models