Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment

    Feb 1, 2026Lancheng Gao, Ziheng Jia, Zixuan Xing +4Multimodal Large Language ModelsMultimodal QA

  2. A Multimodal Large Language Model-Driven Framework for Context-Aware UAV Emergency Landing Site Selection

    Feb 1, 2026Chunliang Hua, Lei Zhang, Jiayang Sun +2UAV NavigationMultimodal Large Language Models

  3. MedAD-R1: Consistency-Reinforced Policy Optimization for Interpretable Medical Anomaly Detection

    Feb 1, 2026Haitao Zhang, Yingying Wang, Jiaxiang Wang +5HealthcareGroup Relative Policy Optimization

  4. TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs

    Jan 30, 2026Baiqi Li, Kangyi Zhao, Ce Zhang +3VLM EvaluationVideo Understanding

  5. AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking

    Jan 25, 2026Xilin Jiang, Qiaolin Wang, Junkai Wu +30Audio-Visual UnderstandingMultimodal Large Language Models

  6. Social Caption: Evaluating Social Understanding in Multimodal Models

    Jan 21, 2026Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe +1Multimodal Large Language ModelsMultimodal Reasoning

  7. AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

    Jan 20, 2026Aahana Basappa, Pranay Goel, Anusri Karra +3Reasoning EvaluationMultimodal Large Language Models

  8. ChartAttack: Testing the Vulnerability of LLMs to Malicious Prompting in Chart Generation

    Jan 19, 2026Jesus-German Ortiz-Barajas, Jonathan Tonglet, Vivek Gupta +1Data VisualizationAdversarial Attacks on VLMs

  9. BabyVision: Visual Reasoning Beyond Language

    Jan 10, 2026Liang Chen, Weichu Xie, Yiyan Liang +27VLM EvaluationVisual Reasoning

  10. Towards Multi-modal Multi-turn Safety: From Agentic Interaction to Strategic Alignment

    Jan 8, 2026Han Zhu, Jiale Chen, Chengkun Cai +8Language Model Safety EvaluationMultimodal Large Language Models

  11. ELF: A Family of Encoder-Free ECG-Language Models

    Jan 5, 2026William Han, Tony Chen, Chaojing Duan +6HealthcareElectrocardiography

  12. NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

    Jan 3, 2026Hyeonjeong Ha, Jinjin Ge, Bo Feng +2VLM EvaluationVideo Understanding

  13. BrepLLM: Enabling Large Language Models to Understand Boundary Representations

    Dec 18, 2025Liyuan Deng, Hao Guo, Yongkang Dai +5Multimodal Large Language Models3D Representation Learning

  14. EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs

    Dec 11, 2025Chao Gong, Depeng Wang, Zhipeng Wei +3Rotary Positional EmbeddingsMultimodal Large Language Models

  15. Enhancing Large Language Model-Based Systems for End-to-End Circuit Analysis Problem Solving

    Dec 10, 2025Liangliang Chen, Weiyu Sun, Huiru Xie +2LLM Answer VerificationEducational Technology

  16. Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors

    Dec 10, 2025Tian Liu, Anwesha Basu, James Caverlee +1Large Vision-Language ModelsMultimodal Large Language Models

  17. VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

    Nov 25, 2025Tianxiang Jiang, Sheng Xia, Yicheng Xu +5VLM EvaluationMultimodal Large Language Models

  18. Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning

    Nov 25, 2025Zhen Zeng, Leijiang Gu, Zhangling Duan +4VLM UnlearningMultimodal Large Language Models

  19. Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents

    Nov 24, 2025Dayong Liu, Chao Xu, Weihong Chen +5AI Agent EvaluationMultimodal Large Language Models

  20. VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

    Nov 21, 2025Lingxiao Li, Yifan Wang, Xinyan Gao +3Visual Spatial ReasoningVisual Reasoning

  21. A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models

    Nov 19, 2025Duo Li, Zuhao Yang, Xiaoqin Zhang +2Multimodal Large Language ModelsDiffusion Language Model Inference

  22. LLM4Delay: Flight Delay Prediction via Cross-Modality Adaptation of Large Language Models and Aircraft Trajectory Representation

    Oct 24, 2025Thaweerath Phisannupawong, Joshua Julian Damanik, Han-Lim ChoiAir Traffic ManagementIntelligent Transportation Systems

  23. Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

    Oct 20, 2025Yulin Luo, Chun-Kai Fan, Menghang Dong +19Long-Horizon Robotic ManipulationMultimodal Large Language Models

  24. MCA: Modality Composition Awareness for Robust Composed Multimodal Retrieval

    Oct 17, 2025Qiyu Wu, Shuyang Cui, Satoshi Hayakawa +3Multimodal RobustnessMultimodal Large Language Models

  25. Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

    Oct 10, 2025Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra +6Object Hallucination in VLMsMultimodal Large Language Models

  26. LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition

    Oct 10, 2025Yushuo Zheng, Tongrui Ye, Zicheng Zhang +3Multimodal Large Language ModelsAI Agent Benchmarks

  27. Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs

    Oct 1, 2025Sanghwan Kim, Rui Xiao, Stephan Alaniz +2Multimodal Large Language ModelsLong-Video Understanding