Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding

    Apr 24, 2026Lihao Zheng, Zhenwei Shao, Yu Zhou +5Multimodal GroundingMultimodal Large Language Models

  2. MTT-Bench: Predicting Social Dominance in Mice via Multimodal Large Language Models

    Apr 24, 2026Yunquan Chen, Haoyu ChenMultimodal Large Language ModelsSocial Reasoning

  3. SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments

    Apr 24, 2026Chih-Ting Liao, Xi Xiao, Chunlei Meng +6Spatial Reasoning BenchmarksVisual Spatial Reasoning

  4. CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language

    Apr 24, 2026Rui Zhao, Xuewen Zhong, Xiaoyun Zheng +2Multimodal Large Language ModelsSign Language Recognition

  5. T2MM: An LLM Supported Architecture For Inquiry-Based Modeling

    Apr 24, 2026John Kos, Rudra Singh, Ashok GoelEducational TechnologyMultimodal Large Language Models

  6. BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature

    Apr 23, 2026Jiaxian Yan, Jintao Zhu, Yuhang Yang +8Document Information ExtractionMultimodal Large Language Models

  7. Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts

    Apr 23, 2026Azher Ahmed Efat, Seok Hwan Song, Wallapak TavanapongData VisualizationMultimodal Large Language Models

  8. Latent Denoising Improves Visual Alignment in Large Multimodal Models

    Apr 23, 2026Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan +1VLM RobustnessMultimodal Large Language Models

  9. Can MLLMs "Read" What is Missing?

    Apr 23, 2026Jindi Guo, Chaozheng Huang, Xi FangVLM EvaluationDocument Understanding

  10. Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery

    Apr 22, 2026Siyuan Yao, Siavash Ghorbany, Kuangshi Ai +6Multimodal Large Language Models

  11. Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

    Apr 22, 2026Guotao Liang, Zhangcheng Wang, Juncheng Hu +5Multimodal Large Language ModelsMultimodal Generation

  12. SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

    Apr 22, 2026Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr +2Multimodal Large Language ModelsReinforcement Learning with Verifiable Rewards

  13. Benchmarking Large Language Models for Safety Data Extraction

    Apr 22, 2026Jonas Grill, Thomas Bayer, Sören BerlingerLLM EvaluationLLM Prompting

  14. HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

    Apr 22, 2026Tao Cheng, Shi-Zhe Chen, Hao Zhang +3Multimodal Large Language ModelsMultimodal Reasoning

  15. ATIR: Towards Audio-Text Interleaved Contextual Retrieval

    Apr 22, 2026Tong Zhao, Chenghao Zhang, Yutao Zhu +1Multimodal IRMultimodal Large Language Models

  16. SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition

    Apr 22, 2026Jielong Tang, Xujie Yuan, Jiayang Liu +6Multimodal GroundingNamed Entity Recognition

  17. Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis

    Apr 21, 2026Paweł Pozorski, Jakub Muszyński, Maria GanzhaMultimodal Large Language ModelsNeural Network Interpretability

  18. mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

    Apr 21, 2026Jakub Muszyński, Paweł Pozorski, Maria GanzhaMultimodal Large Language ModelsShapley Value Attribution

  19. ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety

    Apr 21, 2026Kun Wang, Cheng Qian, Miao Yu +6LLM Backdoor AttacksMultimodal Large Language Models

  20. DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

    Apr 20, 2026Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao +3Cross-Modal LearningVisual Question Answering

  21. Autonomous Skeletal Landmark Localization towards Agentic C-Arm Control

    Apr 20, 2026Jay Jung, Ahmad Arrabi, Jax Luo +2Robotic ControlLanguage Model-Based Control

  22. Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models

    Apr 20, 2026Yakoub Bazi, Mohamad M. Al Rahhal, Mansour Zuair +1VLM EvaluationRemote Sensing Image Understanding

  23. EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations

    Apr 20, 2026Yongrui Heng, Chaoya Jiang, Han Yang +2Synthetic Data GenerationMultimodal Large Language Models

  24. Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

    Apr 20, 2026Samuel G. Balter, Ethan Jerzak, Connor T. JerzakMultimodal Large Language ModelsMultimodal Reasoning

  25. MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

    Apr 20, 2026Sua Lee, Sanghee Park, Jinbae ImLLM-as-a-JudgeMultimodal Large Language Models

  26. Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs

    Apr 20, 2026Tingchao Fu, Wenkai Wang, Fanxiao Li +6Knowledge EditingMultimodal Large Language Models

  27. Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

    Apr 19, 2026Shaoguang Wang, Weiyu Guo, Ziyang Chen +2Multimodal Large Language ModelsMultimodal QA

  28. E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition

    Apr 19, 2026Meng Zhang, Jinzhong Ning, Xiaolong Wu +2Multimodal GroundingNamed Entity Recognition