Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts

    Apr 23, 2026Azher Ahmed Efat, Seok Hwan Song, Wallapak TavanapongData VisualizationMultimodal Large Language Models

  2. Latent Denoising Improves Visual Alignment in Large Multimodal Models

    Apr 23, 2026Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan +1VLM RobustnessMultimodal Large Language Models

  3. Can MLLMs "Read" What is Missing?

    Apr 23, 2026Jindi Guo, Chaozheng Huang, Xi FangVLM EvaluationDocument Understanding

  4. Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery

    Apr 22, 2026Siyuan Yao, Siavash Ghorbany, Kuangshi Ai +6Multimodal Large Language Models

  5. Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

    Apr 22, 2026Guotao Liang, Zhangcheng Wang, Juncheng Hu +5Multimodal Large Language ModelsMultimodal Generation

  6. SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

    Apr 22, 2026Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr +2Multimodal Large Language ModelsReinforcement Learning with Verifiable Rewards

  7. Benchmarking Large Language Models for Safety Data Extraction

    Apr 22, 2026Jonas Grill, Thomas Bayer, Sören BerlingerLLM EvaluationLLM Prompting

  8. HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

    Apr 22, 2026Tao Cheng, Shi-Zhe Chen, Hao Zhang +3Multimodal Large Language ModelsMultimodal Reasoning

  9. ATIR: Towards Audio-Text Interleaved Contextual Retrieval

    Apr 22, 2026Tong Zhao, Chenghao Zhang, Yutao Zhu +1Multimodal IRMultimodal Large Language Models

  10. SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition

    Apr 22, 2026Jielong Tang, Xujie Yuan, Jiayang Liu +6Multimodal GroundingNamed Entity Recognition

  11. Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis

    Apr 21, 2026Paweł Pozorski, Jakub Muszyński, Maria GanzhaMultimodal Large Language ModelsNeural Network Interpretability

  12. mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

    Apr 21, 2026Jakub Muszyński, Paweł Pozorski, Maria GanzhaMultimodal Large Language ModelsShapley Value Attribution

  13. ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety

    Apr 21, 2026Kun Wang, Cheng Qian, Miao Yu +6LLM Backdoor AttacksMultimodal Large Language Models

  14. DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

    Apr 20, 2026Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao +3Cross-Modal LearningVisual Question Answering

  15. Autonomous Skeletal Landmark Localization towards Agentic C-Arm Control

    Apr 20, 2026Jay Jung, Ahmad Arrabi, Jax Luo +2Robotic ControlLanguage Model-Based Control

  16. Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models

    Apr 20, 2026Yakoub Bazi, Mohamad M. Al Rahhal, Mansour Zuair +1VLM EvaluationRemote Sensing Image Understanding

  17. EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations

    Apr 20, 2026Yongrui Heng, Chaoya Jiang, Han Yang +2Synthetic Data GenerationMultimodal Large Language Models

  18. Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

    Apr 20, 2026Samuel G. Balter, Ethan Jerzak, Connor T. JerzakMultimodal Large Language ModelsMultimodal Reasoning

  19. MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

    Apr 20, 2026Sua Lee, Sanghee Park, Jinbae ImLLM-as-a-JudgeMultimodal Large Language Models

  20. Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs

    Apr 20, 2026Tingchao Fu, Wenkai Wang, Fanxiao Li +6Knowledge EditingMultimodal Large Language Models

  21. Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

    Apr 19, 2026Shaoguang Wang, Weiyu Guo, Ziyang Chen +2Multimodal Large Language ModelsMultimodal QA

  22. E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition

    Apr 19, 2026Meng Zhang, Jinzhong Ning, Xiaolong Wu +2Multimodal GroundingNamed Entity Recognition

  23. MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference

    Apr 19, 2026Bo Li, Chuan Wu, Shaolin ZhuEfficient Multimodal InferenceExpert Load Balancing

  24. Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

    Apr 19, 2026Yunkai Dang, Yifan Jiang, Yizhu Jiang +3Selective PredictionConfidence Estimation in Language Models

  25. RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation

    Apr 19, 2026Rui Min, Liang Yao, Shiyu Miao +5Remote Sensing Image UnderstandingVLM Robustness

  26. Enhancing Zero-shot Personalized Image Aesthetics Assessment with Profile-aware Multimodal LLM

    Apr 19, 2026Chun Wang, Chenfeng Wei, Chenyang Liu +1Zero-Shot LearningPersonalized Image Aesthetics Assessment