Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation

    May 5, 2026Quanxing Xu, Ling Zhou, Xian Zhong +3Multimodal RAGVisual Question Answering

  2. Can Multimodal Large Language Models Understand Pathologic Movements? A Pilot Study on Seizure Semiology

    May 5, 2026Lina Zhang, Tonmoy Monsoor, Mehmet Efe Lorasdagi +8Video UnderstandingMultimodal Large Language Models

  3. Bolek: A Multimodal Language Model for Molecular Reasoning

    May 4, 2026Frederic Grabowski, Jacek Szczerbiński, Maciej Jaśkowski +4LLM GroundingScientific Reasoning

  4. Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs

    May 4, 2026Xin Zhang, Qiqi Tao, Jiawei Du +2Inference-Time OptimizationTest-Time Optimization

  5. From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs

    May 4, 2026Le Zhang, Jihan Yang, Soundarya Krishnan +11Spatial Reasoning BenchmarksVisual Spatial Reasoning

  6. Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time

    May 3, 2026Itai Allouche, Joseph KeshetMultimodal GroundingInference-Time Optimization

  7. Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression

    May 2, 2026Yao Du, Shanshan Song, Xiaomeng LiMultimodal Large Language ModelsRL Fine-Tuning

  8. DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

    May 2, 2026Jincheng Lou, Ruohan Xu, Jiapeng Li +6Multi-Agent LLM SystemsElectronic Design Automation

  9. OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

    May 2, 2026Rongyang Wang, Shuang Zhou, Jiashuo Wang +2Medical ImagingCognitive Modeling

  10. Valley3: Scaling Omni Foundation Models for E-commerce

    May 2, 2026Zeyu Chen, Guanghao Zhou, Min Yang +6Unified Multimodal ModelsMultimodal Pretraining

  11. EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness

    May 1, 2026Yueru Sun, Yimeng Zhang, Haoyu Gu +5Missing-Modality LearningMultimodal Large Language Models

  12. Let ViT Speak: Generative Language-Image Pre-training

    May 1, 2026Yan Fang, Mengcheng Lan, Zilong Huang +7Cross-Modal LearningVision Transformer

  13. Generating Statistical Charts with Validation-Driven LLM Workflows

    May 1, 2026Pavlin G. Poličar, Andraž Pevcin, Blaž ZupanData VisualizationMultimodal Large Language Models

  14. DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home

    May 1, 2026Changshuo Liu, Junran Wu, Zhongle Xie +9HealthcareMultimodal Large Language Models

  15. Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

    May 1, 2026Prabal Shrestha, Bohan Jiang, Haoning Xue +2Multimodal Large Language ModelsLanguage Model Bias Evaluation

  16. Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology

    May 1, 2026Roy Jiang, Hyunjae Kim, Zhenyue Qin +8HealthcareClinical Triage

  17. Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

    Apr 30, 2026Sudong Wang, Weiquan Huang, Xiaomin Yu +9Multimodal Large Language ModelsMultimodal Reasoning

  18. From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

    Apr 30, 2026Guang Yang, Xing Hu, Xiang Chen +1Multimodal GroundingCode Generation

  19. State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading

    Apr 29, 2026Yuanze Hu, Gen Li, Yuqin Lan +5Multimodal RobustnessCross-Modal Alignment

  20. Assessing Y-Axis Influence: Bias in Multimodal Language Models on Chart-to-Table Translation

    Apr 27, 2026Seok Hwan Song, Azher Ahmed Efat, Wallapak TavanapongData VisualizationMultimodal Large Language Models

  21. X2SAM: Any Segmentation in Images and Videos

    Apr 27, 2026Hao Wang, Limeng Qiao, Chi Zhang +4Image SegmentationVideo Object Segmentation

  22. Aligned Multi-View Scripts for Universal Chart-to-Code Generation

    Apr 27, 2026Zhihan Zhang, Lizi LiaoData VisualizationCode Generation

  23. ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

    Apr 26, 2026Zichun Guo, Yuling Shi, Wenhao Zeng +6Image ReconstructionMultimodal Large Language Models

  24. EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

    Apr 25, 2026He Hu, Tengjin Weng, Zebang Cheng +5Multimodal Large Language ModelsMultimodal Model Evaluation

  25. UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks

    Apr 25, 2026Jason Nguyen, Ameet Rao, Alexander Chang +2Multimodal Large Language ModelsVideo QA