Multimodal Large Language Models

Latest papers 877

All topics
CardsList
  1. DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

    May 2, 2026Jincheng Lou, Ruohan Xu, Jiapeng Li +6DiagramsTable Reasoning Datasets

  2. OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

    May 2, 2026Rongyang Wang, Shuang Zhou, Jiashuo Wang +2Occlusal ConstraintMultimodal Clinical Data

  3. EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness

    May 1, 2026Yueru Sun, Yimeng Zhang, Haoyu Gu +5Emotion RecognitionMultimodal Large Language Models

  4. Generating Statistical Charts with Validation-Driven LLM Workflows

    May 1, 2026Pavlin G. Poličar, Andraž Pevcin, Blaž ZupanChartLarge Language Model Workflows

  5. Scaling Video Understanding via Compact Latent Multi-Agent Collaboration

    May 1, 2026Kerui Chen, Jinglu Wang, Jianrong Zhang +3Fine-Grained Video UnderstandingMultimodal Large Language Models

  6. Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

    May 1, 2026Prabal Shrestha, Bohan Jiang, Haoning Xue +2Video Multimodal Large Language ModelsMultimodal Large Language Models

  7. Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology

    May 1, 2026Roy Jiang, Hyunjae Kim, Zhenyue Qin +8Multimodal Clinical DataMelanoma

  8. MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

    Apr 30, 2026Junbo Cui, Bokai Xu, Chongyi Wang +33Omni-ModalFull-Duplex Speech Models

  9. COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

    Apr 30, 2026Bingli Wang, Huanze Tang, Haijun Lv +5Multimodal Large Language ModelsImage-Text Alignment

  10. State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading

    Apr 29, 2026Yuanze Hu, Gen Li, Yuqin Lan +5MeasuresMultimodal Large Language Models

  11. Multimodal LLMs are not all you need for Pediatric Speech Language Pathology

    Apr 29, 2026Darren Fürst, Sebastian Steindl, Ulrich SchäferSpeech Language ModelsDysarthric Speech

  12. SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring

    Apr 28, 2026Hector G. Rodriguez, Marcus RohrbachVisual EvidenceMultimodal Large Language Models

  13. Learning from Medical Entity Trees: An Entity-Centric Medical Data Engineering Framework for MLLMs

    Apr 28, 2026Jianghang Lin, Haihua Yang, Deli Yu +6Medical OntologyMultimodal Clinical Data

  14. OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

    Apr 28, 2026Minghang Zheng, Zihao Yin, Yi Yang +2Video Temporal GroundingMultimodal Large Language Models

  15. M3^3-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

    Apr 28, 2026Jiatong Ma, Longteng Guo, Yuchen Liu +4Knowledge-Based Visual Question AnsweringMultimodal Reasoning

  16. Assessing Y-Axis Influence: Bias in Multimodal Language Models on Chart-to-Table Translation

    Apr 27, 2026Seok Hwan Song, Azher Ahmed Efat, Wallapak TavanapongChartTabular Learning

  17. X2SAM: Any Segmentation in Images and Videos

    Apr 27, 2026Hao Wang, Limeng Qiao, Chi Zhang +4Video Object SegmentationMultimodal Large Language Models

  18. Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues

    Apr 27, 2026Beomchan Park, Seongho Kim, Hyunjun Kim +2Multimodal Large Language ModelsGrounding

  19. ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

    Apr 26, 2026Zichun Guo, Yuling Shi, Wenhao Zeng +6Visual Document RetrievalMultimodal Large Language Models

  20. EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

    Apr 25, 2026He Hu, Tengjin Weng, Zebang Cheng +5Emotion RecognitionMultimodal Large Language Models

  21. OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

    Apr 25, 2026Yida Xue, Ningyu Zhang, Tingwei Wu +5Multimodal DatasetOcean

  22. SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

    Apr 24, 2026Jichao Wang, Liuyang Bian, Yufeng Zhou +9Long-Horizon Task PlanningMultimodal Large Language Models

  23. CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding

    Apr 24, 2026Lihao Zheng, Zhenwei Shao, Yu Zhou +5Fine-Grained PerceptionMultimodal Large Language Models

  24. MTT-Bench: Predicting Social Dominance in Mice via Multimodal Large Language Models

    Apr 24, 2026Yunquan Chen, Haoyu ChenBehavioral Foundation ModelsSpecies

  25. SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments

    Apr 24, 2026Chih-Ting Liao, Xi Xiao, Chunlei Meng +6Spatial MemorySpatial Reasoning

  26. CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language

    Apr 24, 2026Rui Zhao, Xuewen Zhong, Xiaoyun Zheng +2Sign Language TranslationMultilingual Benchmark

  27. Can Multimodal Large Language Models Truly Understand Small Objects?

    Apr 24, 2026Fujun Han, Junan Chen, Xintong Zhu +4Multimodal Large Language ModelsSmall Models

  28. Towards Temporal Compositional Reasoning in Long-Form Sports Videos

    Apr 24, 2026Siyu Cao, Lu Zhang, Ruizhe Zeng +1Video Temporal GroundingTemporal Reasoning

  29. Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

    Apr 23, 2026Chentao Li, Zirui Gao, Mingze Gao +3Egocentric VisionMultimodal Large Language Models

  30. Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts

    Apr 23, 2026Azher Ahmed Efat, Seok Hwan Song, Wallapak TavanapongChartMultimodal Query

  31. Can MLLMs "Read" What is Missing?

    Apr 23, 2026Jindi Guo, Chaozheng Huang, Xi FangMultimodal Large Language ModelsQuestion-Answer Pairs

  32. Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery

    Apr 22, 2026Siyuan Yao, Siavash Ghorbany, Kuangshi Ai +6Real Estate DataMultimodal Large Language Models

  33. Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry

    Apr 22, 2026Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin +4Diagnostic BenchmarkVisual Reasoning

  34. Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational Recommendation

    Apr 22, 2026Dongding Lin, Jian Wang, Yongqi Li +1Preference Alignment LearningMultimodal Large Language Models

  35. Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

    Apr 22, 2026Guotao Liang, Zhangcheng Wang, Juncheng Hu +5Scalable Vector GraphicVisual Generation

  36. SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

    Apr 22, 2026Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr +2Multimodal Large Language ModelsRecent Vision-Language Models

  37. Exploring Spatial Intelligence from a Generative Perspective

    Apr 22, 2026Muzhi Zhu, Shunyao Jiang, Huanyi Zheng +9Stable Spatial UnderstandingMultimodal Large Language Models

  38. CHASM: Unveiling Covert Advertisements on Chinese Social Media

    Apr 22, 2026Jingyi Zheng, Tianyi Hu, Yule Liu +5Social Media PostsContent Moderation

  39. CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs

    Apr 22, 2026Xingcheng Zhou, Hao Guo, Rui Song +5TrafficCounterfactuals

  40. X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis

    Apr 22, 2026Gui Wang, Zehao Zhong, YongSong Zhou +6Multimodal Clinical DataOphthalmology

  41. Text Steganography with Dynamic Codebook and Multimodal Large Language Model

    Apr 22, 2026Jianxin Gao, Ruohan Lei, Wanli PengSteganographyLarge Language Model Watermarks

  42. Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

    Apr 21, 2026Jing Jin, Hao Liu, Yan Bai +9Multimodal Large Language ModelsElectron Microscopy

  43. SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

    Apr 21, 2026Josue Torres-Fonseca, Naihao Deng, Yinpei Dai +5HazardSafety-Critical Scenarios

  44. DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

    Apr 21, 2026Zhihong Zhang, Jie Zhao, Xiaojian Huang +5Multimodal Large Language ModelsMultimodal Dataset

  45. Seeing Candidates at Scale: Multimodal LLMs for Visual Political Communication on Instagram

    Apr 21, 2026Michael Achmann-Denkler, Mario Haim, Christian WolffSocial Media PostsMultimodal Large Language Models

  46. Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis

    Apr 21, 2026Paweł Pozorski, Jakub Muszyński, Maria GanzhaMultimodal Large Language ModelsExplainability

  47. mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

    Apr 21, 2026Jakub Muszyński, Paweł Pozorski, Maria GanzhaMultimodal Large Language ModelsMllm-Based

  48. ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety

    Apr 21, 2026Kun Wang, Cheng Qian, Miao Yu +6Multimodal Large Language ModelsProjection Heads

  49. DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

    Apr 20, 2026Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao +3Recent Vision-Language ModelsMultimodal Large Language Models

  50. Autonomous Skeletal Landmark Localization towards Agentic C-Arm Control

    Apr 20, 2026Jay Jung, Ahmad Arrabi, Jax Luo +2One-Shot Medical Landmark DetectionMultimodal Large Language Models

  51. Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

    Apr 20, 2026HaeJun Yoo, Yongseop Shin, Insung Lee +2Text-To-AudioEmbedder

  52. EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations

    Apr 20, 2026Yongrui Heng, Chaoya Jiang, Han Yang +2Self-EvolutionMultimodal Large Language Models

  53. Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

    Apr 20, 2026Samuel G. Balter, Ethan Jerzak, Connor T. JerzakMultimodal Large Language ModelsModalities

  54. MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

    Apr 20, 2026Sua Lee, Sanghee Park, Jinbae ImLlm-As-A-JudgeMultimodal Large Language Models

  55. Retrieval-Augmented Multimodal Model for Fake News Detection

    Apr 20, 2026Yiheng Li, Weihai Lu, Hanyi Yu +1Fake News DetectionFake News

  56. Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs

    Apr 20, 2026Tingchao Fu, Wenkai Wang, Fanxiao Li +6Multimodal Large Language Models