Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. ReGraph: Learning to Generate Recipe Graphs from Food Images

    Aug 7, 2026Guoshan Liu, Bin Zhu, Pengkun Jiao +3Graph GenerationGraph Representation Learning

  2. AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

    Aug 7, 2026Zibo Shao, Baochen Xiong, Chengdong Xu +6Multimodal Large Language ModelsModel Merging

  3. Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding

    Aug 6, 2026Ming Wang, Yuqing Zhang, Tingna Xie +5Creativity AssessmentMultimodal Large Language Models

  4. MoCA: Implicit Social Context Analysis

    Aug 6, 2026Wenhao Xu, Kaiwen Zhang, Hao Li +10Abductive ReasoningMultimodal Large Language Models

  5. ChronoVision: Temporal Reasoning via Latent State Reconstruction

    Aug 6, 2026Yifan Shen, Jian Xu, Boyi Li +6Multimodal Large Language ModelsLatent Visual Reasoning

  6. SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

    Aug 5, 2026Yue Zhang, Yingzhao Jian, Yunqiu Xu +2Mixture of ExpertsMultimodal Large Language Models

  7. OPD-V: Visual On-Policy Self-Distillation with Modality Balance

    Aug 5, 2026Aniri, Jinhe Bi, Peng Liao +5Modality ImbalanceOn-Policy Self-Distillation

  8. Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

    Aug 5, 2026Yang Yang, Jiawei Chen, Tairan Chen +1Multimodal GroundingVisual Spatial Reasoning

  9. A Model Merging Approach for Continual MLLM Unlearning

    Aug 5, 2026Yuhang Wang, Linlin Zhang, Haoxuan Ji +3Multimodal Large Language ModelsMLLM Unlearning

  10. Multi-Branch Policy Optimization for Multimodal Large Language Models

    Aug 5, 2026Shuai Lyu, Yuning Gong, Ruiling Gao +7Credit Assignment in RLMultimodal Large Language Models

  11. SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

    Aug 4, 2026Sirun Li, Minghao Liu, Ling Dai +4VLM RobustnessMultimodal Large Language Models

  12. ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

    Aug 4, 2026Yang Yang, Qinyu Zhao, Mouxiang Chen +5Vision-Language ModelsMultimodal Large Language Models

  13. OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

    Aug 4, 2026Wanshun Su, Yang Shi, Feihu Liu +10Efficient Multimodal InferenceAudio Token Compression

  14. Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement

    Aug 4, 2026Chunyang Jiang, Pingping Zhang, Yuzhi Zhao +9Synthetic Data AugmentationData Augmentation

  15. Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

    Aug 4, 2026Khai-Nguyen Nguyen, Oscar Chaparro, Antonio MastropaoloCode GenerationMultimodal Large Language Models

  16. Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training

    Aug 4, 2026Yibei Liu, Jiajun Chen, Qianle Zhang +4Multimodal Large Language ModelsRisk-Sensitive RL

  17. ChartAnno: Benchmarking Multimodal Large Language Models for Chart Annotation Generation

    Aug 4, 2026Zhenghan Chen, Zekai Shao, Lidan Tan +10Data VisualizationMultimodal Large Language Models

  18. Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

    Aug 4, 2026Haoqian Kang, Liupeng Li, Kuofeng Gao +5Efficient Multimodal InferenceMultimodal Large Language Models

  19. ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models

    Aug 4, 2026Xiaolin Chen, Xuemeng Song, Wenhao Shi +3Multimodal Large Language ModelsMultimodal Emotion Recognition

  20. DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning

    Aug 4, 2026Le Xiang, Zhicheng Guan, Hong Chen +5Visual Question AnsweringMultimodal Large Language Models

  21. NeuroMosaic: Anatomically Grounded Multimodal Large Language Modeling for Molecularly Aware Glioma Reasoning from 3D MRI and Clinical Narratives

    Aug 4, 2026Yantong Liu, Zheyu Zhang, Runpeng Liu +3Multimodal Large Language ModelsMedical VLMs

  22. ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs

    Aug 3, 2026Zizhong Ding, Junxian Li, Kai Liu +4Efficient Multimodal InferenceMultimodal Large Language Models

  23. Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models

    Aug 3, 2026Junxiang You, Junkai Chen, Yuhao He +3Multimodal Large Language ModelsMLLM Unlearning

  24. Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

    Aug 3, 2026Qianlong Yang, Bowen Ye, Xianda Guo +4VLM RobustnessMultimodal Large Language Models

  25. PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle

    Aug 2, 2026Yicheng Xiao, Haoxuan Ma, Caorui Li +7Self-Supervised LearningVLM Adaptation

  26. CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

    Jul 31, 2026Wenxin Tang, Jingyu Xiao, Zhenyu Liu +6Efficient Multimodal InferenceMultimodal Large Language Models