Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. Large Language Models in Transportation Systems Management and Operations: From Text Reasoning to Multi-modal Decision Support

    May 31, 2026Siyan Li, Zehao Wang, Jiachen Li +3AI-Assisted Decision MakingIntelligent Transportation Systems

  2. Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

    May 31, 2026Wanlong Fang, Tianle Zhang, Wen Tao +1Multimodal GroundingMultimodal Large Language Models

  3. MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue

    May 30, 2026Yue Jiang, Xue Jiang, Lihua Zhang +6Multimodal Large Language ModelsMultimodal Hallucination

  4. MindZero: Learning Online Mental Reasoning With Zero Annotations

    May 29, 2026Shunchi Zhang, Jin Lu, Chuanyang Jin +3Self-Supervised LearningTheory of Mind

  5. ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

    May 29, 2026Kaiwen Xue, Tao Wei, Guoxin Zhang +5Spatial Reasoning BenchmarksVisual Spatial Reasoning

  6. The Regularizing Power of Language-Training Deepfake Detectors

    May 29, 2026Benedikt Hopf, Zongwei Wu, Radu TimofteVLM RobustnessExplainable Deepfake Detection

  7. AMix-2: Establishing Protein as a Native Modality in Large Language Models

    May 29, 2026Keyue Qiu, Yixin Wu, Lihao Wang +19Multimodal Large Language ModelsProtein Language Models

  8. Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages

    May 29, 2026Fan Wu, Lishuai Dong, Cuiyun Gao +4Web Application GenerationCode Generation

  9. MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

    May 29, 2026Qian Kou, Xiaofeng Shi, Yulin Li +4Visual Spatial ReasoningMultimodal Large Language Models

  10. Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models

    May 28, 2026Leijiang Gu, Zhen Zeng, Feng Li +2Knowledge EditingMultimodal Large Language Models

  11. DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning

    May 28, 2026Junzhe Zhang, Huixuan Zhang, Guirong Wang +5Counterfactual EvaluationCounterfactual Reasoning in Language Models

  12. SalsaAgent: A multimodal embodied language model for interactive dance generation

    May 28, 2026Payam Jome Yazdian, Zoe Stanley, Angelica LimMultimodal Large Language ModelsHuman Motion Generation

  13. Persona Prompting in Multimodal Urban Perception: Descriptive Convergence and Interpretive Variation

    May 27, 2026Neemias da Silva, Matt Ratto, Myriam Delgado +3Multimodal Large Language ModelsLanguage Model Bias Evaluation

  14. OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

    May 27, 2026Xinchen Zhang, Bowei Liu, Jiale Liu +7Multimodal Large Language ModelsReinforcement Learning with Verifiable Rewards

  15. Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

    May 27, 2026Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell +1VLM EvaluationMultimodal Large Language Models

  16. SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter

    May 27, 2026Lee Jung-Mok, Kim Sung-Bin, Joohyun Chang +2Mixture of ExpertsMultimodal Large Language Models

  17. Rethinking Visual Neglect: Steering via Context-Preference for MLLM Hallucination Mitigation

    May 27, 2026Jingwen Wu, Xijun Zhang, Ge SongLLM Hallucination MitigationHallucination in Language Models

  18. Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

    May 27, 2026Jiawei Kong, Hao Fang, Shunxiang Liao +5Multimodal GroundingDirect Preference Optimization

  19. OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

    May 26, 2026Guangzhi Sun, Yixuan Li, Yudong Yang +1Streaming Video UnderstandingMultimodal Large Language Models

  20. Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

    May 26, 2026Partho Ghose, Al Bashir, Prem Raj +1Agricultural Image AnalysisVLM Hallucination

  21. Touch-R1: Reinforcing Touch Reasoning in MLLMs

    May 26, 2026Yingxin Lai, Yafei Zhou, Fucai Zhu +2Tactile SensingMultimodal Large Language Models

  22. Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning

    May 26, 2026Junkai Chen, Yuhao He, Junxiang You +3VLM UnlearningMultimodal Large Language Models

  23. LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?

    May 26, 2026Xiaohan Wang, Mingze Yin, Yilin Zhao +2Mathematical Reasoning BenchmarksEducational Assessment

  24. OnceSelect: Reusable Data Selection for Efficient Multimodal Instruction Tuning

    May 26, 2026Mingkang Dong, Muxin Pu, Hongyi Cai +5Instruction-Tuning Data SelectionMultimodal Large Language Models