Multimodal Large Language Models

Latest papers 877

All topics
CardsList
  1. VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

    Nov 25, 2025Tianxiang Jiang, Sheng Xia, Yicheng Xu +5Video Multimodal Large Language ModelsMultimodal Large Language Models

  2. Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning

    Nov 25, 2025Zhen Zeng, Leijiang Gu, Zhangling Duan +4Large Language Model UnlearningMultimodal Large Language Models

  3. WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

    Nov 25, 2025Seungjun Yu, Seonho Lee, Namho Kim +5Waymo Open Motion DatasetAutonomous Driving

  4. Thinking Ahead: Foresight Intelligence in MLLMs and World Model

    Nov 24, 2025Zhantao Gong, Liaoyuan Fan, Qing Guo +3Recent Vision-Language ModelsForesight

  5. Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents

    Nov 24, 2025Dayong Liu, Chao Xu, Weihong Chen +5Embodied AgentsFine-Grained Actions

  6. RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

    Nov 22, 2025Jun Zhang, Xin Zhang, Jie Feng +5Multimodal Large Language Models

  7. VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

    Nov 21, 2025Lingxiao Li, Yifan Wang, Xinyan Gao +3Multimodal Large Language ModelsRecent Vision-Language Models

  8. SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

    Nov 10, 2025Hunar Batra, Haoqin Tu, Hardy Chen +3Spatial ReasoningSpatial Grounding

  9. SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

    Nov 3, 2025Xinyu Mao, Junsi Li, Haoji Zhang +2Cross-Modal AlignmentMultimodal Large Language Models

  10. GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding

    Nov 2, 2025Shijie Zhou, Viet Dac Lai, Hao Tan +4Graphical User InterfaceMultimodal Large Language Models

  11. Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

    Oct 20, 2025Yulin Luo, Chun-Kai Fan, Menghang Dong +19RobocasaEvaluation Benchmarks

  12. Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

    Oct 10, 2025Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra +6Multimodal Large Language ModelsCross-Modal Attention

  13. Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs

    Oct 1, 2025Sanghwan Kim, Rui Xiao, Stephan Alaniz +2Multimodal Large Language ModelsRecent Vision-Language Models

  14. LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

    Sep 28, 2025Shubhang Bhatnagar, Andy Xu, Kar-Han Tan +1Large Language Model QuantizationMultimodal Large Language Models

  15. Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models

    Sep 26, 2025Jiawei Liang, Jianjie Huang, Ruoyu Chen +4Multimodal Large Language ModelsToken-Level Uncertainty

  16. Bridging the Gap in Ophthalmic AI: MM-Retinal-Reason Dataset and OphthaReason Model toward Dynamic Multimodal Reasoning

    Aug 22, 2025Ruiqi Wu, Yuang Yao, Na Su +11Multimodal ReasoningOphthalmology

  17. AD-FM: Multimodal LLMs for Anomaly Detection via Multi-Stage Reasoning and Fine-Grained Reward Optimization

    Aug 6, 2025Jingyi Liao, Yongyi Su, Rong-Cheng Tu +6Vision-Language Model AdaptationMultimodal Large Language Models

  18. Test-time Prompt Refinement for Text-to-Image Models

    Jul 22, 2025Mohammad Abdul Hafeez Khan, Yash Jain, Siddhartha Bhattacharyya +1Modern Text-To-Image ModelsImage Generation

  19. Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey

    Jul 21, 2025Jindong Li, Yali Fu, Jiahong Liu +5Large Language Model QuantizationMultimodal Large Language Models

  20. Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation

    Jun 29, 2025Sunggu Kyung, Jinyoung Seo, Hyunseok Lim +7Radiology Report GenerationCone-Beam Computed Tomography

  21. Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

    Jun 11, 2025Zhaoyang Wei, Bowen Jiang, Xumeng Han +6Multimodal ReasoningVisual Reasoning

  22. The NTNU System at the S&I Challenge 2025 SLA Open Track

    Jun 5, 2025Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang +4Wav2VecTranscript

  23. Seeing Isn't Orienting: A Cognitively Informed Hierarchical Benchmark for Object Orientation in MLLMs

    May 27, 2025Nazia Tasnim, Keanu Nichols, Yuting Yan +4Spatial ReasoningObject-Centric Representations

  24. Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing

    May 15, 2025Chunyu Ye, Yunhao Zhang, Jingyuan Sun +3Brain-Computer InterfaceMultimodal Alignment

  25. Multimodal Language Models as Text-to-Image Model Evaluators

    May 1, 2025Jiahui Chen, Candace Ross, Reyhane Askari-Hemmat +5Modern Text-To-Image ModelsText-To-Image

  26. CompArt: Operationalizing Aesthetic Alignment in Text-to-Image Generation via Principles of Art

    Mar 15, 2025Zhe Jin, Tat-Seng ChuaArtValue Alignment

  27. SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs

    Mar 11, 2025Parsa Hosseini, Sumit Nawathe, Mazda Moayeri +2Multimodal Large Language ModelsLarge Language Models Fail

  28. Histopathology Multi-modal Embedding for Pathology Composed Retrieval

    Feb 11, 2025Qifeng Zhou, Wenliang Zhong, Thao M. Dang +4Pathology Foundation ModelsMultimodal Clinical Data

  29. A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models

    Feb 9, 2025Huiyao Chen, Meishan Zhang, Jing Li +4Multimodal Large Language ModelsNatural Language Processing

  30. Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models

    Dec 21, 2024Yanxu Mao, Peipei Liu, Tiehan Cui +3Large Language Model JailbreaksJailbreak Attacks

  31. MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning

    Sep 9, 2024Jianyi Zhang, Hao Frank Yang, Ang Li +5Multimodal Large Language ModelsHeterogeneity

  32. Multimodal Large Language Model driven Radiology Report Generation with Clinical Knowledge Enhancement

    Mar 11, 2024Miaojing Shi, Tianyu Cen, Zijie Yue +3Radiology Report GenerationMultimodal Clinical Data

  33. Do Multimodal LLMs See Before They Read? Diagnosing Contextual Sycophancy

    Date pendingYi-Cheng Lai, Hen-Hsen HuangMultimodal Large Language ModelsSycophancy

  34. Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

    Date pendingGuiqiu Liao, Matjaz Jogan, Daniel A. HashimotoLong Visual-Token SequencesMultimodal Large Language Models

  35. SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics

    Date pendingHaolong Hu, Hanyu Li, Tiancheng He +6Mllm-BasedLarge Language Model Alignment