Multimodal Large Language Models

Also known as MLLM

Latest papers 676

All topics
CardsList
  1. RegRet: Enhancing Region-Level Retrieval in Large Multimodal Models

    Sep 15, 2026Xun Liang, Honghui Yang, Weihang Pan +6Multimodal IRMultimodal Large Language Models

  2. ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training

    Sep 15, 2026Zhihao Zhang, Mingqi Wu, Qiaole Dong +15Fine-TuningMultimodal Large Language Models

  3. A multimodal large language model for evidence-based autism spectrum disorder screening

    Sep 15, 2026Jun Chen, Qi Zhao, Yunliang Jiang +8Autism Spectrum DisorderMultimodal Large Language Models

  4. Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training

    Sep 14, 2026Yuanhao Yue, Qianli Ma, Chengyu Wang +3Multimodal Large Language ModelsCurriculum RL

  5. Calibrated Ambiguity in Multimodal Language Models: Humans reach for cultural references, while models describe the picture

    Sep 14, 2026Cody Kommers, Mingrui Ye, Evelyn Gius +4Pragmatic Reasoning in Language ModelsMultimodal Large Language Models

  6. Func-R1: Incentivizing Mathematical Function Reasoning in Multimodal Large Language Models

    Sep 13, 2026Mingze Yin, Xiaohan Wang, Dian Li +8Multimodal Large Language ModelsMathematical Reasoning

  7. Bidirectional Multimodal Fusion of Sky Images and Time-Series for Solar Forecasting with Large Language Models

    Sep 11, 2026Ken Chen, Maneesha Perera, Wei Wang +3Multivariate Time Series ForecastingMultimodal Large Language Models

  8. OmniHallu: Unified Hallucination Detection for Cross-Modal Comprehension and Generation in Multimodal Large Language Models

    Sep 11, 2026Jianjiang Yang, Peihang Li, Shanqing Xu +3Hallucination Detection in VLMsHallucination Detection

  9. OmniKVQuant: KV Cache Quantization for Omni-LLMs

    Sep 11, 2026Suho Yoo, Hyunjong Ok, Jongmin Choi +2Efficient Multimodal InferenceKV Caching

  10. S3S^3-Bench: Evaluating Speech Interaction Models as Scientific Voice Assistants

    Sep 9, 2026Heyang Liu, Jiayi Huang, Wenyang Xiao +8Audio QASpoken Dialogue Systems

  11. InfluenceField: A Differentiable Field with Interventionally Identifiable Causal Structure for Multimodal World Modeling

    Sep 7, 2026Zihao Yang, Zijia Wang, Zhiqiu HuangCausal Representation LearningCausal World Models

  12. InSituMeasure: Probing Situated Measurement Grounding in Industrial Scenes with Multimodal Large Language Models

    Sep 3, 2026Chao Shen, Xinyuan Li, Yunfan Zhou +4Multimodal GroundingMultimodal Robustness

  13. Beauty is in the AI of the beholder: MLLMs systematically overrate facial attractiveness

    Sep 2, 2026Santiago Grandas, Juan Sebastian Cely-Acosta, Mohit Mendiratta +2Multimodal Large Language ModelsHuman-AI Agreement

  14. YesTrack: Referring Multi-Object Tracking via MLLM-based Yes/No Verification

    Sep 2, 2026Quansheng Hu, Qin Sun, Qiansen Dai +4Multi-Object TrackingMultimodal Large Language Models

  15. Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models

    Sep 2, 2026Tianqi Xiao, Shiyao Cui, Minghao Zhang +2Multimodal Large Language ModelsRepresentation Engineering

  16. DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense Documents

    Sep 2, 2026Zhuoran Yu, Le Thien Phuc Nguyen, Jaden Park +5Multimodal Large Language ModelsChart QA

  17. S2^2Prune: Spatially Structured Visual Token Pruning for Multimodal Large Language Models

    Sep 1, 2026Yuanyuan Jia, Shunpu Tang, Qianqian YangEfficient VLM InferenceMultimodal Large Language Models

  18. SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models

    Sep 1, 2026Shiyu Li, Zi-Yuan Hu, Shijia Huang +3Efficient VLM InferenceMultimodal Large Language Models

  19. Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain

    Sep 1, 2026Daizong Liu, Junhao Dong, Zhiyuan Ma +6Adversarial Attacks on VLMsAdversarial Attacks

  20. Distributed Implicit Harm: A Compositional Safety Blind Spot in MLLM-Based Video Moderation

    Aug 31, 2026Ruotong Wang, Zihao Zhu, Siwei Lyu +2Multimodal Large Language ModelsVideo Content Moderation

  21. MMDS-Bench: Benchmarking Multimodal Large Language Models on Dynamic Stance in Social Media Interactions

    Aug 31, 2026Yuzhe Ding, Kang He, Li Zheng +5Multimodal Large Language ModelsMultimodal Reasoning

  22. GUIDE: Guiding Internal Evidence with Language Instructions

    Aug 31, 2026Soyeon Caren Han, Hyunsuk Chung, Jinwoo Kim +2Multimodal RobustnessMultimodal Large Language Models