Multimodal Large Language Models

Latest papers 877

All topics
CardsList
  1. Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

    Apr 19, 2026Shaoguang Wang, Weiyu Guo, Ziyang Chen +2Video UnderstandingKeyframe Selection

  2. SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning

    Apr 19, 2026Yian Li, Yang Jiao, Bin Zhu +4Spatial ReasoningMultimodal Large Language Models

  3. Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

    Apr 19, 2026Yunkai Dang, Yifan Jiang, Yizhu Jiang +3Confidence EstimationMultimodal Large Language Models

  4. RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation

    Apr 19, 2026Rui Min, Liang Yao, Shiyu Miao +5Remote SensingEarth Observation

  5. Enhancing Zero-shot Personalized Image Aesthetics Assessment with Profile-aware Multimodal LLM

    Apr 19, 2026Chun Wang, Chenfeng Wei, Chenyang Liu +1Zero-Shot RobustnessZero-Shot

  6. Modeling Multi-Dimensional Cognitive States in Large Language Models under Cognitive Crowding

    Apr 19, 2026Lin Zhong, Siyu Zhu, Zizhen Yuan +5Multimodal Large Language ModelsCognitive Science

  7. Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models

    Apr 18, 2026Bruce A. Bassett, Amy Rouillard, Sitwala Mundia +8Multimodal Clinical DataMultimodal Large Language Models

  8. DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models

    Apr 18, 2026Biao Wu, Yiwu Zhong, Meng Fang +1Multimodal Large Language ModelsMultimodal Learning

  9. MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation

    Apr 18, 2026Bo Li, Ningyuan Deng, Tianyu Dong +3Unpaired Image-To-Image TranslationContrastive Language-Image Pre-Training Model

  10. PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging

    Apr 18, 2026Zibo Shao, Baochen Xiong, Xiaoshan Yang +4Cross-Modal AlignmentMultimodal Pretraining

  11. Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models

    Apr 18, 2026Xinru Yan, Boxi Cao, Yaojie Lu +4Multimodal Large Language ModelsOmni-Modal

  12. Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs

    Apr 17, 2026Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian +1Spatial ReasoningStable Spatial Understanding

  13. Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

    Apr 17, 2026Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti +2Visual ReasoningMultimodal Large Language Models

  14. ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

    Apr 17, 2026Qiang Xu, Shengyuan Bai, Yu Wang +6Chemical StructuresVisual Reasoning

  15. RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees

    Apr 17, 2026Yichen Xu, Yuanhang Liu, Chuhan Wang +5Video Multimodal Large Language ModelsLong-Video Benchmarks

  16. Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning

    Apr 17, 2026Xiaoyu Yang, En Yu, Wei Duan +1Large Language Model AdaptationMultimodal Large Language Models

  17. RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models

    Apr 16, 2026Gabriele Mattioli, Evelyn Turri, Sara Sarto +4Multimodal Search AgentsMultimodal Large Language Models

  18. Confidence under Visual Token Pruning: Removed Evidence and Risk-Controlled Token Budgets for MLLMs

    Apr 13, 2026Kaizhen Tan, Yang Feng, Heqing Du +3Visual Token PruningMultimodal Large Language Models

  19. FusionBERT: Multi-View Image--3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder

    Apr 2, 2026Wei Li, Yufan Ren, Hanqing Jiang +6Cross-View FusionProgressive Attention Fusion

  20. Steerable Visual Representations

    Apr 2, 2026Jona Ruthardt, Manu Gaur, Deva Ramanan +2Visual RepresentationsVision Encoders

  21. Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos

    Mar 26, 2026Abdullah Hamdi, Changchun Yang, Xin GaoPolyp SegmentationColonoscopy

  22. VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning

    Mar 26, 2026Zhe Gao, Shiyu Shen, Taifeng Chai +7Video UnderstandingLong Videos

  23. ReLope: From Hidden-State Probing to a Decision Module for Multimodal LLM Routing

    Mar 25, 2026Yaopei Zeng, Congchao Wang, Blake JianHang Chen +1Large Language Model RoutingMultimodal Large Language Models

  24. SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

    Mar 24, 2026Haoyu Huang, Jinfa Huang, Zhongwei Wan +3Multimodal AgentsMultimodal Large Language Models

  25. DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

    Mar 24, 2026Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov +3Open-Vocabulary Object DetectionObject Detection

  26. Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

    Mar 21, 2026Huan Zheng, Yucheng Zhou, Tianyi Yan +6ColonoscopyMultimodal Clinical Data

  27. ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

    Mar 19, 2026Thomas De Min, Subhankar Roy, Stéphane Lathuilière +2Multimodal Large Language ModelsProactive

  28. On Optimizing Multimodal Jailbreaks for Spoken Language Models

    Mar 19, 2026Aravind Krishnan, Karolina Stańczak, Dietrich KlakowLarge Language Model JailbreaksJailbreak Attacks

  29. EvoGuard: An Extensible Agentic RL-based Framework for Practical and Evolving AI-Generated Image Detection

    Mar 18, 2026Chenyang Zhu, Maorong Wang, Jun Liu +2Ai-Generated Image DetectionMultimodal Large Language Models

  30. CoMMET: A Psychologically Grounded Benchmark for Evaluating Theory of Mind in Multimodal LLMs

    Mar 12, 2026Ruirui Chen, Weifeng Jiang, Chengwei Qin +3Multimodal Large Language ModelsSocial Reasoning

  31. Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

    Mar 12, 2026Mei Chee Leong, Ying Gu, Hui Li Tan +2Multimodal Large Language ModelsValidation

  32. Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

    Mar 6, 2026Lijiang Li, Zuwei Long, Yunhang Shen +6Multimodal Diffusion ModelsMultimodal Foundation Model

  33. Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design

    Mar 4, 2026Yuxuan Yang, Xiaotong Mao, Jingyao WangMllm-BasedMultimodal Large Language Models

  34. IDProxy: CTR Prediction with Multimodal LLMs for Cold-Start Recommendation at Xiaohongshu

    Mar 2, 2026Yubin Zhang, Haiming Xu, Guillaume Salha-Galvan +6Click-Through Rate PredictionCold-Start

  35. EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

    Feb 27, 2026Yiyang Fang, Wenke Huang, Pei Fu +5Multimodal Large Language ModelsEmotion Recognition

  36. OmniGAIA: Towards Native Omni-Modal AI Agents

    Feb 26, 2026Xiaoxi Li, Wenxiang Jiao, Jiarui Jin +10Omni-ModalMultimodal Agents

  37. BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning

    Feb 25, 2026Mingi Kim, Yongjun Kim, Jungwoo Kang +1Computer-Aided Design ObjectsMultimodal Large Language Models

  38. Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation

    Feb 2, 2026Xinshun Wang, Peiming Li, Ziyi Wang +5Human Motion GenerationSkeleton

  39. A Multimodal Large Language Model-Driven Framework for Context-Aware UAV Emergency Landing Site Selection

    Feb 1, 2026Chunliang Hua, Lei Zhang, Jiayang Sun +2Cooperative Air CombatLandslides

  40. Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

    Jan 31, 2026Zicheng Kong, Dehua Ma, Zhenbo Xu +9Large Language Model AlignmentProgress Reward Modeling

  41. TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs

    Jan 30, 2026Baiqi Li, Kangyi Zhao, Ce Zhang +3Spatio-Temporal ReasoningMultimodal Large Language Models

  42. SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

    Jan 29, 2026Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum +2Audio-Visual ReasoningLarge Audio Language Models

  43. AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

    Jan 20, 2026Aahana Basappa, Pranay Goel, Anusri Karra +3Multimodal Large Language ModelsVisual Reasoning

  44. ChartAttack: Testing the Vulnerability of LLMs to Malicious Prompting in Chart Generation

    Jan 19, 2026Jesus-German Ortiz-Barajas, Jonathan Tonglet, Vivek Gupta +1Multimodal Large Language ModelsAttacker

  45. M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

    Jan 13, 2026Juntao Jiang, Jiangning Zhang, Yali Bi +7Medical ImagesDiagnostic Benchmark

  46. BabyVision: Visual Reasoning Beyond Language

    Jan 10, 2026Liang Chen, Weichu Xie, Yiyan Liang +27Recent Vision-Language ModelsVisual Reasoning

  47. Towards Multi-modal Multi-turn Safety: From Agentic Interaction to Strategic Alignment

    Jan 8, 2026Han Zhu, Jiale Chen, Chengkun Cai +8Safety AlignmentMultimodal Large Language Models

  48. MOSS Transcribe Diarize Technical Report

    Jan 4, 2026MOSI. AI, :, Donghua Yu +22Speaker DiarizationTranscript

  49. SpatialMosaic: A Multiview VLM Dataset for Partial Visibility

    Dec 29, 2025Kanghee Lee, Jungi Hong, Sion Lee +4Multimodal Large Language ModelsVisibility

  50. SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

    Dec 17, 2025Hongbo Wang, AprilPyone MaungMaung, Isao EchizenToxicityLarge Language Model Safety

  51. Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

    Dec 16, 2025Yankai Jiang, Yujie Zhang, Peng Zhang +5Semi-Supervised Medical Image SegmentationMultimodal Large Language Models