Multimodal Large Language Models

Latest papers 877

All topics
CardsList
  1. DIPrune: Task-Aware Token Pruning with Dual Importance for Efficient Multimodal Language Models

    Oct 6, 2026Shuo Yang, Changbai Li, Linlin Yang +6Visual Token PruningMultimodal Large Language Models

  2. OmniConfess: Eliciting Token Confessions to Mitigate Omni-Modal Hallucination

    Oct 2, 2026Huiqiang Rong, Haoran Luo, Hui Feng +4Large Language Model HallucinationOmni-Modal

  3. Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes

    Oct 1, 2026Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc +2Multimodal Large Language ModelsRecent Vision-Language Models

  4. Form and Void: Entangled Composition through an Autonomous AI Agent

    Oct 1, 2026Shiwen Wang, Jian Yang, Xu Wang +2Visual GenerationMultimodal Generation

  5. Beyond Linear Concepts: Discovering and Aligning Non-Linear Concept Manifolds in Large Language Models

    Oct 1, 2026Tido Specht, Elias Benedict Krey, Nils Neukirch +1Large Language Model AlignmentMultimodal Large Language Models

  6. MWOP: Modality-aware Width-wise Operation Pruning for Efficient MLLMs

    Oct 1, 2026Xudong Wang, Hao Wu, Haozhe Hu +5Visual Token PruningLarge Language Model Compression

  7. GLoC-EHR: Evidence-Cited Clinical Reasoning over Global Context and Local EHR Events

    Oct 1, 2026Chaiho Shin, Kwangsoo KimElectronic Health RecordsPatient Trajectories

  8. Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis

    Sep 30, 2026Tian Xia, Minghao Liu, Yiqing Liang +2Multimodal Clinical DataMultimodal Large Language Models

  9. TACTIC: Temporal and Context-Aware LLM Tactical Planning for Roadside LiDAR Attacks

    Sep 30, 2026Yiming Gao, Shaocheng LuoTwo-Dimensional Light Detection And RangingAutonomous Driving Perception

  10. MCD: Causal Distillation of Multimodal In-Context Learning in Large Vision-Language Models

    Sep 30, 2026Yanshu Li, Jiaqian Li, Canran Xiao +3Multimodal Large Language ModelsKnowledge Distillation

  11. ChartDensity-Bench: Benchmarking MLLMs for Numerical Data Reconstruction under Visual Density

    Sep 30, 2026Xinhe Wu, Yadong JinDenseMultimodal Large Language Models

  12. Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

    Sep 29, 2026Jaewoo Jung, Hyeonseo Yu, Honggyu An +10Spatial ReasoningMultimodal Large Language Models

  13. Why MLLMs Struggle to Count: Overcoming Individuation and Aggregation Bottlenecks with ConvStack

    Sep 29, 2026Liwei Che, Yihao Quan, Sen Fang +4Fine-Grained PerceptionMultimodal Large Language Models

  14. OmniRoute: Mapping Temporal Semantic Evidence to Audio-Visual Token Budgets for Efficient Omnimodal Large Language Models

    Sep 29, 2026Yuchen Deng, Zidang Cai, Feidiao Yang +4Omni-ModalAudio-Visual Reasoning

  15. Representation Dynamics Reveal Semantic Saliency and Similarity for Visual Token Pruning in MLLMs

    Sep 29, 2026Weixuan Li, Zikun Zhou, Xinyi Zhuang +4Long Visual-Token SequencesMultimodal Large Language Models

  16. Calibrate the Decisions That Change the Future: On-Policy Post-Training Quantization for Multimodal Large Language Models

    Sep 29, 2026Wenxiao Fan, Jingling Fu, Lichen Ma +6Post-Training QuantizationPost-Training

  17. Decoding Affective Nuances: Enhancing MLLMs via Hierarchical Emotion Reasoning and Contrastive Discriminative Pruning

    Sep 29, 2026Cheng Ye, Weidong Chen, Zhaobo Qi +2Multimodal Large Language ModelsAffective

  18. ThinkingGuard: Decoding Implicit Hazards via Step-by-Step Risk Attribution in Multimodal Large Language Models

    Sep 29, 2026Ruochen Zhang, Yao Huang, Yitong Sun +5Large Language Model SafetyMultimodal Large Language Models

  19. AdaKerNet: Neural Kernel Decoding for Task-Adaptive Prediction with Multimodal Large Models

    Sep 28, 2026Konstantinos D. Polyzos, Eleni Oikonomou, Tara JavidiLarge Language Model AdaptationUnimodal Encoders

  20. From Sharp Eyes to Expert Mind: Internalizing Expert Knowledge in MLLMs for Tampered Text Detection

    Sep 28, 2026Kaiqing Lin, Songze Li, Shen Chen +8Tamper LocalizationDigital Forensics

  21. Render Before Reading: Visual Rendering as a Prompt Injection Defense

    Sep 28, 2026Jie Zhang, Andrei Baroian, Jan N. van Rijn +2Indirect Prompt InjectionMultimodal Large Language Models

  22. Look Before You Judge: Training-Free Region Mining for Grounded and Explainable Deepfake Detection

    Sep 28, 2026Chia-Ling Chen, Yu-Ting Ta, Jian-Yu Jiang-Lin +8Deepfake DetectionUnsupervised Detection

  23. ReVA: A Scene-Centric Dataset Beyond Repetition for Remote Sensing Video Question Answering

    Sep 28, 2026Zhen Yao, Likai Wang, Yuming Yang +9Remote SensingMultimodal Reasoning Benchmarks

  24. Automated Species Identification in Camera Trap Images for Wildlife Conservation

    Sep 28, 2026Nowshin Amin, Nafisa Tabassum Oyshi, Tahmid Abrar Zidan +2Species IdentificationRoadside Cameras

  25. Token-Disentangled Latent Test-Time Scaling for Vision-Language Reasoning

    Sep 28, 2026Hao-Xuan Ma, Yihao Liu, Yutao Sun +8Compact Latent Sensor TokensMultimodal Large Language Models

  26. Advancing Video-Text Pretraining with Multi-View Captions

    Sep 28, 2026Fida M. Thoker, Renaud Vandeghen, Karen Sanchez +2Text-To-Video Generation ModelImage Difference Captioning

  27. SPIDER: Multi-Layer Semantic Token Pruning and Adaptive Sub-Layer Skipping in Multimodal Large Language Models

    Sep 28, 2026Tianxiang Chen, Zhentao Tan, Zi Ye +9Visual Token PruningMultimodal Large Language Models

  28. Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models

    Sep 28, 2026Jingdi lei, Junxian Li, Di Zhang +3Long Visual-Token SequencesMultimodal Large Language Models

  29. Counterfactual Attention Policy Distillation for Temporal Video Grounding

    Sep 28, 2026Shaobo Ju, Haiyang Yu, Xuecheng Wu +5Video Temporal GroundingMultimodal Large Language Models

  30. DPS: Dual-Mode Precision LLM Serving with Semi-Unified Memory

    Sep 28, 2026Xuan Truong Nguyen, Tien Son Pham, Tuan Duc Chu +2Graphics Processing Unit MemoryKv-Cache Management

  31. MaLiang-Harness: A Programmable Path to Image and Video Generation

    Sep 28, 2026Haoyu Zhao, Zihao Zhang, Xudong Wang +4Visual GenerationVideo Generation

  32. PhysFieldBench: Can Multimodal Models Understand Physical Fields?

    Sep 28, 2026Yuezhou Ma, Huikun Weng, Jialong Wu +5Multimodal Large Language ModelsMultimodal Model

  33. MetaSampling: Making Frame Samplers Efficient for Long-Video Question Answering

    Sep 27, 2026Ashim Dahal, Bikramjit BanerjeeLong Video Question AnsweringMultimodal Large Language Models

  34. One Attack to Fool Them All: Highly Transferable Black-Box Adversarial Attacks on Frontier MLLMs

    Sep 27, 2026Sen Nie, Jie Zhang, Zhongqi Wang +2Black-Box Adversarial AttacksMultimodal Large Language Models

  35. Learning Multimodal Embeddings with Evidence-Aligned Readout

    Sep 27, 2026Zirong Chen, Fuda Ye, Enjun Du +8Multimodal EmbeddingsMultimodal Large Language Models

  36. SphMind: Towards Robust, Training-Free VLM-based Spatial Reasoning with a 360 Camera

    Sep 27, 2026Shriram Damodaran, Soumyaratna Debnath, Cheston Tan +1Spatial ReasoningMultimodal Large Language Models

  37. Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction

    Sep 26, 2026Junxian Li, Ruixuan Yang, Tianao Zhang +3Multimodal Large Language ModelsCurriculum

  38. The Alignment Illusion in Multimodal Large Language Models

    Sep 24, 2026Hong-Han Wang, Yuntao Wang, Hu DingMultimodal Large Language ModelsLarge Language Model Alignment

  39. Mind What Matters for Reasoning: Aligning Cross-Modal Attention via Selective Probability Mass Concentration

    Sep 24, 2026Jiaqi Deng, Zonghan Wu, Zhan Heng +3Multimodal ReasoningMultimodal Large Language Models

  40. MoVISA: Multi-Token Reasoning for Video Object Segmentation

    Sep 24, 2026Ruining Zhao, Ho Kei Cheng, Alexander G SchwingVideo Object SegmentationMultimodal Large Language Models

  41. DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs

    Sep 23, 2026Yingxuan Zhuang, Miao Pan, Wangjie Gan +6Large Language Model Reinforcement LearningLarge Language Model Hallucination

  42. Pistis Technical Report

    Sep 23, 2026Heyun Chen, Xiaohan Lan, Jiaxi Li +17Multimodal AgentsMultimodal Large Language Models

  43. RGSQ: Riemannian Geometry-Sensitive Quantization for Large Vision-Language Models

    Sep 21, 2026Zhiping Wu, Dongdong Ren, Yangchengyu Zhou +4Large Language Model QuantizationPost-Training Quantization

  44. SLICEChat: Progressive In-Encoder Token Pruning for Whole-Slide Pathology Language Models

    Sep 21, 2026Ali Kerem Bozkurt, Baris Cem Bakay, Ibrahim Kulac +3Whole-Slide ImagesPathology Foundation Models

  45. Look Where It Counts: A Free, Label-Free Visual Evidence Signal for Fine-Grained Vision-Language Reasoning

    Sep 21, 2026Santi Ram Tiwari, Nihal Naik, Devbrat Pandey +1Fine-Grained PerceptionRecent Vision-Language Models

  46. Representation-guided in-context learning for medical image interpretation with multimodal large language models

    Sep 21, 2026Minda Zhao, Fangyu Hu, Yan Luo +8Medical Vision-Language ModelsMultimodal Clinical Data

  47. PackLab: A Comprehensive Framework for Developing, Training, and Evaluating MLLMs in Robotic Bin Packing

    Sep 20, 2026Donghao Zhou, Jia-Hui Pan, Fan Zhang +6Robot StateMultimodal Large Language Models