Multimodal Large Language Models

Latest papers 877

All topics
CardsList
  1. Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration

    May 12, 2026Mingtao Xian, Yifeng Yang, Qinying Gu +2Multimodal Large Language ModelsCross-Modal Attention

  2. When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs

    May 12, 2026Fanpu Cao, Xin Zou, Xuming Hu +1Large Language Model HallucinationMultimodal Large Language Models

  3. LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs

    May 12, 2026Jingfeng Chen, Jiawen Qian, Wendi Deng +5Video UnderstandingFrame Rate

  4. Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts

    May 12, 2026Eunho Lee, Rei Kawakami, Youngbae HwangImage RestorationQuery-Specific Degradation-Aware Representation

  5. LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

    May 11, 2026Xueqi Cheng, Yushun DongLarge Language Model RoutingMultimodal Large Language Models

  6. ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction

    May 11, 2026Amirhossein Abaskohi, Yuhang He, Peter West +3Computer-Use AgentsMultimodal Agents

  7. MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation

    May 11, 2026Ziyi Wang, Xianping Ma, Ziyao Wang +2Remote Sensing Image SegmentationScene Reasoning

  8. Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning

    May 11, 2026Tao Hu, Da-Wei ZhouMultimodal Continual Instruction TuningInstruction Tuning

  9. Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model

    May 11, 2026David F. Ramirez, Tim Overman, Kristen Jaskie +1Sentinel-2Textvqa

  10. Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

    May 11, 2026Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada +7RaterLlm-As-A-Judge

  11. Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium

    May 11, 2026Qingxin Xiao, Peilin Zhao, Yangyang Zhao +2Contrastive DecodingLarge Language Model Hallucination

  12. GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

    May 11, 2026Tianyuan Zhang, Peng Yue, Zihao Peng +8Autonomous DrivingProbabilistic Safety

  13. V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

    May 11, 2026Zhiwei Ning, Xuanang Gao, Jiaxi Cao +6Multimodal Large Language ModelsBeam Search

  14. MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph

    May 11, 2026Manyu Li, Ruian He, Chenxi Ma +2Multimodal Large Language ModelsKnowledge Graphs

  15. ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

    May 11, 2026Tingshu Mou, Jiabo He, Renying Wang +53D Spatial ReasoningMultimodal Large Language Models

  16. Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment

    May 11, 2026Haobo Wang, Xiaorong Ma, Weiqi Luo +2Multimodal Large Language ModelsLatent Representation Alignment

  17. The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

    May 11, 2026Xia Hu, Zhenrui Yue, Brian Potetz +4Visual ReasoningMultimodal Large Language Models

  18. SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs

    May 10, 2026Bo Gu, Zhikang Zhang, Zizhuang Wei +33D Spatial ReasoningVideo Multimodal Large Language Models

  19. Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs

    May 10, 2026Yigui Feng, Qinglin Wang, Yang Liu +1Token CompressionVideo Compression

  20. Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

    May 9, 2026Jucheng Hu, Zhangquan Chen, Yulin Chen +9Multimodal Large Language ModelsEmotion Recognition

  21. LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?

    May 9, 2026Kechen Fang, Yihua Qin, Chongyi Wang +3Vision EncodersMultimodal Large Language Models

  22. Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

    May 9, 2026Tri Cao, Khoi Le, Thong Nguyen +7Video Multimodal Large Language ModelsSpatio-Temporal Reasoning

  23. How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A

    May 9, 2026YiJie Huang, Yiqun Zhang, Zhuoyue Jia +7Visual Token PruningLong Visual-Token Sequences

  24. PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models

    May 9, 2026Jiahui Guang, Zexun Zhan, Zhenlin Xu +5Exact UnlearningMultimodal Large Language Models

  25. SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding

    May 8, 2026Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy +1Video Multimodal Large Language ModelsLong-Video Benchmarks

  26. SalesSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

    May 8, 2026Yada Pruksachatkun, Elaine Wan, Lyanna Chen +2User SimulationMultimodal Large Language Models

  27. WeatherSyn: An Instruction Tuning MLLM For Weather Forecasting Report Generation

    May 8, 2026Zinan Zheng, Yang Liu, Nuo Chen +3Weather PredictionMultimodal Continual Instruction Tuning

  28. AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models

    May 8, 2026Kai Zheng, Zejian Kang, Rui Mao +4Facial Expression RecognitionArticulatory

  29. StrLoRA: Towards Streaming Continual Visual Instruction Tuning for MLLMs

    May 8, 2026Chang Che, Ziqi Wang, Hui Ma +2Multimodal Continual Instruction TuningReplay-Based Continual Learning

  30. Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment

    May 8, 2026Zhixue Song, Boyan Han, Yiwei Wang +1Recent Vision-Language ModelsMultimodal Large Language Models

  31. Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning

    May 8, 2026Jin Cui, Xinyue Long, Xunyong Zhang +5Latent Visual ReasoningRecent Vision-Language Models

  32. Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment

    May 7, 2026Yuchen Guo, Junli Gong, Yao Lu +3Infrared-Visible Image FusionMultimodal Fusion

  33. MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes

    May 7, 2026Maximillian Chen, Xuanming Zhang, Michael Peng +3Voice AgentsSmart Homes

  34. Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric

    May 7, 2026Ying Gu, Mei Chee Leong, Hui Li Tan +3Multimodal Large Language ModelsTextvqa

  35. CrossCult-KIBench: A Benchmark for Cross-Cultural Knowledge Insertion in MLLMs

    May 7, 2026Zhen Zeng, Leijiang Gu, Feng Li +2Multilingual BenchmarkCross-Cultural Variation

  36. OmicsLM: A Multimodal Large Language Model for Multi-Sample Omics Reasoning

    May 7, 2026Maciej Sypetkowski, Joanna Krawczyk, Łukasz Smoliński +4Multi-Omic IntegrationTranscriptomics

  37. ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models

    May 7, 2026Yuhang Wang, Wenjie Mei, Junkai Zhang +3Multimodal Large Language ModelsMultimodal Learning

  38. Null Space Constrained Contrastive Visual Forgetting for MLLM Unlearning

    May 7, 2026Yuhang Wang, Zhenxing Niu, Haoxuan Ji +3Large Language Model UnlearningMultimodal Large Language Models

  39. Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models

    May 7, 2026Daniel Sungho Jung, Kyoung Mu Lee3D HandDense Prediction

  40. Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

    May 7, 2026Md Farhamdur Reza, Richeng Jin, Tianfu Wu +1Large Language Model JailbreaksJailbreak Attacks

  41. The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

    May 7, 2026Hoin Jung, Xiaoqian WangMultimodal Retrieval Augmented GenerationMultimodal Large Language Models

  42. Causal Probing for Internal Visual Representations in Multimodal Large Language Models

    May 7, 2026Zehao Deng, Tianjie Ju, Zheng Wu +5Multimodal Large Language ModelsVisual Representations

  43. AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification

    May 7, 2026Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu +7Astronomical ImagesMultimodal Benchmarks

  44. JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions

    May 6, 2026Leying Zhang, Bowen Shi, Haibin Wu +2Modern Generative Audio ModelsInstruction

  45. DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning

    May 6, 2026Yuancheng Wei, Haojie Zhang, Linli Yao +7Image Difference CaptioningMulti-Image Editing Benchmarks

  46. Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation

    May 5, 2026Quanxing Xu, Ling Zhou, Xian Zhong +3Knowledge-Based Visual Question AnsweringMultimodal Large Language Models

  47. Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe

    May 5, 2026Wenjin Hou, Shangpin Peng, Weinong Wang +13Uni-OpdPost-Training

  48. Can Multimodal Large Language Models Understand Pathologic Movements? A Pilot Study on Seizure Semiology

    May 5, 2026Lina Zhang, Tonmoy Monsoor, Mehmet Efe Lorasdagi +8Seizure DetectionMultimodal Large Language Models

  49. Bolek: A Multimodal Language Model for Molecular Reasoning

    May 4, 2026Frederic Grabowski, Jacek Szczerbiński, Maciej Jaśkowski +4MoleculenetMolecular Property Prediction

  50. Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs

    May 4, 2026Xin Zhang, Qiqi Tao, Jiawei Du +2Latent Visual ReasoningEfficient Latent Reasoning

  51. From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs

    May 4, 2026Le Zhang, Jihan Yang, Soundarya Krishnan +11Stable Spatial UnderstandingSpatial Reasoning

  52. Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts

    May 3, 2026Hongkun Pan, Yuwei Wu, Wanyi Hong +8ChartMultimodal Reasoning

  53. Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time

    May 3, 2026Itai Allouche, Joseph KeshetMultimodal Large Language ModelsLarge Language Model Hallucination

  54. Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression

    May 2, 2026Yao Du, Shanshan Song, Xiaomeng LiMultimodal Large Language ModelsDistributional Information