Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. MultiToP: Learning to Patch Visual Tokens to Mitigate Hallucinations in Video Large Multimodal Models

    Jun 10, 2026Yuansheng Gao, Wenbin Xing, Jiahao Yuan +4Video-Language ModelsMultimodal Foundation Models

  2. ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

    Jun 9, 2026Junke Wang, Xiao Wang, Jiacheng Pan +16Text-Guided Image EditingUnified Multimodal Models

  3. Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

    Jun 9, 2026Miaoxin Cai, Guanqun Wang, Wei Zhang +6Remote Sensing Image UnderstandingMultimodal Grounding

  4. Kwai Keye-VL-2.0 Technical Report

    Jun 9, 2026Kwai Keye Team, Bin Wen, Changyi Liu +50Temporal Video GroundingLong-Context Modeling

  5. RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification

    Jun 8, 2026Shakhrul Iman Siam, Tiantian Feng, Jiankun Zhang +2HealthcareAudio-Language Models

  6. Next-Token Prediction Learns Generalisable Representations of Sleep Physiology

    Jun 8, 2026Jonathan F. Carter, Lionel TarassenkoSleep Stage ClassificationTime Series Classification

  7. AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models

    Jun 8, 2026Shouwei Ruan, Bin Wang, Zhenyu Wu +5VLM ReasoningMultimodal Foundation Models

  8. TRACE: A Temporal Conditional Estimation for Multimodal Time Series Foundation Models

    Jun 4, 2026Ziwen Kan, Yishuo Chen, Kecheng Li +7Irregular Time-Series ModelingMissing-Modality Learning

  9. Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning

    Jun 3, 2026Niloufar Alipour Talemi, Hossein Kashiani, Fatemeh AfghahEfficient Multimodal InferenceMultimodal ICL

  10. Geometry-Preserving Unsupervised Alignment for Heterogeneous Foundation Models

    Jun 3, 2026Shuwen Yu, Zhanxuan Hu, Yi Zhao +2Cross-Modal Representation LearningVision Foundation Model Adaptation

  11. Frames2LoRA: Parametric Video Internalization for Vision-Language Models

    Jun 3, 2026Manan Suri, Sarvesh Baskar, Dinesh ManochaVLM AdaptationEfficient VLM Inference

  12. Differentiable Efficient Operator Search

    Jun 3, 2026Xiaohuan Pei, Jiyuan Zhang, Yuanfan Guo +4Efficient Multimodal InferenceMultimodal Token Compression

  13. KODA: Contrastive Representation Comparison and Alignment for Vision-Language Foundation Models

    Jun 2, 2026Youqi Wu, Mohammad Jalali, Farzan FarniaKernel MethodsMultimodal Foundation Models

  14. Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs

    Jun 2, 2026Wei Ding, Yudong Zhang, Ruobing Xie +3VLM EvaluationVision-Language Models

  15. Investigating Adversarial Robustness of Multi-modal Large Language Models

    Jun 2, 2026Hashmat Shadab Malik, Muzammal Naseer, Salman KhanAdversarial TrainingVLM Robustness

  16. Attend to Anything: Foundation Model for Unified Human Attention Modeling

    Jun 2, 2026Wenzhuo Zhao, Ronghao Xian, Keren Fu +1Visual AttentionUnified Multimodal Models

  17. AdaCodec: A Predictive Visual Code for Video MLLMs

    Jun 1, 2026Haowen Hou, Zhen Huang, Zheming Liang +8Predictive CodingEfficient VLM Inference

  18. Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

    May 31, 2026Wanlong Fang, Tianle Zhang, Wen Tao +1Multimodal GroundingMultimodal Large Language Models

  19. Zamba2-VL Technical Report

    May 29, 2026Hassan Shapourian, Kasra Hejazi, Olabode M. Sule +1Vision-Language ModelsEfficient VLM Inference

  20. Representation Forcing for Bottleneck-Free Unified Multimodal Models

    May 29, 2026Yuqing Wang, Zhijie Lin, Ceyuan Yang +10Unified Multimodal ModelsConditional Image Generation

  21. VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning

    May 29, 2026Hengbo Xu, Shengjie Jin, Yanbiao Ma +1Efficient Multimodal InferenceVisual Attention

  22. "Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models

    May 29, 2026Mihai Masala, Marius Leordeanu, Mihai Dascalu +1VLM EvaluationVision-Language Models

  23. GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration

    May 29, 2026Xiangtao Kong, Jixin Zhao, Lingchen Sun +2Synthetic Data AugmentationImage Restoration

  24. Your Multimodal Speech Model Says I Have a Face for Radio

    May 28, 2026Maya K. Nachesa, Vlad Niculae, Vagrant GautamASR EvaluationDemographic Bias in ASR

  25. Archon: A Unified Multimodal Model for Holistic Digital Human Generation

    May 28, 2026Chong Bao, Shichen Liu, Lijun Yu +9Unified Multimodal ModelsMultimodal Pretraining

  26. ReasonLight: A Multimodal Foundation Model-Enhanced Reinforcement Learning Framework for Zero-Shot Traffic Signal Control

    May 28, 2026Aoyu Pang, Maonan Wang, Yuejiao Xie +3RL ControlIntelligent Transportation Systems