Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. MultiToP: Learning to Patch Visual Tokens to Mitigate Hallucinations in Video Large Multimodal Models

    Jun 10, 2026Yuansheng Gao, Wenbin Xing, Jiahao Yuan +4Video-Language ModelsMultimodal Foundation Models

  2. ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

    Jun 9, 2026Junke Wang, Xiao Wang, Jiacheng Pan +16Text-Guided Image EditingUnified Multimodal Models

  3. Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

    Jun 9, 2026Miaoxin Cai, Guanqun Wang, Wei Zhang +6Remote Sensing Image UnderstandingMultimodal Grounding

  4. Kwai Keye-VL-2.0 Technical Report

    Jun 9, 2026Kwai Keye Team, Bin Wen, Changyi Liu +50Temporal Video GroundingLong-Context Modeling

  5. RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification

    Jun 8, 2026Shakhrul Iman Siam, Tiantian Feng, Jiankun Zhang +2HealthcareAudio-Language Models

  6. Next-Token Prediction Learns Generalisable Representations of Sleep Physiology

    Jun 8, 2026Jonathan F. Carter, Lionel TarassenkoSleep Stage ClassificationTime Series Classification

  7. AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models

    Jun 8, 2026Shouwei Ruan, Bin Wang, Zhenyu Wu +5VLM ReasoningMultimodal Foundation Models

  8. TRACE: A Temporal Conditional Estimation for Multimodal Time Series Foundation Models

    Jun 4, 2026Ziwen Kan, Yishuo Chen, Kecheng Li +7Irregular Time-Series ModelingMissing-Modality Learning

  9. Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning

    Jun 3, 2026Niloufar Alipour Talemi, Hossein Kashiani, Fatemeh AfghahEfficient Multimodal InferenceMultimodal ICL

  10. Geometry-Preserving Unsupervised Alignment for Heterogeneous Foundation Models

    Jun 3, 2026Shuwen Yu, Zhanxuan Hu, Yi Zhao +2Cross-Modal Representation LearningVision Foundation Model Adaptation

  11. Frames2LoRA: Parametric Video Internalization for Vision-Language Models

    Jun 3, 2026Manan Suri, Sarvesh Baskar, Dinesh ManochaVLM AdaptationEfficient VLM Inference

  12. Differentiable Efficient Operator Search

    Jun 3, 2026Xiaohuan Pei, Jiyuan Zhang, Yuanfan Guo +4Efficient Multimodal InferenceMultimodal Token Compression

  13. KODA: Contrastive Representation Comparison and Alignment for Vision-Language Foundation Models

    Jun 2, 2026Youqi Wu, Mohammad Jalali, Farzan FarniaKernel MethodsMultimodal Foundation Models

  14. Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs

    Jun 2, 2026Wei Ding, Yudong Zhang, Ruobing Xie +3VLM EvaluationVision-Language Models

  15. Investigating Adversarial Robustness of Multi-modal Large Language Models

    Jun 2, 2026Hashmat Shadab Malik, Muzammal Naseer, Salman KhanAdversarial TrainingVLM Robustness

  16. Attend to Anything: Foundation Model for Unified Human Attention Modeling

    Jun 2, 2026Wenzhuo Zhao, Ronghao Xian, Keren Fu +1Visual AttentionUnified Multimodal Models

  17. AdaCodec: A Predictive Visual Code for Video MLLMs

    Jun 1, 2026Haowen Hou, Zhen Huang, Zheming Liang +8Predictive CodingEfficient VLM Inference

  18. Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

    May 31, 2026Wanlong Fang, Tianle Zhang, Wen Tao +1Multimodal GroundingMultimodal Large Language Models

  19. Zamba2-VL Technical Report

    May 29, 2026Hassan Shapourian, Kasra Hejazi, Olabode M. Sule +1Vision-Language ModelsEfficient VLM Inference

  20. Representation Forcing for Bottleneck-Free Unified Multimodal Models

    May 29, 2026Yuqing Wang, Zhijie Lin, Ceyuan Yang +10Unified Multimodal ModelsConditional Image Generation

  21. VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning

    May 29, 2026Hengbo Xu, Shengjie Jin, Yanbiao Ma +1Efficient Multimodal InferenceVisual Attention

  22. "Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models

    May 29, 2026Mihai Masala, Marius Leordeanu, Mihai Dascalu +1VLM EvaluationVision-Language Models

  23. GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration

    May 29, 2026Xiangtao Kong, Jixin Zhao, Lingchen Sun +2Synthetic Data AugmentationImage Restoration

  24. Your Multimodal Speech Model Says I Have a Face for Radio

    May 28, 2026Maya K. Nachesa, Vlad Niculae, Vagrant GautamASR EvaluationDemographic Bias in ASR

  25. Archon: A Unified Multimodal Model for Holistic Digital Human Generation

    May 28, 2026Chong Bao, Shichen Liu, Lijun Yu +9Unified Multimodal ModelsMultimodal Pretraining

  26. ReasonLight: A Multimodal Foundation Model-Enhanced Reinforcement Learning Framework for Zero-Shot Traffic Signal Control

    May 28, 2026Aoyu Pang, Maonan Wang, Yuejiao Xie +3RL ControlIntelligent Transportation Systems

  27. TRACER: Persistent Regularization for Robust Multimodal Finetuning

    May 28, 2026Hesam Asadollahzadeh, Feng Liu, Christopher Leckie +1VLM RobustnessNeural Network Robustness

  28. From Pixels to Words -- Towards Native One-Vision Models at Scale

    May 27, 2026Haiwen Diao, Jiahao Wang, Penghao Wu +18Vision-Language ModelsVideo-Language Models

  29. OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

    May 27, 2026Xinchen Zhang, Bowei Liu, Jiale Liu +7Multimodal Large Language ModelsReinforcement Learning with Verifiable Rewards

  30. Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

    May 26, 2026Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao +9Vision-Language ModelsVLM Interpretability

  31. FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

    May 26, 2026Guixian Xu, Yide Liang, Zeli Su +5VLM EvaluationVision-Language Models

  32. O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

    May 26, 2026Peiran Wu, Yunze Liu, Chi-Hao Wu +2Audio-Visual UnderstandingEfficient Multimodal Inference

  33. Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

    May 25, 2026Bonan Ding, Umair Nawaz, Ufaq Khan +5Cross-Modal LearningMultimodal Large Language Models

  34. MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

    May 25, 2026Kaixiang Chen, Pengfei Fang, Hui XueCross-Modal LearningCross-Modal Representation Learning

  35. BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

    May 25, 2026Zili Zhang, Chengxu Yang, Shenglong Zhang +8Deep Learning OptimizationMultimodal Large Language Models

  36. Toward Native Multimodal Modeling: A Roadmap

    May 25, 2026Siyu An, Junru Lu, Junnan Dong +18Unified Multimodal ModelsMultimodal Generation

  37. DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement

    May 25, 2026Renjie Lu, Xulong Zhang, Xiaoyang Qu +2Multimodal Disentangled Representation LearningUnified Multimodal Models

  38. Vision-Language Binding in In-Context Image Generation

    May 23, 2026Chris Ge, Rohit Gandikota, Antonio Torralba +1Image GenerationMechanistic Interpretability

  39. ETCHR: Editing To Clarify and Harness Reasoning

    May 22, 2026Beichen Zhang, Yuhong Liu, Jinsong Li +3Tool Use in VLMsMultimodal Reasoning

  40. Cambrian-P: Pose-Grounded Video Understanding

    May 21, 2026Jihan Yang, Zifan Zhao, Xichen Pan +5Vision-Language ModelsCamera Pose Estimation

  41. Bernini: Latent Semantic Planning for Video Diffusion

    May 21, 2026Bernini Team, Chenchen Liu, Junyi Chen +9Video Diffusion ModelsUnified Multimodal Models

  42. LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

    May 21, 2026Yifan Dai, Zhenhua Wu, Bohan Zeng +18Cross-Modal LearningAudio-Visual Understanding

  43. MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset

    May 20, 2026Benjamin Aubin, Gonzalo Iñaki Quintana, Onur Tasar +4Training Data CurationT2I Generation

  44. Modular Multimodal Classification Without Fine-Tuning: A Simple Compositional Approach

    May 20, 2026Herman Bergström, Aditya Mehrotra, Rahul G. KrishnanMultimodal EmbeddingMultimodal Classification

  45. AffectVerse: Emotional World Models for Multimodal Affective Computing

    May 19, 2026Bo Zhao, Fanghua Ye, Yixin Ji +3Cross-Modal LearningMultimodal Large Language Models

  46. Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models

    May 19, 2026Tobias Braun, Jonas Henry Grebe, Hossein Shakibania +2Unified Multimodal ModelsBackdoor Attacks

  47. Chronicle: A Multimodal Foundation Model for Joint Language and Time Series Understanding

    May 18, 2026Paul Quinlan, Jeremy Levasseur, Qingguo Li +1Cross-Modal LearningMultivariate Time Series Forecasting