Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. TRACER: Persistent Regularization for Robust Multimodal Finetuning

    May 28, 2026Hesam Asadollahzadeh, Feng Liu, Christopher Leckie +1VLM RobustnessNeural Network Robustness

  2. From Pixels to Words -- Towards Native One-Vision Models at Scale

    May 27, 2026Haiwen Diao, Jiahao Wang, Penghao Wu +18Vision-Language ModelsVideo-Language Models

  3. OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

    May 27, 2026Xinchen Zhang, Bowei Liu, Jiale Liu +7Multimodal Large Language ModelsReinforcement Learning with Verifiable Rewards

  4. Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

    May 26, 2026Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao +9Vision-Language ModelsVLM Interpretability

  5. FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

    May 26, 2026Guixian Xu, Yide Liang, Zeli Su +5VLM EvaluationVision-Language Models

  6. O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

    May 26, 2026Peiran Wu, Yunze Liu, Chi-Hao Wu +2Audio-Visual UnderstandingEfficient Multimodal Inference

  7. Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

    May 25, 2026Bonan Ding, Umair Nawaz, Ufaq Khan +5Cross-Modal LearningMultimodal Large Language Models

  8. MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

    May 25, 2026Kaixiang Chen, Pengfei Fang, Hui XueCross-Modal LearningCross-Modal Representation Learning

  9. BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

    May 25, 2026Zili Zhang, Chengxu Yang, Shenglong Zhang +8Deep Learning OptimizationMultimodal Large Language Models

  10. Toward Native Multimodal Modeling: A Roadmap

    May 25, 2026Siyu An, Junru Lu, Junnan Dong +18Unified Multimodal ModelsMultimodal Generation

  11. DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement

    May 25, 2026Renjie Lu, Xulong Zhang, Xiaoyang Qu +2Multimodal Disentangled Representation LearningUnified Multimodal Models

  12. Vision-Language Binding in In-Context Image Generation

    May 23, 2026Chris Ge, Rohit Gandikota, Antonio Torralba +1Image GenerationMechanistic Interpretability

  13. ETCHR: Editing To Clarify and Harness Reasoning

    May 22, 2026Beichen Zhang, Yuhong Liu, Jinsong Li +3Tool Use in VLMsMultimodal Reasoning

  14. Cambrian-P: Pose-Grounded Video Understanding

    May 21, 2026Jihan Yang, Zifan Zhao, Xichen Pan +5Vision-Language ModelsCamera Pose Estimation

  15. Bernini: Latent Semantic Planning for Video Diffusion

    May 21, 2026Bernini Team, Chenchen Liu, Junyi Chen +9Video Diffusion ModelsUnified Multimodal Models

  16. LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

    May 21, 2026Yifan Dai, Zhenhua Wu, Bohan Zeng +18Cross-Modal LearningAudio-Visual Understanding

  17. MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset

    May 20, 2026Benjamin Aubin, Gonzalo Iñaki Quintana, Onur Tasar +4Training Data CurationT2I Generation

  18. Modular Multimodal Classification Without Fine-Tuning: A Simple Compositional Approach

    May 20, 2026Herman Bergström, Aditya Mehrotra, Rahul G. KrishnanMultimodal EmbeddingMultimodal Classification

  19. AffectVerse: Emotional World Models for Multimodal Affective Computing

    May 19, 2026Bo Zhao, Fanghua Ye, Yixin Ji +3Cross-Modal LearningMultimodal Large Language Models

  20. Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models

    May 19, 2026Tobias Braun, Jonas Henry Grebe, Hossein Shakibania +2Unified Multimodal ModelsBackdoor Attacks

  21. Chronicle: A Multimodal Foundation Model for Joint Language and Time Series Understanding

    May 18, 2026Paul Quinlan, Jeremy Levasseur, Qingguo Li +1Cross-Modal LearningMultivariate Time Series Forecasting