Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

    May 10, 2026Rui Liu, Dian Yu, Zhenwen Liang +6Multimodal Large Language ModelsMultimodal Reward Modeling

  2. Reinforcing Multimodal Reasoning Against Visual Degradation

    May 10, 2026Rui Liu, Dian Yu, Haolin Liu +6VLM RobustnessImage Corruption Robustness

  3. Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

    May 9, 2026Jucheng Hu, Zhangquan Chen, Yulin Chen +9Multimodal Large Language ModelsMultimodal Foundation Models

  4. MultiMedVision: Multi-Modal Medical Vision Framework

    May 9, 2026Frank Li, Bardia Khosravi, Mohammadreza Chavoshi +5Medical Imaging Foundation ModelsVision Transformer

  5. How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A

    May 9, 2026YiJie Huang, Yiqun Zhang, Zhuoyue Jia +7Efficient VLM InferenceLarge Vision-Language Models

  6. Earth Science Foundation Models: From Perception to Reasoning and Discovery

    May 9, 2026Xiangyu Zhao, Bo Liu, Yuehan Zhang +9AI for ScienceGeospatial Foundation Models

  7. ZAYA1-VL-8B Technical Report

    May 8, 2026Hassan Shapourian, Kasra Hejazi, Olabode M. Sule +1Vision-Language ModelsMixture-of-Experts Language Models

  8. Pan-FM: A Pan-Organ Foundation Model with Saliency-Guided Masking for Missing Robustness

    May 8, 2026Qiangqiang Wu, Grace McIlvain, Zhou Yu +1Missing-Modality LearningMedical Imaging

  9. Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

    May 7, 2026Zeyu Liu, Zanlin Ni, Yang Yue +5Unified Multimodal ModelsImage Generation

  10. A foundation model of vision, audition, and language for in-silico neuroscience

    May 5, 2026Stéphane d'Ascoli, Jérémy Rapin, Yohann Benchetrit +5Cognitive ModelingfMRI Foundation Models

  11. Audio-Visual Intelligence in Large Foundation Models

    May 5, 2026You Qin, Kai Liu, Shengqiong Wu +12Audio-Visual UnderstandingAudio-Video Generation

  12. MolmoAct2: Action Reasoning Models for Real-world Deployment

    May 4, 2026Haoquan Fang, Jiafei Duan, Donovan Clay +26RoboticsEfficient VLA Models

  13. Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs

    May 4, 2026Xin Zhang, Qiqi Tao, Jiawei Du +2Inference-Time OptimizationTest-Time Optimization

  14. Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE

    May 4, 2026Yangming Shi, Shixiang Zhu, Tao Shen +14Diffusion TransformerUnified Multimodal Models

  15. Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

    May 3, 2026Junyuan Xiao, Dingkang Liang, Xin Zhou +9World ModelsCross-Modal Alignment

  16. OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder

    May 2, 2026Detao Bai, Shimin Yao, Weixuan Chen +4Cross-Modal LearningVideo Understanding

  17. Valley3: Scaling Omni Foundation Models for E-commerce

    May 2, 2026Zeyu Chen, Guanghao Zhou, Min Yang +6Unified Multimodal ModelsMultimodal Pretraining

  18. WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild

    May 1, 2026Junzhe Huang, Xiaoxiao Sun, Yan Yang +6Visual Question AnsweringTable QA

  19. Let ViT Speak: Generative Language-Image Pre-training

    May 1, 2026Yan Fang, Mengcheng Lan, Zilong Huang +7Cross-Modal LearningVision Transformer

  20. REALM: An RGB- and Event-Aligned Latent Manifold for Cross-Modal Perception

    Apr 30, 2026Vincenzo Polizzi, David B. Lindell, Jonathan KellyCross-Modal LearningEvent-Based Vision

  21. Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

    Apr 30, 2026Sudong Wang, Weiquan Huang, Xiaomin Yu +9Multimodal Large Language ModelsMultimodal Reasoning

  22. A Pattern Language for Resilient Visual Agents

    Apr 30, 2026Habtom Kahsay Gidey, Alexander Lenz, Alois KnollVision-Language-Action ModelsMultimodal Foundation Models