Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models

    Apr 27, 2026Weixing Wang, Liudvikas Zekas, Anton Hackl +5Unified Multimodal ModelsCross-Modal Alignment

  2. Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

    Apr 27, 2026Zhiheng Liu, Weiming Ren, Xiaoke Huang +12Unified Multimodal ModelsMultimodal Pretraining

  3. X2SAM: Any Segmentation in Images and Videos

    Apr 27, 2026Hao Wang, Limeng Qiao, Chi Zhang +4Image SegmentationVideo Object Segmentation

  4. ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

    Apr 23, 2026Jingpei Wu, Xiao Han, Weixiang Shen +3Process Reward ModelsMultimodal QA

  5. Context Unrolling in Omni Models

    Apr 23, 2026Ceyuan Yang, Zhijie Lin, Yang Zhao +16Cross-Modal LearningUnified Multimodal Models

  6. Latent Denoising Improves Visual Alignment in Large Multimodal Models

    Apr 23, 2026Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan +1VLM RobustnessMultimodal Large Language Models

  7. Focus Session: Hardware and Software Techniques for Accelerating Multimodal Foundation Models

    Apr 23, 2026Muhammad Shafique, Abdul Basit, Muhammad Abdullah Hanif +3Model CompressionEfficient Multimodal Inference

  8. ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response

    Apr 23, 2026Stephan Xie, Ben Cohen, Mononito Goswami +6Time Series ReasoningTime Series QA

  9. Exploring Spatial Intelligence from a Generative Perspective

    Apr 22, 2026Muzhi Zhu, Shunyao Jiang, Huanyi Zheng +9Spatial Reasoning BenchmarksUnified Multimodal Models

  10. SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

    Apr 21, 2026Josue Torres-Fonseca, Naihao Deng, Yinpei Dai +5LLM Safety BenchmarksLarge Language Model-Based Robot Planning

  11. PLaMo 2.1-VL Technical Report

    Apr 21, 2026Tommi Kerola, Yuya Masuda, Takashi Masuko +5Visual Question AnsweringVision-Language Models

  12. DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

    Apr 20, 2026Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao +3Cross-Modal LearningVisual Question Answering

  13. Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

    Apr 20, 2026Samuel G. Balter, Ethan Jerzak, Connor T. JerzakMultimodal Large Language ModelsMultimodal Reasoning

  14. Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs

    Apr 20, 2026Tingchao Fu, Wenkai Wang, Fanxiao Li +6Knowledge EditingMultimodal Large Language Models

  15. Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

    Apr 19, 2026Lijie ZhouCross-Modal LearningVLM Robustness

  16. Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models

    Apr 18, 2026Xinru Yan, Boxi Cao, Yaojie Lu +4Unified Multimodal ModelsNeural Network Interpretability

  17. RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models

    Apr 16, 2026Gabriele Mattioli, Evelyn Turri, Sara Sarto +4Multimodal Foundation ModelsTool Selection

  18. Foundation Models in Robotics: A Comprehensive Review of Methods, Models, Datasets, Challenges and Future Research Directions

    Apr 16, 2026Aggelos Psiris, Vasileios Argyriou, Evangelos K. Markakis +4Large Language Model-Based Robot PlanningRobot Foundation Models

  19. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks

    Apr 1, 2026Wish Suharitdamrong, Tony Alex, Muhammad Awais +1Cross-Modal LearningVLM Adaptation

  20. UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

    Mar 25, 2026Yicheng Xu, Jiangning Zhang, Zhucun Xue +5Multimodal ICLUnified Multimodal Models

  21. UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation

    Mar 23, 2026Ziyi Wang, Xinshun Wang, Shuang Chen +2Cross-Modal LearningUnified Multimodal Models

  22. ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

    Mar 19, 2026Thomas De Min, Subhankar Roy, Stéphane Lathuilière +2Multimodal Large Language ModelsAI Agent Benchmarks

  23. Look Where It Matters: High-Resolution Crops Retrieval for Efficient VLMs

    Mar 14, 2026Nimrod Shabtay, Moshe Kimhi, Artem Spector +5Tool Use in VLMsEfficient VLM Inference

  24. Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning

    Mar 12, 2026Rujie Wu, Haozhe Zhao, Hai Ci +1Video UnderstandingInstruction-Tuning Data Selection

  25. Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

    Mar 6, 2026Lijiang Li, Zuwei Long, Yunhang Shen +6Masked Diffusion ModelsUnified Multimodal Models

  26. Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language

    Mar 3, 2026Michelle Stegeman, Lena Philipp, Fennie van der Graaf +20Computational PathologyMedical Imaging Foundation Models