Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine

    Mar 1, 2026Kai Zhang, Zhengqing Yuan, Cheng Peng +10HealthcareMultimodal Pretraining

  2. MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation

    Feb 24, 2026Sajjad Ghiasvand, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh +1Cross-Modal LearningPrompt Learning

  3. UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

    Feb 9, 2026Cheng Yang, Chufan Shi, Bo Shui +7Unified Multimodal ModelsImage Generation

  4. CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

    Jan 12, 2026Chaoyu Li, Fei Tao, Pooyan FazliTest-Time Scaling for VLMsTest-Time Scaling

  5. CLIMP: Contrastive Language-Image Mamba Pretraining

    Jan 11, 2026Nimrod Shabtay, Itamar Zimerman, Eli Schwartz +1Cross-Modal LearningVLM Robustness

  6. BabyVision: Visual Reasoning Beyond Language

    Jan 10, 2026Liang Chen, Weichu Xie, Yiyan Liang +27VLM EvaluationVisual Reasoning

  7. Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models

    Dec 16, 2025George-Andrei Dima, Răzvan-Alexandru Smădu, Dumitru-Clementin CercelVisual Question AnsweringImage Captioning

  8. OpenPhone: Mobile Agentic Foundation Models

    Oct 24, 2025Yangqin Jiang, Chao HuangOn-Device Language Model InferenceGUI Agents

  9. From Charts to Code: A Hierarchical Benchmark for Multimodal Models

    Oct 20, 2025Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu +8Data VisualizationCode Generation

  10. SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

    Oct 14, 2025Weiyang Jin, Yuwei Niu, Jiaqi Liao +4Unified Multimodal ModelsT2I Generation

  11. HunyuanImage 3.0 Technical Report

    Sep 28, 2025Tencent Hunyuan Foundation Model TeamUnified Multimodal ModelsAutoregressive Image Generation

  12. LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

    Sep 28, 2025Shubhang Bhatnagar, Andy Xu, Kar-Han Tan +1Mixed-Precision QuantizationLLM Quantization

  13. Reconstruction Alignment Improves Unified Multimodal Models

    Sep 8, 2025Ji Xie, Trevor Darrell, Luke Zettlemoyer +1Unified Multimodal ModelsCross-Modal Alignment

  14. Inverse-LLaVA: Rethinking Multimodal Alignment via Text-to-Vision Mapping

    Aug 17, 2025Xuhui Zhan, Tyler DerrCross-Modal LearningCross-Modal Representation Learning

  15. Position: Reasoning After Perception Means Reasoning Without Vision

    Jul 21, 2025Hongcheng Gao, Zihao Huang, Jingyi Tang +12Visual ReasoningVLM Reasoning

  16. Can Argus Judge Them All? Comparing VLMs Across Domains

    Jun 23, 2025Harsh Joshi, Gautam Siddharth Kashyap, Rafiq Ali +5VLM EvaluationVLM Robustness

  17. LaViDa: A Large Diffusion Language Model for Multimodal Understanding

    May 22, 2025Shufan Li, Konstantinos Kallidromitis, Hritik Bansal +7Vision-Language ModelsEfficient VLM Inference

  18. HumaniBench: A Human-Centric Framework for Large Multimodal Models Evaluation

    May 16, 2025Shaina Raza, Aravind Narayanan, Vahid Reza Khazaie +6Algorithmic FairnessMultimodal Large Language Models

  19. ChronoSteer: Bridging Large Language Model and Time Series Foundation Model via Synthetic Cross-Modal Alignment Dataset

    May 15, 2025Chengsen Wang, Qi Qi, Zhongwen Rao +2Cross-Modal LearningMultivariate Time Series Forecasting

  20. ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models

    Feb 13, 2025Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma +31Visual ReasoningVLM Reasoning

  21. Histopathology Multi-modal Embedding for Pathology Composed Retrieval

    Feb 11, 2025Qifeng Zhou, Wenliang Zhong, Thao M. Dang +4Computational PathologyHealthcare

  22. MultiViewDx: Evidence-Linked Multi-View Clinical Diagnosis

    Oct 19, 2024Junda Wang, Zonghai Yao, Yujan Ting +5HealthcareMedical Image Analysis

  23. ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation

    Date pendingAnindya Mondal, Sauradip Nag, Anjan DuttaVLM AdaptationCrowd Counting