Vision-Language Pretraining

Latest papers 50

All topics
CardsList
  1. What Makes Synthetic Hard Negatives Work in Vision-Language Pretraining?

    Oct 7, 2026Nikos Giakoumoglou, Paschalis Giakoumoglou, Andreas Floros +2Vision-Language PretrainingContrastive Learning

  2. VLM4Cluster: Benchmarking Deep Clustering In the Era of Vision-Language Pre-training

    Sep 29, 2026Yuanwei Hu, Bo Peng, Yuheng Jia +3ClusteringDeep Clustering

  3. SentZero: An Enhanced Sentence-Centric Vision-Language Pretraining for Multi-Task Zero-Shot Chest X-Ray Analysis

    Sep 28, 2026Hangyul Yoon, Hyungyung Lee, Edward Choi +1Contrastive LearningRadiology VLMs

  4. Clinical Trajectory Alignment for Medical Vision-Language Pre-training

    Sep 28, 2026Huimin Yan, Xian Yang, Zhi Wang +1Multimodal PretrainingLongitudinal Medical Image Analysis

  5. TDDN: Text-aligned Diffused DINO Network for Puzzle Understanding

    Sep 7, 2026Harsha Patnala, Debopriyo Banerjee, Ayush Sunil Munot +1Visual ReasoningVision-Language Alignment

  6. On the Design Fundamentals of Pixel Text Representation Learning

    Sep 1, 2026Chaohao Yuan, Ruifeng Yuan, Zhuoxu Huang +4Visual Representation LearningVision-Language Alignment

  7. CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

    Aug 19, 2026Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe +4Vision-Language ModelsVision-Language Alignment

  8. A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports

    Jul 30, 2026Jia Yu, Yan Zhu, Yili He +12EndoscopyMedical VLMs

  9. DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

    Jul 27, 2026Jiahao Xie, Zhongbin Guo, Qianle Wang +4Training Data CurationData Mixture Optimization

  10. UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

    Jul 25, 2026Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati +4Vision-Language ModelsEfficient VLM Inference

  11. AspectCLIP: Optimizing CLIP Representation Space via Aspect-Guided Consistency Regularization

    Jul 15, 2026Yiyang Yao, Shanglin Liu, Jianming Lv +4Vision-Language AlignmentMultimodal Contrastive Learning

  12. MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

    Jul 13, 2026Yuliang Liu, Zhang Li, Ziyang Zhang +11Document ParsingMultimodal Foundation Models

  13. SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

    Jul 13, 2026Mingjie Xie, Guangjun He, Dongli Xu +5VLM RobustnessVision-Language Grounding

  14. LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives

    Jul 1, 2026Lukas Kuhn, Giuseppe Serra, Randall Balestriero +1Visual Representation LearningVision-Language Pretraining

  15. SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis

    Jun 28, 2026Hang Su, Chao Sun, Zhaofan Li +3Medical Imaging Foundation ModelsUltrasound Imaging

  16. DataComp-VLM: Improved Open Datasets for Vision-Language Models

    Jun 26, 2026Matteo Farina, Vishaal Udandarao, Thao Nguyen +33VLM EvaluationTraining Data Curation

  17. ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

    Jun 25, 2026Sicheng Zhang, Muzammal Naseer, Binzhu Xie +5Compositional ReasoningMultimodal Reasoning

  18. TuringViT: Making SOTA Vision Transformers Accessible to All

    Jun 23, 2026Qiman Wu, Hanlin Chen, Lyujie Chen +19Vision Foundation ModelsVision Transformer

  19. Data Selection Through Iterative Self-Filtering for Vision-Language Settings

    Jun 22, 2026Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss +1Vision-Language ModelsTraining Data Curation

  20. Beyond Native Success: Auditing Deployment-Interface Exposure of CLIP Backdoors

    Jun 16, 2026Kunlan Xiang, Haomiao Yang, Wenbo JiangVLM RobustnessAdversarial Attacks on VLMs

  21. Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality

    Jun 11, 2026Wei Li, Zhen Huang, Xinmei TianCross-Modal LearningVision-Language Models

  22. X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

    Jun 7, 2026Miracle Kang, Lights Shi, Lucy Liang +10Vision-Language-Action ModelsVision-Language Pretraining

  23. WALL-WM: Carving World Action Modeling at the Event Joints

    Jun 1, 2026Shalfun Li, Victor Yao, Charles Yang +28World Model LearningVision-Language-Action Models

  24. "Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models

    May 29, 2026Mihai Masala, Marius Leordeanu, Mihai Dascalu +1VLM EvaluationVision-Language Models

  25. Wall-OSS-0.5 Technical Report

    May 29, 2026Ryan Yu, Pushi Zhang, Starrick Liu +24Zero-Shot Robotic ManipulationCross-Embodiment Robot Learning

  26. From Pixels to Words -- Towards Native One-Vision Models at Scale

    May 27, 2026Haiwen Diao, Jiahao Wang, Penghao Wu +18Vision-Language ModelsVideo-Language Models

  27. GEM: Generative Supervision Helps Embodied Intelligence

    May 27, 2026Ruowen Zhao, Bangguo Li, Zuyan Liu +9Vision-Language-Action ModelsEmbodied AI

  28. Rethinking VLM Representation for VLA Initialization

    May 25, 2026Weifeng Lin, Siyuan Huang, Hao Li +5VLM AdaptationLow-Rank Adaptation