Vision-Language Pretraining

Latest papers 50

All topics
CardsList
  1. Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

    May 13, 2026Zhaowei Wang, Lishu Luo, Haodong Duan +9Visual Question AnsweringVision-Language Models

  2. CA-GCL: Cross-Anatomy Global-Local Contrastive Learning for Robust 3D Medical Image Understanding

    May 13, 2026Hanwen Zhang, Yao Liu, Die Dai +4VLM RobustnessMedical Image Anomaly Detection

  3. DINORANKCLIP: DINOv3 Distillation and Injection for Vision-Language Pretraining with High-Order Ranking Consistency

    May 7, 2026Shuyang Jiang, Nan Yu, Yiming Zhang +2Contrastive LearningVision-Language Alignment

  4. HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities

    May 6, 2026Esra Dönmez, Pascal Tilli, Hsiu-Yu Yang +2Cross-Modal LearningImage Matching

  5. Scientific Domain Knowledge Improves Vision-Language Fundus Models

    May 4, 2026Verena Jasmin Hallitschke, Carsten Eickhoff, Philipp BerensHealthcareMedical Diagnosis

  6. Let ViT Speak: Generative Language-Image Pre-training

    May 1, 2026Yan Fang, Mengcheng Lan, Zilong Huang +7Cross-Modal LearningVision Transformer

  7. Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training

    Apr 30, 2026Mingliang Liang, Zhuoran Liu, Arjen P. de Vries +1Long-Tail LearningVision-Language Pretraining

  8. Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics

    Apr 27, 2026Hai Wang, Xiaochen Yang, Mingzhi Dong +1VLM EvaluationVLM Adaptation

  9. PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance

    Apr 22, 2026Yupeng Zheng, Xiang Li, Songen Gu +12Robot Foundation ModelsEfficient VLA Models

  10. ITO: Multi-View Alignment and Training-Time Fusion for Image-Text Pretraining

    Mar 3, 2026Hanpeng Liu, Zidan Wang, Shuoxi Zhang +6Cross-Modal LearningCross-Modal Alignment

  11. Xray-Visual Models: Scaling Vision models on Industry Scale Data

    Feb 18, 2026Shlok Mishra, Tsung-Yu Lin, Linda Wang +24Vision Foundation ModelsMultimodal Pretraining

  12. MTV: Revisiting Multi-Task Visual Representation Learning

    Jan 20, 2026Shangzhe Di, Zhonghua Zhai, Weidi XieVisual Representation LearningSelf-Supervised Visual Representation Learning

  13. CLIMP: Contrastive Language-Image Mamba Pretraining

    Jan 11, 2026Nimrod Shabtay, Itamar Zimerman, Eli Schwartz +1Cross-Modal LearningVLM Robustness