Image-Text Pairs

Momentum

2 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 42

All topics
CardsList
  1. Multimodal Routing and Region Refinement for Language-Guided Medical Image Segmentation

    Sep 24, 2026Md Maklachur Rahman, Md Hasan Al Banna, Saraf Anjum +2Semi-Supervised Medical Image SegmentationImage-Text Pairs

  2. Generative Retrieval for Unsupervised Text-Based Person Search

    Sep 14, 2026Mang Ye, Yucheng Ji, Yang Bai +4Image-Text PairsContrastive Learning

  3. MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

    Aug 11, 2026Changhao Xiang, Shangyu Xing, Zhen Wu +2Multimodal PretrainingMultimodal Large Language Models

  4. Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts

    Aug 1, 2026Ziang Wu, Peng Jin, Qishen Yin +4Load BalancingImage-Text Pairs

  5. MarkushGlyph and OCSRGlyph: Improved Chemical Structure Recognition

    Jul 30, 2026Alex Andonian, Samuel G Rodriques, Andrew D White +1Optical Character RecognitionImage-Text Pairs

  6. Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation

    Jul 9, 2026Shun Liu, Nan Xi, Yang Liu +3ColonoscopyImage-Text Pairs

  7. UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

    Jul 9, 2026Haibin Tian, Huichao Xie, Xuelin Qian +3Aerial ImageryVisual Grounding Benchmarks

  8. MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

    Jul 8, 2026Hyunjae Kim, Dain Kim, Pan Xiao +25Multimodal Clinical DataMultimodal Foundation Model

  9. Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval

    Jul 1, 2026Jingjing Zhang, Lei Zhang, Zheren Fu +1Zero-Shot Composed Image RetrievalComposed Image Retrieval

  10. Unsupervised Data-Efficient Cross-Modal Retrieval with Global-Neighborhood Alignment Hashing

    Jun 30, 2026Runhao Li, Xiaoxu Ma, Zhenyu Weng +5Contrastive AlignmentImage-Text Pairs

  11. SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

    Jun 29, 2026Zhiyuan Ma, Zhengfeng Shi, Yuning An +6Scientific FigureImage-Text Pairs

  12. Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature

    Jun 29, 2026Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim +1Materials ScienceImage-Text Pairs

  13. Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

    Jun 25, 2026Yunqi Xue, Zhijiang Li, Philip Torr +1Autoregressive Image GenerationAutoregressive Generation

  14. GAVEL: Grounded Caption Error Verification and Localization

    Jun 25, 2026Zixian Gao, Atsushi Hashimoto, Kuniaki SaitoImage-Text PairsCaptions

  15. HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models

    Jun 22, 2026Hoang-Bao Le, Aiden Durrant, Thai Son Mai +3NegationImage-Text Pairs

  16. T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation

    Jun 21, 2026Gagandeep Singh, Aaditya Yadav, Priyanka SinghImage-Text PairsMultimodal Benchmarks

  17. Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model

    Jun 16, 2026Jinghan Wu, Jing Li, Ivor W. Tsang +1Vision-Language AlignmentCoreference Resolution

  18. Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

    Jun 15, 2026Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina +1Vision-Language Foundation ModelsMultilingual

  19. Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality

    Jun 11, 2026Wei Li, Zhen Huang, Xinmei TianImage-Text PairsCross-Modal

  20. POTATR: A Lightweight Image-to-Graph Model for Page-Level Table Extraction

    Jun 8, 2026Brandon Smock, Libin Liang, Max Sokolov +4Lingdt-Vl-OcrImage-Text Pairs

  21. PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

    Jun 1, 2026Yichuan Wang, Zhifei Li, Zirui Wang +5Visual Document RetrievalMultimodal Retrieval Augmented Generation

  22. PMC-InterCPT: Rethinking Biomedical Interleaved Data for Multimodal Continued Pretraining

    May 31, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +9Multimodal Clinical DataMultimodal Pretraining

  23. Comparative Evaluation of Machine Translation Systems on Images with Text

    May 28, 2026Blai Puchol, Sergio Gómez González, Miguel Domingo +1Image-Text PairsUnpaired Image-To-Image Translation

  24. Multimodal Distribution Matching for Vision-Language Dataset Distillation

    May 22, 2026Jongoh Jeong, Hoyong Kwon, Minseok Kim +1Cross-Modal DistillationDataset Distillation

  25. Supervised Classification Heads as Semantic Prototypes: Unlocking Vision-Language Alignment via Weight Recycling

    May 21, 2026David Méndez, Roberto Confalonieri, Natalia Díaz RodríguezVision-Language AlignmentCross-Modal

  26. TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval

    May 18, 2026Xinyu Sun, Huangyu Dai, Lingtao Mao +5Multimodal RetrievalImage-Text Pairs

  27. SMA: Submodular Modality Aligner For Data Efficient Multimodal Learning

    May 13, 2026Truong Pham, Anay Majee, Rishabh IyerMultimodal AlignmentModality Alignment

  28. HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities

    May 6, 2026Esra Dönmez, Pascal Tilli, Hsiu-Yu Yang +2Image-Text Pairs

  29. InterPartAbility: Phrase-Region Grounding for Interpretable Text-to-Image Person Re-Identification

    Apr 29, 2026Shakeeb Murtaza, Aryan Shukla, Rajarshi Bhattacharya +2Re-IdentificationVision-Language Model Grounding

  30. Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics

    Apr 27, 2026Hai Wang, Xiaochen Yang, Mingzhi Dong +1Frozen Contrastive Language-Image Pre-Training Visual EncoderContrastive Language-Image Pre-Training Model

  31. TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval

    Apr 23, 2026Zixu Li, Yupeng Hu, Zhiheng Fu +3Composed Image RetrievalImage-Text Pairs

  32. Document-as-Image Representations Fall Short for Scientific Retrieval

    Apr 20, 2026Ghazal Khalighinejad, Raghuveer Thirukovalluru, Alexander H. Oh +1Multimodal DocumentsScholar Information Database

  33. Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis

    Apr 17, 2026Ayhan Can Erdur, Daniel Scholz, Jiazhen Pan +3Medical ImagesImage-Text Pairs

  34. SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding

    Apr 17, 2026Keisuke Gomi, Keiji YanaiMultimodal EmbeddingsRecipe

  35. Multimodal rumor detection enhanced by external evidence and forgery features

    Jan 21, 2026Han Li, Hua SunMultimodal FusionForgeries