Vision-Language Alignment

Latest papers 65

All topics
CardsList
  1. Alignment-Guided Flow Transformer for Efficient Vision-Language-Action Policy Learning

    Sep 28, 2026Shengchao Hu, Peng Wang, Qiyang Zhou +5Flow-Matching Vision-Language-ActionGeneralizable Vision-Language-Action Policies

  2. Clinical Trajectory Alignment for Medical Vision-Language Pre-training

    Sep 28, 2026Huimin Yan, Xian Yang, Zhi Wang +1Medical Vision-Language ModelsLongitudinal Imaging

  3. From Alignment to Fusion in 3D Vision-Language

    Sep 23, 2026Xueqi Qiu, Xingyu Miao, Jingjing Deng +3Vision-Language AlignmentCross-View Fusion

  4. FFM-CP: Cross-Backbone Fusion of Vision-Language Foundation Models for Few-Shot Computational Pathology

    Sep 23, 2026Anh-Tien Nguyen, Trung DQ. Dang, Nghiem Tuong Diep +9Pathology Foundation ModelsComputational Pathology

  5. 0.5%>100%: Bidirectional Reciprocal Learning for Referring Image Segmentation

    Sep 21, 2026Xiaoqiang Lu, Licheng Jiao, Lingling Li +5Vision-Language AlignmentMultiple Vision Tasks

  6. ViCo-SAM3: Vision-Conditioned Alignment for Open-Vocabulary Camouflaged Object Segmentation

    Sep 14, 2026Qiangqiang Zhou, Wenjun Tang, Yong Chen +2Open-Vocabulary SegmentationVision-Language Alignment

  7. Bridging the Semantic-Utility Gap in Multimodal RAG via Generator-in-the-Loop Alignment

    Sep 8, 2026Zhan-Lun Chang, Dong-Jun Han, Seyyedali Hosseinalipour +2Multimodal Retrieval Augmented GenerationVision-Language Alignment

  8. DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection

    Aug 31, 2026Yuyang Hong, Jinhui Guo, Jiaqi Gu +6Vision-Language AlignmentInstruction

  9. Towards Continual Test-Time Adaptation of Vision-Language Models in Open-Vocabulary Semantic Segmentation

    Aug 30, 2026Chandler Timm C. Doloriel, Yunbei Zhang, Sarthak Kumar Maharana +5Vision-Language Model AdaptationOpen-Vocabulary Segmentation

  10. LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning

    Aug 13, 2026Yupan Ding, Jing Xiao, Zhenyuan Zhang +4Earth ObservationRecent Vision-Language Models

  11. Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding

    Aug 13, 2026Junyi Hu, Tian Bai, Fengyi Wu +7Vision-Language AlignmentContextual Grounding

  12. SLAP: Selective Local Vision-Language Alignment for Fish Re-Identification via Partial Optimal Transport

    Aug 9, 2026Cigdem Beyan, Tonje Knutsen Sordalen, Kim Tallaksen HalvorsenRe-IdentificationVision-Language Alignment

  13. DistMedVL: Distributional Vision-Language Alignment for Uncertainty-Aware Medical Image Segmentation

    Aug 6, 2026Jiaxuan Li, Qing Xu, Xiangjian He +4Vision-Language AlignmentSemi-Supervised Medical Image Segmentation

  14. EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment

    Aug 5, 2026Zhenyu Yi, Jianwei Xu, Yue Hu +6Vision-Language AlignmentColonoscopy

  15. Semantically Calibrated Evidence Composition for CT Vision-Language Learning

    Jul 31, 2026Guoliang You, Haifan Gong, Xiaomeng ChuCone-Beam Computed TomographyVision-Language Alignment

  16. One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

    Jul 30, 2026Enyi Shi, Fei Shen, Chuancheng Shi +4Safety AlignmentVision-Language Alignment

  17. Anatomy Contextualized Adaption of CT Foundation Models

    Jul 29, 2026Roshan Kenia, Stephanie L McNamara, William LotterVision-Language AlignmentAnatomy

  18. Fine-Grained Food Image Understanding via Target-Aware Data Alignment

    Jul 28, 2026Jui-Feng Chi, Wei-Lun Chu, Bruce Coburn +2Fine-Grained PerceptionVision-Language Alignment

  19. Joint Optimization for Greedy Longest-match Tokenization

    Jul 25, 2026Adhiraj Singh, Deepanshu Mody, Ghina Al Shdaifat +4Byte-Pair EncodingToken Compression

  20. MOPDA: Mixed-Trajectory On-Policy Distillation for Language-Guided Industrial Anomaly Detection

    Jul 21, 2026Shuimu Chen, Jing Jin, Nan Su +5Multimodal Industrial Anomaly DetectionVision-Language Alignment

  21. Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

    Jul 17, 2026Zhengbo Zhou, Jiren Li, Dooman Arefan +2LesionMedical Vision-Language Models

  22. Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

    Jul 15, 2026Dwip Dalal, Shivansh Patel, Chahit Jain +8Vision-Language AlignmentBehavior Cloning

  23. Dive Into the Implicit Biases of Low-rank Vision-language Alignment

    Jul 9, 2026Mingjia Shi, Shuo Wang, Xiaobo Wang +7Vision-Language AlignmentFeature Alignment

  24. Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning

    Jul 3, 2026Chengzhen Yu, Canran Xiao, Siyuan Ma +1Vision-Language AlignmentRecent Vision-Language Models

  25. Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

    Jun 28, 2026Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin YoonVision-Language AlignmentCross-Modal

  26. MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

    Jun 28, 2026Hong-Han Wang, Yuntao Wang, Hu DingVision-Language AlignmentMultimodal Large Language Models

  27. Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography

    Jun 24, 2026Bowen Shi, Weiwei Cao, Ruifeng Yuan +5Medical Vision-Language ModelsRadiology Report Generation

  28. Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning

    Jun 23, 2026Julien Khlaut, Charles Corbière, Baptiste Callard +9Vision-Language AlignmentMedical Images

  29. MAPS: Multi-Anchor Projection Similarity for Joint Vision-Language Geo-Localization

    Jun 21, 2026Yutong Hu, Siyuan Tan, Shaocheng Yan +3Cross-View Geo-LocalizationVision-Language Alignment

  30. GTA-Net: Cooperative Game Theory for Vision-Language Alignment in Chest X-Ray Report Generation

    Jun 20, 2026Saif ur Rehman Khan, Imad Ahmed Waqar, Sebastian Vollmer +2Vision-Language Alignment

  31. REVEAL++: Differentiable Phenotypic Grouping for Vision-Language Retinal Modeling of Alzheimer's Disease Risk

    Jun 17, 2026Ethan Elio Meidinger, Seowung Leem, Zeyun Zhao +1AlzheimerVision-Language Alignment

  32. AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model

    Jun 17, 2026Diogo Glória-Silva, João Cardeira, Manuel Letras da Luz +8Vision-Language AlignmentLarge Multimodal Models

  33. Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model

    Jun 16, 2026Jinghan Wu, Jing Li, Ivor W. Tsang +1Vision-Language AlignmentCoreference Resolution

  34. Attention Alignment Between Humans and Vision-Language Models

    Jun 16, 2026Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld +4Vision-Language AlignmentHuman Visual Cortex

  35. Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs

    Jun 10, 2026Shayan Mohammadizadehsamakosh, Pritam Sarkar, Leonid Sigal +2Medical Vision-Language ModelsVision-Language Alignment

  36. TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment

    Jun 5, 2026Sweta Mahajan, Sukrut Rao, Jiahao Xie +2Vision-Language AlignmentVisual Embeddings

  37. Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models

    Jun 3, 2026Jialin Wu, Qianru Zhang, Georges El Fakhri +1Medical Visual Question AnsweringVision-Language Alignment

  38. Beyond Symmetric Alignment: Spectral Diagnostics of Modality Imbalance in Vision-Language Models in the Medical Domain

    Jun 3, 2026Alessandro Gambetti, Qiwei Han, Cláudia Soares +1Medical Vision-Language ModelsVision-Language Alignment

  39. GLINT: Sparsely Gated Vision-Language Alignment for Fine-Grained Radiology Representations

    Jun 2, 2026Jonggwon Park, Seongeun Lee, Junhyun Park +6Vision-Language AlignmentFew-Shot Segmentation

  40. Cross-modal linkage risk in clinical vision-language models

    Jun 1, 2026Soroosh Tayebi Arasteh, Mahshad Lotfinia, Sven Nebelung +1Medical Vision-Language ModelsVision-Language Alignment

  41. Supervised Classification Heads as Semantic Prototypes: Unlocking Vision-Language Alignment via Weight Recycling

    May 21, 2026David Méndez, Roberto Confalonieri, Natalia Díaz RodríguezVision-Language AlignmentCross-Modal

  42. QwenSafe: Multimodal Content Rating Description Identification via Preference-Aligned VLMs

    May 20, 2026Dishanika Denipitiyage, Aruna Seneviratne, Suranga SeneviratneMultimodal EvaluationContent Moderation

  43. Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation

    May 15, 2026Chenhao Wang, Yingrui Ji, Yu Meng +1Open-Vocabulary SegmentationVision-Language Alignment

  44. Deep Pre-Alignment for VLMs

    May 14, 2026Tianyu Yu, Kechen Fang, Zihao Wan +5Vision-Language AlignmentVision Transformer

  45. CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis

    May 8, 2026Haroon Wahab, Irfan Mehmood, Hassan UgailColonoscopyVision-Language Alignment

  46. FairEnc: A Fair Vision-Language Model with Fair Vision and Text Encoders for Glaucoma Detection

    May 6, 2026Mohamed Elhabebe, Ayman El-Baz, Qing LiuGlaucoma DetectionVision-Language Alignment

  47. Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

    May 5, 2026Shule Lu, Yujing Wang, Hainan Zhang +5Vision-Language AlignmentRecent Vision-Language Models

  48. Ultrasound Vision-Language Alignment via Contrastive Learning

    May 4, 2026Zhuoyang Lyu, Yiyang Zhang, Tongxin Wang +1UltrasoundVision-Language Alignment

  49. Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance

    May 2, 2026Muyang Li, Yucheng Liu, Jianbo Ma +3Vision EncodersVision-Language Alignment

  50. DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval

    Apr 21, 2026Xinwei He, Yansong Zheng, Qianru Han +7Multi-ViewDinov3

  51. REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction

    Apr 20, 2026Seowung Leem, Lin Gu, Chenyu You +2Glaucoma DetectionAlzheimer

  52. T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability

    Apr 20, 2026Savya Khosla, Sethuraman T, Aryan Chadha +2Vision-Language AlignmentScalability

  53. Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

    Mar 21, 2026Huan Zheng, Yucheng Zhou, Tianyi Yan +6ColonoscopyMultimodal Clinical Data

  54. HiPath: Hierarchical Vision-Language Alignment for Structured Pathology Report Prediction

    Mar 20, 2026Ruicheng Yuan, Zhenxuan Zhang, Anbang Wang +5Pathology Foundation ModelsMedical Vision-Language Models