Cross-Modal Alignment

Momentum

5 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 65

All topics
CardsList
  1. HyperCLIP++: Fine-tuning CLIP forOpen-vocabulary Semantic Segmentation in Hyperbolic Space

    Sep 21, 2026Zelin Peng, Zhengqin Xu, Changsong Wen +4Contrastive Language-Image Pre-Training ModelOpen-Vocabulary Segmentation

  2. Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

    Aug 10, 2026Dongxu Ge, Shansong Liu, Cheng Gong +3Audio-Video GenerationMultimodal Generation

  3. Vision-Language Grounding as Bidirectional Concept Correspondence

    Aug 8, 2026Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer +1Vision-Language Model GroundingContextual Grounding

  4. DARAD: Dual Adapters and Ranking-Aware Distillation for Continual Remote Sensing Image-Text Retrieval

    Aug 6, 2026Xi Chen, Xu Chen, Xiangyang Jia +3Remote SensingCross-Modal Distillation

  5. DistMedVL: Distributional Vision-Language Alignment for Uncertainty-Aware Medical Image Segmentation

    Aug 6, 2026Jiaxuan Li, Qing Xu, Xiangjian He +4Vision-Language AlignmentSemi-Supervised Medical Image Segmentation

  6. Learning Molecular Representations from Cellular Phenotypes with Structure Preservation

    Aug 3, 2026Xuan Lin, Jingyu Sheng, Tengfei Ma +2Molecular Representation LearningChemical Structures

  7. OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

    Jul 28, 2026Haoyang Huang, Wenjie Huang, Tianqi Xu +14Token CompressionAudio Tokenizers

  8. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

    Jul 26, 2026Jun Zhan, Chen Yang, Yitian Gong +23Audio-Video GenerationCross-Modal Alignment

  9. DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

    Jul 23, 2026Sung-Hoon Yoon, Hoyong Kwon, Changgyoon Oh +1Open-Vocabulary SegmentationImage-Text Alignment

  10. Achieving Text-based Person Retrieval with Any Granularity

    Jul 23, 2026Jialong Zuo, Hanyu Zhou, Dongyue Wu +5Cross-Modal Alignment

  11. Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

    Jul 23, 2026Kyeongmo Chae, Jihoon Lee, Sangtae AhnFine-Grained Video UnderstandingCross-Modal Alignment

  12. RMS@CC-MMD 2026: Multimodal Misogyny Detection via Geometric Interaction and Multi-View Consensus

    Jul 20, 2026Md. Ajwad HossainMemesMultimodal Sentiment Analysis

  13. Towards Predictive, Aligned, and Scalable Robot Learning

    Jul 13, 2026Peijun Tang, Shangjin Xie, Baifu Huang +6Latent World ModelsScalable Robot Learning

  14. VTaMo: Video-Text Alignment Model for Sign Language Translation

    Jul 10, 2026Junyi Hu, Zhewen He, Haomian Huang +2Gloss-Free Sign Language TranslationSign Language Translation

  15. Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

    Jul 10, 2026Xugang Lu, Peng Shen, Yu Tsao +1Cross-Modal AlignmentLatent Representation Alignment

  16. Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

    Jul 7, 2026Thanh V. T. Tran, Ngoc-Son Nguyen, Luong Tran +4Audio-Video GenerationCross-Modal Alignment

  17. Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing

    Jul 6, 2026Gengtian Shi, Jinze Yu, Chenhao Wu +5Temporal Action LocalizationCross-Modal Alignment

  18. Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

    Jul 2, 2026Chen Zhao, Jiajun Ma, Qilong Huang +6Audio-Visual ConsistencyCross-Modal Alignment

  19. CALM: Interpretable Cross-Modal Alignment for Biomarker Discovery from Unpaired Data

    Jul 2, 2026Jueqi Wang, Zachary Jacokes, John Darrell Van Horn +3Multimodal NeuroimagingBiomarker

  20. Resolving superposition in AI for interpretability and cross-modal alignment in patient-neuronal images

    Jun 30, 2026Jisung Park, Seohyeon Kang, Daeun Yoo +8Multimodal NeuroimagingSpatial Transcriptomics

  21. Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation

    Jun 29, 2026Kun Li, Shengxi Gui, Francesco Nex +1Remote Sensing Image SegmentationCross-Modal Alignment

  22. Heterogeneous Tactile Transformer

    Jun 29, 2026Jianxin Bi, Qiang Wang, Jayaram Reddy +4TactileContact-Rich Dexterous Manipulation

  23. Text as Illumination: Spatial Contrastive Retinex Learning for Language-guided Medical Image Segmentation

    Jun 26, 2026Jian Shi, Cheng Zhen, Pingping Zhang +6Semi-Supervised Medical Image SegmentationRetinex Theory

  24. Progressive Pixel-Neighborhood Deformable Cross-Attention for Multispectral Object Detection

    Jun 23, 2026Tian Qiu, Jifeng Shen, Xin ZuoCross-Modal AlignmentLong-Range Coherence

  25. Mind the Heads: Topological Representation Alignment for Multimodal LLMs

    Jun 22, 2026Davide Caffagni, Alberto Compagnoni, Federico Melis +5Cross-Modal AlignmentMultimodal Large Language Models

  26. MV-WAM: Manifold-Aware World Action Model with Value Augmentation

    Jun 19, 2026Jintao Chen, Peidong Jia, Qingpo Wuwu +13Efficient World-Action ModelFaster-Wam

  27. MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

    Jun 18, 2026Yu Nakagome, Jaesong Lee, Soo-Whan ChungSpeech-To-Text AlignmentLarge Audio Language Models

  28. The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports

    Jun 16, 2026Samar AnsariRadiology Report GenerationSummarization

  29. Structure-aware Knowledge-guided Heterogeneous Mamba for Zygomaticomaxillary Suture Assessment

    Jun 15, 2026Xiaoqi Guo, Birui Chen, Xinquan Yang +8Occlusal ConstraintMorphometric Analysis

  30. UniCA: Bi-directional Cross-Attention with Positive Similarity Loss for Robust Multi-Modal Retrieval

    Jun 3, 2026Yini Huang, Wenlong ZhangMultimodal RetrievalCross-Modal Alignment

  31. Mixed-Modality Dual Face-Hair Retrieval

    Jun 2, 2026Quoc-Anh Bui-Huynh, Mai-Tuyen Lam, Dai-Anh-Tuan Nguyen +1Multimodal RetrievalFace Recognition Model

  32. Variational Adapter for Cross-modal Similarity Representation

    May 29, 2026WenZhang Wei, Zhipeng Gui, Dehua Peng +2Cross-Modal AlignmentCross-Modal

  33. Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding

    May 29, 2026Xiang Fang, Daizong Liu, Wanlong Fang +4Temporal GroundingCross-Modal Alignment

  34. Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

    May 24, 2026Shuyuan Tu, Qi Tian, Zihan Yang +9Audio-Video GenerationDenoising Trajectory

  35. Representation Alignment Rests on Linear Structure

    May 22, 2026Kiril Bangachev, Guy Bresler, Yury PolyanskiyCross-Modal AlignmentBiases

  36. Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes

    May 22, 2026Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-ElorMulti-Reference Image GenerationIndoor Scene Generation

  37. Semi-MedRef: Semi-Supervised Medical Referring Image Segmentation with Cross-Modal Alignment

    May 15, 2026Yuchen Li, Zhen Zhao, Yi Liu +1Semi-Supervised Medical Image SegmentationCross-Modal Alignment

  38. Differentially Private Motif-Preserving Multi-modal Hashing

    May 14, 2026Zehua Cheng, Wei Dai, Jiahao SunLocality-Sensitive HashingΔ)$-Differential Privacy

  39. STAR: Semantic-Temporal Adaptive Representation Learning for Few-Shot Action Recognition

    May 13, 2026Hongli Liu, Yu Wang, Shengjie ZhaoOpen-Vocabulary Action RecognitionPhotometric Supervision

  40. Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention

    May 12, 2026Hamza Ahmed Durrani, Rafay Suleman DurraniRecent Vision-Language ModelsCross-Modal Alignment

  41. Cross-Modal-Domain Generalization Through Semantically Aligned Discrete Representations

    May 12, 2026Souptik Sen, Raneen Younis, Zahra AhmadiCross-Modal AlignmentCross-Modal

  42. DAPE: Dynamic Non-uniform Alignment and Progressive Detail Enhancement Techniques for Improving the Performance of Efficient Visual Language Models

    May 9, 2026Mengyuan Tian, Qiyan Zhao, Yanan Wang +1Cross-Modal AlignmentRecent Vision-Language Models

  43. Align3D-AD: Cross-Modal Feature Alignment and Dual-Prompt Learning for Zero-shot 3D Anomaly Detection

    May 7, 2026Letian Bai, Xuanming Cao, Juan Du +1Multimodal Anomaly Detection3D Generation

  44. SpectraDINO: Bridging the Spectral Gap in Vision Foundation Models via Lightweight Adapters

    May 4, 2026Yagiz Nalcakan, Hyeongjin Ju, Incheol Park +3Recent Vision Foundation ModelsVision Foundation Models

  45. TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation

    May 3, 2026Xiaoda Yang, Majun Zhang, Changhao Pan +10DuetText-To-Music

  46. Personalized Cross-Modal Emotional Correlation Learning for Speech-Preserving Facial Expression Manipulation

    Apr 28, 2026Tianshui Chen, Yujie Zhu, Jianman Lin +4Facial Expression RecognitionEmotion Recognition

  47. Fast-then-Fine: A Two-Stage Framework with Multi-Granular Representation for Cross-Modal Retrieval in Remote Sensing

    Apr 22, 2026Xi Chen, Xu Chen, Xiangyang Jia +3Multimodal RetrievalRemote Sensing

  48. Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?

    Apr 20, 2026Chengan Che, Chao Wang, Jiayuan Huang +2Medical Vision-Language ModelsMultimodal Pretraining

  49. PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging

    Apr 18, 2026Zibo Shao, Baochen Xiong, Xiaoshan Yang +4Cross-Modal AlignmentMultimodal Pretraining