Cross-Modal Learning

Latest papers 127

All topics
CardsList
  1. Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

    May 11, 2026Xuanchen Li, Yuheng Lu, Chenrui Cui +6Cross-Modal LearningMultimodal QA

  2. FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning

    May 10, 2026Xing Han, Shravan Chaudhari, Tanvi Ranade +2Cross-Modal LearningHealthcare

  3. SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

    May 10, 2026Kun Xiang, Terry Jingchen Zhang, Zirong Liu +15Cross-Modal LearningMultimodal Grounding

  4. Decoupling Endpoint and Semantic Transition Learning for Zero-Shot Composed Image Retrieval

    May 8, 2026Mingyu Liu, Sihan Huang, Yijia Fan +4Cross-Modal LearningVLM Adaptation

  5. Anisotropic Modality Align

    May 8, 2026Xiaomin Yu, Yijiang Li, Yuhui Zhang +8Cross-Modal LearningCross-Modal Alignment

  6. Weather-Robust Scene Semantics with Vision-Aligned 4D Radar

    May 8, 2026Kali Hamilton, Christoffer HeckmanCross-Modal LearningVLM Robustness

  7. Cross-Modal Navigation with Multi-Agent Reinforcement Learning

    May 7, 2026Shuo Liu, Xinzichen Li, Christopher AmatoCross-Modal LearningMulti-Agent Collaboration

  8. Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval

    May 7, 2026Jun Li, Peifeng Lai, Xuhang Lou +5Cross-Modal LearningEvidential Deep Learning

  9. Tumor-aware augmentation with task-guided attention analysis improves rectal cancer segmentation from magnetic resonance images

    May 6, 2026Aneesh Rangnekar, Joao Miranda, Natally Horvat +13Cross-Modal LearningCross-Modality Medical Image Segmentation

  10. Direct Product Flow Matching: Decoupling Radial and Angular Dynamics for Few-Shot Adaptation

    May 6, 2026Hongxu Chen, Yanghao Wang, Bowei Zhu +6Cross-Modal LearningFlow Matching

  11. HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities

    May 6, 2026Esra Dönmez, Pascal Tilli, Hsiu-Yu Yang +2Cross-Modal LearningImage Matching

  12. To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition

    May 6, 2026Yangchen Yu, Qian Chen, Jia Li +5Cross-Modal LearningMultimodal Robustness

  13. Unified Multimodal Visual Tracking with Dual Mixture-of-Experts

    May 5, 2026Lingyi Hong, Jinglun Li, Xinyu Zhou +6Cross-Modal LearningMultimodal Robustness

  14. Structured Diffusion Bridges: Inductive Bias for Denoising Diffusion Bridges

    May 3, 2026Eitan Kosman, Gabriele Serussi, Chaim BaskinCross-Modal LearningCross-Modal Alignment

  15. OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder

    May 2, 2026Detao Bai, Shimin Yao, Weixuan Chen +4Cross-Modal LearningVideo Understanding

  16. SplAttN: Bridging 2D and 3D with Gaussian Soft Splatting and Attention for Point Cloud Completion

    May 2, 2026Zhaoyang Li, Zhichao You, Tianrui LiCross-Modal LearningPoint Cloud Completion

  17. Multimodal Data Curation Through Ranked Retrieval

    May 1, 2026Pratyush Muthukumar, Harshil Kotamreddy, Sarah Amiraslani +4Cross-Modal LearningCross-Modal Alignment

  18. Let ViT Speak: Generative Language-Image Pre-training

    May 1, 2026Yan Fang, Mengcheng Lan, Zilong Huang +7Cross-Modal LearningVision Transformer

  19. EASE: Federated Multimodal Unlearning via Entanglement-Aware Anchor Closure

    May 1, 2026Zihao Ding, Beining Wu, Jun HuangCross-Modal LearningMultimodal Federated Learning

  20. Towards Customized Multimodal Role-Play

    May 1, 2026Chao Tang, Jianzong Wu, Qingyu Shi +5Cross-Modal LearningCross-Modal Alignment

  21. Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

    May 1, 2026Chunlei Meng, Pengbin Feng, Rong Fu +7Cross-Modal LearningMulti-Agent Collaboration

  22. REALM: An RGB- and Event-Aligned Latent Manifold for Cross-Modal Perception

    Apr 30, 2026Vincenzo Polizzi, David B. Lindell, Jonathan KellyCross-Modal LearningEvent-Based Vision

  23. One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness

    Apr 30, 2026Hiroyuki Deguchi, Katsuki Chousa, Yusuke SakaiCross-Modal LearningMultimodal Robustness

  24. VitaminP: cross-modal learning enables whole-cell segmentation from routine histology

    Apr 26, 2026Yasin Shokrollahi, Karina B. Pinao Gonzales, Elizve N. Barrientos Toro +5Cross-Modal LearningComputational Pathology

  25. Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

    Apr 26, 2026Zhen Ye, Xu Tan, Aoxiong Yin +8Cross-Modal LearningAudio-Video Generation

  26. Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization

    Apr 24, 2026Hefeng Zhou, Xuan Liu, Sicheng Chen +7Cross-Modal LearningMultimodal Federated Learning