Cross-Modal Learning

Latest papers 127

All topics
CardsList
  1. CrossEdit: Cross-Modal Training Enables Rich Audio-Visual Editing

    Oct 7, 2026William Chen, Prem Seetharaman, Ke Chen +10Instruction-Based Video EditingUnified Multimodal Models

  2. GCTAuto-encoder: A Cross modal Framework for Security Flaw Detection in IoT Networks

    Oct 5, 2026Najmieh Sadat SafarabadiCross-Modal LearningIoT Intrusion Detection

  3. Do Emotion Concepts Generalize Across Sources, Modalities, and Architectures in Vision-Language Models?

    Sep 28, 2026Bohao Xing, Xin Liu, Kaishen Yuan +5Cross-Modal LearningVision-Language Models

  4. Cross-modal Translation via Conditional Latent Denoising for Video Deepfake Detection

    Sep 27, 2026Xinzhe Li, Youzhi Tu, Kong Aik LeeCross-Modal LearningCross-Modal Alignment

  5. Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

    Aug 7, 2026Chen Ling, Hanqian Li, Dongnan Liu +9Cross-Modal LearningVisual Reasoning

  6. Deep Multimodal Fusion Detection through Spatial Mask and Channel Competition

    Aug 3, 2026Guandi Wang, Ming Li, Yunsen Xing +1Cross-Modal LearningCross-Modal Attention

  7. Scaling Native Multimodal Pre-Training From Scratch

    Jul 24, 2026Haoyuan Wu, Aoqi Wu, Hai Wang +3Cross-Modal LearningMultimodal Pretraining

  8. Multimodality as Supervision: Self-Supervised Specialization to the Test Environment via Multimodality

    Jul 16, 2026Kunal Pratap Singh, Ali Garjani, Rishubh Singh +6Cross-Modal LearningCross-Modal Representation Learning

  9. Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

    Jul 7, 2026Andrei-George Durdun, Victor Constantinescu, Radu Tudor IonescuCross-Modal LearningSentiment Analysis

  10. Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality

    Jun 11, 2026Wei Li, Zhen Huang, Xinmei TianCross-Modal LearningVision-Language Models

  11. Building The Ph(ysical)AI Layer Of Machine Intelligence

    Jun 2, 2026Ulbert Jose Botero, Liam Smith, Brooks Olney +5Cross-Modal LearningCross-Modal Representation Learning

  12. A Sonar-Visual Dataset for Cross-Modal Underwater Robot Perception

    May 31, 2026Weitung Chen, Phil Tinn, Per Gunnar Auran +2Cross-Modal LearningUnderwater Robotics

  13. DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation

    May 28, 2026Jusuk Lee, Seungjae Lee, Jonghun Shin +6Cross-Modal LearningCross-Modal Representation Learning

  14. LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

    May 28, 2026Feng Han, Zhixiong Zhang, Zheming Liang +2Cross-Modal LearningVLM Robustness

  15. OVA-IB: One vs All Information Bottleneck for Multi-Modal Alignment

    May 28, 2026Tianchao Li, Shujian Yu, Xinrui Zu +4Cross-Modal LearningCross-Modal Alignment

  16. Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language

    May 28, 2026Xiang Fang, Daizong Liu, Wanlong Fang +5Cross-Modal LearningTemporal Video Grounding

  17. AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling

    May 28, 2026Yiheng Li, Zhuo Li, Ruibing Hou +4Cross-Modal LearningUnified Multimodal Models

  18. ProgVLA: Progress-Aware Robot Manipulation Skill Learning

    May 27, 2026Seungsu Kim, Jinyoung Choi, Seungmin Baek +1Cross-Modal LearningEfficient Multimodal Inference

  19. LAST: Bridging Vision-Language and Action Manifolds via Gromov-Wasserstein Alignment

    May 27, 2026Huaihai Lyu, Chaofan Chen, Yuheng Ji +4Cross-Modal LearningVision-Language-Action Models

  20. Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

    May 25, 2026Bonan Ding, Umair Nawaz, Ufaq Khan +5Cross-Modal LearningMultimodal Large Language Models

  21. MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

    May 25, 2026Kaixiang Chen, Pengfei Fang, Hui XueCross-Modal LearningCross-Modal Representation Learning

  22. Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

    May 24, 2026Shuyuan Tu, Qi Tian, Zihan Yang +9Cross-Modal LearningAudio-Video Generation

  23. RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?

    May 22, 2026Arijit Ghosh, Aritra Bandyopadhyay, Chiranjeev Bindra +1Cross-Modal LearningCross-Modal Alignment