Audio-Visual Representation Learning

Latest papers 19

All topics
CardsList
  1. PVSync: A Unified Lip-Sync Expert for Timing and Articulation

    Oct 6, 2026Kevin Stephen, Varun Menon, Timo Mertens +1Audio-Visual SynchronizationAudio-Visual Representation Learning

  2. SyncRA: Learning Temporal Correspondence in Omni-Modal Models

    Sep 28, 2026Zelong Xu, Yan Li, Wenhe Hu +1Audio-Visual Representation LearningAudio-Visual Synchronization

  3. A Hybrid Mamba for Audio-Visual Navigation

    Jul 14, 2026Yi Wang, Yinfeng YuMambaEmbodied Navigation

  4. Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking

    Jul 7, 2026Manning Gao, Tingyi Liu, Leheng Zhang +3Representation LearningLearning to Rank

  5. C3C^3ASD: Multi-Level Consistency-Driven Representation Learning

    Jul 3, 2026Jin Hong, Jisoo Park, Junseok KwonMultimodal RobustnessAudio-Visual Representation Learning

  6. Unlocking Spatial Grounding in Large Audio-Visual Retrieval models

    Jun 22, 2026Hugo Malard, Michel Olvera, Sanjeel Parekh +3Multimodal GroundingAudio-Visual Understanding

  7. Listen, Look, and Learn: Learning Without Forgetting through SAM-Audio

    Jun 9, 2026Avi Gupta, Nilotpal Sinha, Vishnu Raj +4Class-Incremental LearningAudio-Visual Representation Learning

  8. M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

    Jun 4, 2026Fei Su, Cancan Li, Ming Li +1Multimodal RobustnessAudio-Visual Representation Learning

  9. Towards multi-modal forgery representation learning for AI-generated video detection and localization

    May 8, 2026Dat Le, Khoa Nguyen, Xin Wang +1Audio-Visual Representation LearningDeepfake Detection

  10. Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning

    May 3, 2026Xinmeng Xu, Haoran Xie, S. Joe Qin +3Audio-Visual UnderstandingAudio-Visual Representation Learning

  11. OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder

    May 2, 2026Detao Bai, Shimin Yao, Weixuan Chen +4Cross-Modal LearningVideo Understanding

  12. AViS-Mamba: Adaptive Visual Steering of Audio State-Space Dynamics for Violence Detection

    Apr 2, 2026Damith Chamalke Senadeera, Dimitrios Kollias, Gregory SlabaughAudio-Visual UnderstandingAudio-Visual Representation Learning

  13. Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios

    Mar 9, 2026Pol Buitrago, Javier HernandoSynthetic Data AugmentationAudio-Visual Representation Learning

  14. Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation

    Dec 23, 2025Jingqi Tian, Yiheng Du, Haoji Zhang +6Audio-Visual UnderstandingAudio-Visual Representation Learning

  15. TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization

    Dec 2, 2024Hugo Malard, Michel Olvera, Stephane Lathuiliere +1Image SegmentationAudio-Visual Representation Learning