Audio-Visual Alignment

Latest papers 57

All topics
CardsList
  1. Ariadne's Thread of LipSync: Unraveling Forgeries via Inconsistency between Lip Motions and Head Poses

    Oct 6, 2026Tianyi She, Jiawei Liu, Weifeng Liu +3Digital ForensicsDeepfake Detection

  2. UltraDub: Towards Authentic Dubbing by Unifying Visually-Steered Flow Learning and Trajectory Guidance

    Oct 5, 2026Gaoxiang Cong, Liang Li, Jianwei Wen +3Audio-Video GenerationAudio-Visual Alignment

  3. Align Then Reason: A Multimodal Lip-Sync Judge for Dubbing

    Sep 30, 2026Rui Liu, Bhavin Jawade, Haoqi Li +4Audio-Visual SynchronizationAudio-Visual Alignment

  4. Soundwich: Video Generation with Layered and Controllable Audio

    Sep 30, 2026Zhuo Ning, AmirHossein Naghi Razlighi, Sagi Polaczek +2Audio-Video GenerationAudio-Visual Synchronization

  5. Hear the World in Stereo: Learning Dynamic Spatial Correspondence for Immersive Joint Video-Audio Generation

    Sep 30, 2026Hanmo Chen, Chengcheng Liu, Tianxiao Chen +7Audio-Video GenerationAudio-Visual Alignment

  6. Enabling Immersive Audio-Visual Experience from Any Video

    Sep 28, 2026Zitong Lan, Mutian Tong, Jiatao Gu +1Audio-Video GenerationAudio-Visual Alignment

  7. Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy

    Sep 28, 2026Abhinav Sharma, Sai Karthik Navuluru, Wang Wei +21Audio-Video GenerationMultimodal Generation

  8. SyncRA: Learning Temporal Correspondence in Omni-Modal Models

    Sep 28, 2026Zelong Xu, Yan Li, Wenhe Hu +1Audio-Visual Representation LearningAudio-Visual Synchronization

  9. Uncovering Ordinal-Matching Bias in Audio-Visual LLMs

    Sep 28, 2026Jihoo Jung, Youngjoon Jang, Hyebin Cho +2Audio-Visual UnderstandingMultimodal Large Language Models

  10. AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

    Sep 24, 2026Zhiyu Xu, Weilong Yan, Yufei Shi +4Audio-Video GenerationAudio-Visual Alignment

  11. The Attention Triangle in Audio-Video Models

    Sep 3, 2026Sagi Polaczek, Noa Kraicer, Gal Metzer +4Audio-Video GenerationAttention Control in Diffusion Models

  12. Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

    Aug 10, 2026Dongxu Ge, Shansong Liu, Cheng Gong +3Audio-Visual UnderstandingConditional Image Generation

  13. Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation

    Aug 4, 2026Leiye Liu, Miao Zhang, Jiahong Jiang +7Video Object SegmentationInstance Segmentation

  14. EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

    Aug 3, 2026Jiayu Chen, Xiaoyu Wu, Rongshan Gao +6Audio-Video GenerationAudio-Visual Alignment

  15. DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs

    Jul 31, 2026Ziwei Cheng, Zhenhua Tan, Zhuomin ZhuMultimodal RobustnessAudio-Visual Speech Recognition

  16. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

    Jul 26, 2026Jun Zhan, Chen Yang, Yitian Gong +23Variational AutoencodersAudio-Video Generation

  17. AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

    Jul 17, 2026Yuqing Wen, Yukai Huang, Qianqian Xie +6Video Editing BenchmarksVideo Editing

  18. MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

    Jul 15, 2026Xiaohan Zhang, Yuqing Wen, Junlin Chen +9Audio-Video GenerationAudio-Visual Alignment

  19. AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

    Jul 14, 2026Yanghai Wang, Jiahao Wang, Jiafu Tang +9Audio-Visual UnderstandingAudio-Visual Alignment

  20. Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

    Jul 10, 2026Xugang Lu, Peng Shen, Yu Tsao +1Automatic Speech RecognitionAudio-Visual Speech Recognition

  21. Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

    Jul 2, 2026Chen Zhao, Jiajun Ma, Qilong Huang +6Audio-Visual UnderstandingVideo Captioning

  22. AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

    Jul 1, 2026Tianhong Zhou, Mingyang Han, Boyu Li +8Audio-Visual SynchronizationAudio-Visual Alignment

  23. AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

    Jun 29, 2026Kien T. Pham, I Chieh Chen, Qifeng Chen +1Audio-Video GenerationAudio-Visual Alignment

  24. MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

    Jun 28, 2026Kaiqi Liu, Yunyao Mao, Ziqi Cai +8Audio-Video GenerationAudio-Visual Alignment

  25. Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement

    Jun 16, 2026Colombe Mboungou, Mostafa Sadeghi, Jean-Eudes Ayilo +1Speech EnhancementAudio-Visual Alignment