Audio-Visual Alignment

Latest papers 57

All topics
CardsList
  1. FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

    Jun 12, 2026Shiyao Wang, Xijuan Zeng, Hui Wang +4Audio-Video GenerationAudio-Visual Synchronization

  2. Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization

    Jun 5, 2026Zhe Yang, Ruyi Zhang, Hongtao Chen +4Audio-Visual UnderstandingHeterogeneous GNNs

  3. Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

    Jun 2, 2026Ye Tao, Lupeng Liu, Xuenan Xu +6Audio-Video GenerationUnified Multimodal Models

  4. Inference-Time Scaling for Joint Audio-Video Generation

    Jun 2, 2026Jaemin Jung, Kyeongha Rho, Inkyu Shin +1Audio-Video GenerationInference-Time Scaling

  5. Benchmarking Single-Factor Physical Video-to-Audio Generation

    May 28, 2026Tingle Li, Siddharth Gururani, Kevin J. Shih +6Audio-Video GenerationAudio-Visual Alignment

  6. Native Audio-Visual Alignment for Generation

    May 28, 2026Longbin Ji, Guan Wang, Xuan Wei +6Audio-Video GenerationAudio-Visual Synchronization

  7. BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation

    May 26, 2026Yutong Wang, Yunke Wang, Xinyuan Chen +1Audio-Video GenerationVideo Generation

  8. Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

    May 24, 2026Shuyuan Tu, Qi Tian, Zihan Yang +9Cross-Modal LearningAudio-Video Generation

  9. SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing

    May 24, 2026Sen Liang, Cong Wang, Fengbin Guan +6Video EditingAudio-Visual Synchronization

  10. AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

    May 23, 2026Jialiang Yang, Bin Xia, Ruihang Chu +6Audio-Video GenerationAudio-Visual Alignment

  11. MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

    May 19, 2026Yujie Wei, Yujin Han, Zhekai Chen +20Audio-Video GenerationAudio-Visual Alignment

  12. When Vision Speaks for Sound

    May 13, 2026Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6Audio-Language Model EvaluationAudio-Visual Understanding

  13. OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

    May 12, 2026Guohui Zhang, XiaoXiao Ma, Jie Huang +9Audio-Video GenerationAudio-Visual Synchronization

  14. LightAVSeg: Lightweight Audio-Visual Segmentation

    May 9, 2026Qing Zhong, Guodong Ding, Lingqiao Liu +3Audio-Visual UnderstandingAudio-Visual Alignment

  15. Audio-Visual Intelligence in Large Foundation Models

    May 5, 2026You Qin, Kai Liu, Shengqiong Wu +12Audio-Visual UnderstandingAudio-Video Generation

  16. MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

    May 1, 2026Kazuya Tateishi, Akira Takahashi, Atsuo Hiroe +3Audio-Video GenerationSound Event Detection

  17. Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

    Apr 26, 2026Chunyu Li, Jiaye Li, Ruiqiao Mei +4Audio-Video GenerationVideo Diffusion Models

  18. BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

    Apr 24, 2026Advait Tilak, Jiwon Choi, Nazifa Mouli +1Text-to-Video GenerationAudio-Visual Alignment

  19. Hierarchical Codec Diffusion for Video-to-Speech Generation

    Apr 17, 2026Jiaxin Ye, Gaoxiang Cong, Chenhui Wang +4Audio-Video GenerationDiffusion Transformer

  20. ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

    Apr 16, 2026Jianxuan Yang, Xinyue Guo, Zhi Cheng +10Audio-Video GenerationMultimodal Generation

  21. AViS-Mamba: Adaptive Visual Steering of Audio State-Space Dynamics for Violence Detection

    Apr 2, 2026Damith Chamalke Senadeera, Dimitrios Kollias, Gregory SlabaughAudio-Visual UnderstandingAudio-Visual Representation Learning

  22. Conditional Flow Matching for Visually-Guided Acoustic Highlighting

    Feb 3, 2026Hugo Malard, Gael Le Lan, Daniel Wong +3Conditional Flow MatchingAudio-Visual Alignment

  23. Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation

    Dec 23, 2025Jingqi Tian, Yiheng Du, Haoji Zhang +6Audio-Visual UnderstandingAudio-Visual Representation Learning

  24. SyncVoice: Simple and Effective Automatic Video Dubbing with Vision-Augmented TTS

    Nov 23, 2025Kaidi Wang, Yi He, Wenhao Guan +9TTS SynthesisAudio-Visual Synchronization