Audio-Visual Synchronization

Momentum

10 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 42

All topics
CardsList
  1. PVSync: A Unified Lip-Sync Expert for Timing and Articulation

    Oct 6, 2026Kevin Stephen, Varun Menon, Timo Mertens +1Audio-Visual SynchronizationAudio-Visual Representation Learning

  2. Align Then Reason: A Multimodal Lip-Sync Judge for Dubbing

    Sep 30, 2026Rui Liu, Bhavin Jawade, Haoqi Li +4Audio-Visual SynchronizationAudio-Visual Alignment

  3. Soundwich: Video Generation with Layered and Controllable Audio

    Sep 30, 2026Zhuo Ning, AmirHossein Naghi Razlighi, Sagi Polaczek +2Audio-Video GenerationAudio-Visual Synchronization

  4. HelixWorld: A Real-time Interactive Audio-Visual World Model

    Sep 29, 2026Lei Ke, Jiahao Pan, Zeyue Tian +13World Model LearningReal-Time Interactive Video Generation

  5. BeatDance: Generating Beat-Consistent 3D Dance with Hierarchical Spatial-Temporal Modeling

    Sep 29, 2026Xiaojian Shen, Dahu Shi, Jianrong Zhang +7Human Motion GenerationAudio-Visual Synchronization

  6. SyncRA: Learning Temporal Correspondence in Omni-Modal Models

    Sep 28, 2026Zelong Xu, Yan Li, Wenhe Hu +1Audio-Visual Representation LearningAudio-Visual Synchronization

  7. ComplexSync: High-Fidelity and Real-Time Lip Sync in Complex Scenarios

    Sep 24, 2026Jiaran Cai, Xingpei Ma, Shenneng HuangVideo Diffusion ModelsAudio-Visual Synchronization

  8. Not Quite My Tempo: Voice Activity-aware Speech Synthesis for Lip-Synchronous Dubbing

    Sep 22, 2026Alejandro Pérez-González-de-Martos, Florian Lux, Angelina Elizarova +3TTS SynthesisAudio-Visual Synchronization

  9. AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models

    Sep 17, 2026Longyin Zhang, Parth Sakhare Mahendra, Chengwei Wei +4Temporal Video GroundingAudio-Visual Understanding

  10. HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion

    Aug 12, 2026Wenshuo Peng, Kaipeng ZhangAudio-Video GenerationAudio Diffusion Models

  11. UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

    Aug 12, 2026Yuxuan Zhang, Haozhong Xiong, Jiayi Song +5Audio-Video GenerationVideo Diffusion Models

  12. Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

    Aug 6, 2026Menglin Han, Yang Ding, Yulei Lu +6Text-to-Video GenerationLong-Horizon Video Generation

  13. PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

    Aug 5, 2026Ao Fu, Yi Zhou3D Gaussian SplattingAudio-Visual Synchronization

  14. OmniVR: Audio-Video Conditional Generation for Archival Footage Restoration

    Aug 4, 2026Xin Lu, Zihao Fan, Jie Huang +4Audio-Visual SynchronizationVideo Restoration

  15. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

    Jul 26, 2026Jun Zhan, Chen Yang, Yitian Gong +23Variational AutoencodersAudio-Video Generation

  16. Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

    Jul 10, 2026Yijie Qian, Juncheng Wang, Chao Xu +6Audio-Video GenerationGroup Relative Policy Optimization

  17. Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

    Jul 7, 2026Thanh V. T. Tran, Ngoc-Son Nguyen, Luong Tran +4Audio-Video GenerationAudio-Visual Synchronization

  18. AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

    Jul 1, 2026Tianhong Zhou, Mingyang Han, Boyu Li +8Audio-Visual SynchronizationAudio-Visual Alignment

  19. WaveSync: Constrained Wavefront Optimization for Synchronized Co-Speech Gestures in Humanoid Robots

    Jun 15, 2026Thang Tran Viet, Thanh Nguyen Canh, Gia Huy Uong +4Human Motion GenerationAudio-Visual Synchronization

  20. FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

    Jun 12, 2026Shiyao Wang, Xijuan Zeng, Hui Wang +4Audio-Video GenerationAudio-Visual Synchronization

  21. Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

    Jun 9, 2026Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee +7Diffusion Model DistillationAudio-Visual Synchronization

  22. Inference-Time Scaling for Joint Audio-Video Generation

    Jun 2, 2026Jaemin Jung, Kyeongha Rho, Inkyu Shin +1Audio-Video GenerationInference-Time Scaling

  23. Native Audio-Visual Alignment for Generation

    May 28, 2026Longbin Ji, Guan Wang, Xuan Wei +6Audio-Video GenerationAudio-Visual Synchronization

  24. SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing

    May 24, 2026Sen Liang, Cong Wang, Fengbin Guan +6Video EditingAudio-Visual Synchronization

  25. Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

    May 17, 2026Yuheng Chen, Qingdong He, Teng Hu +4Audio-Video GenerationAudio-Visual Synchronization