Video Generation

Momentum

32 papers in the last four weeks, up 146% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 241

All topics
CardsList
  1. PresentAgent-2: Towards Generalist Multimodal Presentation Agents

    May 12, 2026Wei Wu, Ziyang Xu, Zeyu Zhang +2Video GenerationMultimodal Agents

  2. AllocMV: Optimal Resource Allocation for Music Video Generation via Structured Persistent State

    May 11, 2026Huimin Wang, Leilei Ouyang, Chang Xia +3Audio-Video GenerationLong-Horizon Video Generation

  3. TIE: Time Interval Encoding for Video Generation over Events

    May 11, 2026Zhilei Shu, Shangwen Zhu, Zihang Liang +10Rotary Positional EmbeddingsVideo Diffusion Models

  4. Improving Human Image Animation via Semantic Representation Alignment

    May 11, 2026Chang Liu, Mengting Chen, Yixuan Huang +5Image-to-Video GenerationVideo Diffusion Models

  5. SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation

    May 11, 2026Liangyang Ouyang, Ruicong Liu, Caixin Kang +2Video GenerationControllable Video Generation

  6. SDTalk: Structured Facial Priors and Dual-Branch Motion Fields for Generalizable Gaussian Talking Head Synthesis

    May 11, 2026Peng Jia, Zhen Xiao, Jia Li +33D Gaussian SplattingTalking Head Generation

  7. SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation

    May 10, 2026Shanwen Tan, Hao Li, Jingtao Zhang +4Long Video GenerationMemory-Augmented Video Generation

  8. CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

    May 9, 2026Joowon Kim, Seungho Shin, Joonhyung Park +1Video GenerationVideo Reasoning

  9. Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

    May 9, 2026Shihao Cheng, Jiaxu Zhang, Quanyue Song +6Audio-Video GenerationAudio-Visual Synchronization

  10. FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction

    May 7, 2026Fangda Chen, Shanshan Zhao, Longrong Yang +3Video Diffusion ModelsLong Video Generation

  11. FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation

    May 6, 2026Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng +7Text-to-Video GenerationIdentity-Preserving Video Generation

  12. Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing

    May 5, 2026Zhiyuan Li, Wenyan Yang, Wenshuai Zhao +4Disentangled Representation LearningCross-Embodiment Robot Learning

  13. Video Generation with Predictive Latents

    May 4, 2026Yian Zhao, Feng Wang, Qiushan Guo +4Variational AutoencodersPredictive Coding

  14. AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation

    May 1, 2026Yuxin Lu, Jiayang Sun, Guibo Zhu +1Video Diffusion ModelsLong Video Generation

  15. PhyCo: Learning Controllable Physical Priors for Generative Motion

    Apr 30, 2026Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan +1Physics-Informed Generative ModelingPhysical Consistency in Video Generation

  16. Generate Your Talking Avatar from Video Reference

    Apr 30, 2026Zujin Guo, Zhenhui Ye, Yi Ren +4Video-Reference Video GenerationAudio-Video Generation

  17. DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation

    Apr 29, 2026Junhu Fu, Ke Chen, Weidong Guo +9EndoscopyPhysical Consistency in Video Generation

  18. A Systematic Post-Train Framework for Video Generation

    Apr 28, 2026Zeyue Xue, Siming Fu, Jie Huang +9Diffusion Model AlignmentVideo Diffusion Models

  19. DATAREEL: Automated Data-Driven Video Story Generation with Animations

    Apr 28, 2026Ridwan Mahbub, Syem Aziz, Mahir Ahmed +4Data VisualizationVideo Generation

  20. MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation

    Apr 26, 2026Haojie Zhang, Di Wu, Bingyan Liu +5Video GenerationMulti-Shot Video Generation

  21. PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics

    Apr 26, 2026Tianyidan Xie, Zhentao Huang, Mingjie Wang +4Physical Consistency in Video GenerationImage-to-Video Generation

  22. EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence

    Apr 25, 2026Yahui Li, Yinfeng Yu, Liejun Wang +1Video Diffusion ModelsAudio-Visual Synchronization

  23. KD-CVG: A Knowledge-Driven Approach for Creative Video Generation

    Apr 23, 2026Linkai Liu, Wei Feng, Xi Zhao +9Multimodal RAGText-to-Video Generation

  24. Building a Precise Video Language with Human-AI Oversight

    Apr 22, 2026Zhiqiu Lin, Chancharik Mitra, Siyuan Cen +13Human-in-the-Loop AnnotationVideo Captioning

  25. ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis

    Apr 21, 2026Zhengwentai Sun, Keru Zheng, Chenghong Li +7Camera-Controlled Video GenerationVideo Generation