Video Generation

Momentum

32 papers in the last four weeks, up 146% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 241

All topics
CardsList
  1. WorldGuide: Goal-Directed Video World Model for Procedural Task Execution

    Oct 8, 2026Ankan Deria, Komal Kumar, Hisham Cholakkal +2Video GenerationAgentic Video Generation

  2. WorldAlign: Decoupled 4D Reward for World-Consistent Video Generation

    Oct 8, 2026Jing He, Kaixin Ding, Xingye Tian +5Video GenerationTemporal Consistency in Video Generation

  3. Phase-aware video generation for physics-grounded dynamics and interactions

    Oct 8, 2026Jingfeng Ou, Kun Wang, Rui Zhao +4Video GenerationPhysical Consistency in Video Generation

  4. Conditional Residual Prediction: Improving Autoregressive Video Diffusion without a Bidirectional Teacher

    Oct 8, 2026Bowen Zheng, Zhiguang Liu, Jiarong Ou +2Video Diffusion ModelsVideo Generation

  5. Fluid-Gen-Zero: Grounding Pretrained Video Generators in Physics without Training

    Oct 7, 2026Hong Huang, Yuqiu Liu, Chenyu You +3Video GenerationPhysical Consistency in Video Generation

  6. Beyond Masks and Trajectories: Flow-Guided Latent Action Injection for Stable Surgical Video Generation

    Oct 7, 2026Tsz-Yui Qin, Siyu Zhou, Chi-Keung Tang +2Video GenerationAction-Conditioned Video Generation

  7. VIS-Ground: Video Interactive Storytelling with Contextual Grounding

    Oct 7, 2026Bingxuan Li, Yiwen Song, Xueqing Wu +10Video GenerationInteractive Storytelling

  8. SPW-Nav: A Streaming Panoramic World Model for Language-Guided Navigation

    Oct 6, 2026Yunheng Liu, Ziqi Cai, Siqi Yang +7Video GenerationVideo World Models

  9. TasteRoute: Personalized Routing for Video Generation

    Oct 5, 2026Zhi Rui Tam, Chao-Chung Wu, Sin-Han Yang +8Video Generation

  10. Generating the Wild: Individual-Consistent Image-to-Video Generation for Wildlife

    Oct 4, 2026Yuzhuo Li, Di Zhao, Xinyu Zhang +2Image-to-Video GenerationIdentity-Preserving Video Generation

  11. Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training

    Oct 4, 2026Shuyuan Tu, Qi Tian, Yinming Huang +8Audio-Video GenerationVideo Generation

  12. Custom Forcing: Training-Free Subject Customization for Autoregressive Video Generation

    Oct 2, 2026Yunseung Ok, Hyunsoo Kim, Minseo Kim +1Identity-Preserving Video GenerationStreaming Video Generation

  13. Memory-Guided B-Roll Generation from User Video Collections

    Oct 1, 2026Cusuh Ham, Fabian Caba Heilbron, Josef Sivic +1Video-Reference Video GenerationMemory-Augmented Video Generation

  14. DiVid: Diagnosing Dimension-Specific Diversity Collapse in Video Generation Models

    Oct 1, 2026Huanran Hu, Zihui Ren, Dingyi Yang +4Video GenerationControllable Video Generation

  15. VTR-Bench: A Systematic Benchmark for Evaluating Visual Text Rendering in Video Generation

    Oct 1, 2026Yu Huang, Jungang Li, Zhiyuan Wang +8Agentic Video GenerationVideo Generation

  16. Towards Subject Consistency over Dynamic Subject Sets in Video Generation

    Oct 1, 2026Tongcheng Zhang, Jun Zhu, Jianfei ChenLong Video GenerationIdentity-Preserving Video Generation

  17. No Corners Cut: State-Grounded Transitions for Mid-Stream Prompt Switches in Video Generation

    Sep 30, 2026Zejing Rao, Ketong Ren, Xiaoqiang Liu +3Streaming Video GenerationVideo Generation

  18. Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE

    Sep 29, 2026Yu Xu, Yuxin Zhang, Xiao Yang +7Video Diffusion ModelsVideo Generation

  19. Beyond Legibility: Benchmarking Visual Text Rendering and In-Place Editing in Unified Video Generation

    Sep 29, 2026Ziying Zhang, Litao Li, Junchao Liao +4Video Editing BenchmarksVideo Editing

  20. PreviewDiff: Multimodal Critic-Guided Search over Diffusion Latents

    Sep 28, 2026Vighnesh Subramaniam, Boris Katz, Brian Cheung +3Diffusion Model GuidanceT2I Generation

  21. Ego-Forge: Text and Geometric-Attention Free Exo-to-Egocentric Video Generation

    Sep 28, 2026Mohammad Mahdi, Luc Van Gool, Danda Pani PaudelCamera-Conditioned Video GenerationVideo Diffusion Models

  22. G3^3-LoRA: Organizing Reward-Weighted Video Data with Gradient-Guided Grouped LoRA

    Sep 28, 2026Jia Song, Wenhow Li, Lichen Bai +2Video Diffusion ModelsMulti-Task Learning

  23. SkillPE: Creativity-Oriented Cinematic Skill Evolution for Text-to-Video Prompt Engineering

    Sep 28, 2026Yanwei Huang, Mingxuan Zhu, Shujie Li +3Text-to-Video GenerationVideo Generation

  24. MaLiang-Harness: A Programmable Path to Image and Video Generation

    Sep 28, 2026Haoyu Zhao, Zihao Zhang, Xudong Wang +4Image GenerationLarge Vision-Language Models