cs.CVSep 27, 2026

FloodDiffusion 2: Efficient and Path Controllable Streaming Motion Generation

Authors: Yiyi Cai, Yuhan Wu, Kunhang Li, Tu Fangyuan, Xiangyue Zhang, Qiaoge Li, Zhixiang Wang, Kaipeng Zhang, +1 more

Organizations: Alaya Lab · The University of Tokyo · Japan Advanced Institute of Science and Technology · China Mobile Communications Company Limited Research Institute

Abstract

We present FloodDiffusion 2 (FD2), an efficient and controllable framework that builds upon FloodDiffusion (FD1), a state-of-the-art streaming motion generation model. While FD1 produces plausible motion, it suffers from low efficiency and limited controllability, as its attention design requires repeated computation over the entire history, and it lacks precise trajectory control for real-world applications. To address these limitations and improve generation quality, FD2 introduces three advances. First, Partial Attention makes finalized history representations independent of the active window, enabling KV-cached inference and shared-history packing for efficient training. Second, we establish a necessary-and-sufficient Bregman criterion for regression losses to preserve diffusion's conditional-mean velocity field. This criterion guides an FK-induced quadratic loss that incorporates motion geometry without online FK evaluation. Third, FD2 introduces precise path conditioning to control the character's root trajectory while preserving natural body motion. Experiments show that FD2 reduces training computation by 4.6×\times and accelerates denoising by 11.29×\times, reaching 2.303 ms per update on long sequences. Alongside these efficiency gains, FD2 improves motion quality over FD1 and achieves state-of-the-art FID scores among streaming methods, with 0.048 on SEED and 0.053 on HumanML3D.

Figures & tables

Appendix figures & tables7 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Triangular Resampling for Long-Horizon Motion Generation

    Sep 28, 2026Kunhang Li, Yiyi Cai, Xiangyue Zhang +5Denoising TrajectoryDiffusion Models

  2. Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

    Aug 11, 2026Yueting Zhu, Yuehao Song, Kaicheng Zhang +5Video Diffusion ModelsVideo Generation

  3. Reconstruction-Anchored Diffusion Model for Text-to-Motion Generation

    Jan 21, 2026Yifei Liu, Changxing Ding, Ling Guo +2Text-To-Motion GenerationText-To-Video Diffusion Models