cs.CVSep 28, 2026

WorldWeave: Growing Persistent Geometric Worlds for Video Generation

Authors: Yifan Huang, Lifan Jiang, Qingyue Hao, Cheng Chen, Boxi Wu, Xiaoxue Ren, Xiaofei He, Dehai Zhao

Organizations: Zhejiang University · Daerwen AI

Abstract

Despite rapid progress, world models still lack explicit, persistent structural memory, making it difficult to preserve consistent world structure during continual scene expansion and cross-view revisits. To address this limitation, we present WorldWeave, a world generation framework that decouples world-state maintenance from visual rendering. Specifically, WorldWeave combines continual elevation-map generation with agent-guided scene organization and stitching to build an expandable explicit 3D world that incrementally extends structural memory while preserving existing structure. First, its terrain module uses diffusion-based image outpainting to generate continuous metric elevation maps under neighborhood conditioning and boundary constraints. Next, an agent integrates user intent, terrain evidence, and cross-region connectivity constraints to construct scenes through hierarchical semantic planning, deterministic geometry compilation, and local revision. Finally, during visual generation, planned camera trajectories query world geometry through a read-only interface, producing depth sequences that guide video synthesis without writing the generated results back into the world state. As a result, structural memory remains independent of short-window video generation, enabling continual expansion without predefined map boundaries and providing a consistent geometric basis for observations across trajectories and repeated visits.

Figures & tables

Appendix figures & tables8 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

    Jul 2, 2026Hanlin Wang, Hao Ouyang, Qiuyu Wang +10Video World ModelsDramadirector

  2. OctWorld: Long-Range World-Consistent Video Generation with Octree-Based 3D Mapping

    Sep 3, 2026Zelong Lv, Sicheng Xu, Jianfeng Xiang +5Playable Video World GenerationLong Video Generation

  3. WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

    Sep 21, 2026Wangbo Yu, Kunhao Liu, Wenbo Hu +8Video World ModelsCraft