Action-Conditioned Video Generation

Latest papers 72

All topics
CardsList
  1. Beyond Masks and Trajectories: Flow-Guided Latent Action Injection for Stable Surgical Video Generation

    Oct 7, 2026Tsz-Yui Qin, Siyu Zhou, Chi-Keung Tang +2Video GenerationAction-Conditioned Video Generation

  2. UltraWorld: Learning Interactive Ultrasound World Models from Untracked Clinical Videos with Acoustic Sampling Map

    Oct 7, 2026Keke Yang, Erqi Wang, Sainan Guan +1Interactive World ModelsWorld Models for Robotics

  3. KineWorld: Action-Induced Transport Fields for Embodied World Modeling

    Oct 5, 2026Ziying Song, Yuchen Liu, Zhuoran Xu +6Action-Conditioned Video GenerationVideo Diffusion Models

  4. Dream4ACT: A Shared Visual Action Interface for Multi-Embodiment Video-Action Modeling

    Sep 30, 2026Xiangyu Zhu, Jin Xu, Yue Guo +6Action-Conditioned Video GenerationCross-Embodiment Robot Learning

  5. BadAction: Backdoor Attacks on Interactive Video Generation via Action-Guided Triggers

    Sep 30, 2026Zhihang Wu, Zhongqi Wang, Jie Zhang +3Action-Conditioned Video GenerationBackdoor Attacks

  6. WorldLine: Action-Driven Visual Simulation for Robotic Manipulation

    Sep 29, 2026Shenghe Zheng, Wenbo Li, Jiyao Zhang +4Action-Conditioned Video GenerationWorld Models for Robotics

  7. ReSync: Re-Aligning the Two Clocks of Asynchronous World-Action Models

    Sep 27, 2026Xi Lin, Feihong Zhang, Yulong Shi +6Action-Conditioned Video GenerationVideo Diffusion Models

  8. Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

    Sep 14, 2026Hoeun Lee, Jaeik Kim, Jusang Oh +4Robotic ControlAction-Conditioned Video Generation

  9. Building Pretraining Data for World Models: An Unreal Engine-Based Pipeline for Action-Conditioned Video Generation

    Sep 3, 2026Haoyu Wang, Songchun Zhang, Haoran Li +3Action-Conditioned Video GenerationMulti-View Video Generation

  10. H3-World: Turning Language Understanding into World Control

    Sep 1, 2026Danze Chen, Zeqing Wang, Ziyue Lin +2Action-Conditioned Video GenerationCamera-Controlled Video Generation

  11. CAER: Causal Action Effect Reweighting for World Model Training

    Aug 31, 2026Jianjie Fang, Xvyuan Liu, Ziyou Wang +9Action-Conditioned Video GenerationWorld Model Learning

  12. PhiZero: A World Model Built Around Physical Language

    Jul 30, 2026Shuyao Shang, Yuqi Wang, Ruopeng Gao +4Action-Conditioned Video GenerationPhysical Consistency in Video Generation

  13. EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE

    Jul 30, 2026Zexuan Yan, Yuzhou Wu, Yue Ma +9Action-Conditioned Video GenerationMemory-Augmented Video Generation

  14. Masked Visual Actions for Unified World Modeling

    Jul 21, 2026Hadi Alzayer, Wenlong Huang, Haonan Chen +8Action-Conditioned Video GenerationRobotic Manipulation

  15. Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation

    Jul 20, 2026Zhenjie Liu, Binyan Chen, Hao Chen +2Action-Conditioned Video GenerationText-to-Video Generation

  16. FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

    Jul 14, 2026Yixiang Chen, Peiyan Li, Yuan Xu +13Action-Conditioned Video GenerationVideo Diffusion Models

  17. RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

    Jul 7, 2026Haoyu Zhao, Xingyue Zhao, Hangyu Li +6Action-Conditioned Video GenerationWorld Models for Robotics

  18. UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

    Jul 6, 2026Mengmeng Liu, Diankun Zhang, Jiuming Liu +7Action-Conditioned Video GenerationVideo Diffusion Models

  19. MemLearner: Learning to Query Context memory for Video World Models

    Jun 30, 2026Jiwen Yu, Jianxiong Gao, Jianhong Bai +7Action-Conditioned Video GenerationLong-Horizon Video Generation

  20. Learning Transferable Dynamics Priors from Action to World Modeling

    Jun 28, 2026Ze Huang, Jiahui Zhang, Hairuo Liu +3Action-Conditioned Video GenerationRobot Policy Learning

  21. ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models

    Jun 27, 2026Longyu Chen, Heng Li, Wei Yang +2Action-Conditioned Video GenerationWorld Models for Robotics

  22. Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model

    Jun 25, 2026Zizhao Yuan, Zhengtu Liang, Taowen Wang +7Action-Conditioned Video GenerationDexterous Manipulation

  23. IOI: Decoupling Kinematics and Physics for Interactive World Models

    Jun 22, 2026Chengyu Bai, Peidong Jia, Tiecheng Guo +11Action-Conditioned Video GenerationWorld Models for Robotics

  24. World Action Models: A Survey

    Jun 18, 2026Qiuhong Shen, Shihua Zhang, Yue Liao +5Action-Conditioned Video GenerationAction-Conditioned World Models

  25. SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

    Jun 17, 2026Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong +9Action-Conditioned Video GenerationPhysical Consistency in Video Generation

  26. CausalDrive: Real-time Causal World Models for Autonomous Driving

    Jun 13, 2026Tianyi Yan, Huan Zheng, Dubing Chen +10Action-Conditioned Video GenerationAutonomous Driving

  27. Diffusion Transformer World-Action Model for AV Scene Prediction

    Jun 11, 2026Ruslan Sharifullin, Benjamin Jiang, Kai Xi ChewAction-Conditioned Video GenerationDiffusion Transformer

  28. BiWM: Advancing Open-Source Interactive Video World Models with Bidirectional Autoregression

    Jun 8, 2026Shaohao Rui, Xiaofeng Mao, Zhanyu Zhang +5Action-Conditioned Video GenerationCamera-Controlled Video Generation

  29. Echo-Memory: A Controlled Study of Memory in Action World Models

    Jun 8, 2026Wayne King, Zeyue Xue, Yuxuan Bian +13Action-Conditioned Video GenerationVideo Diffusion Models

  30. Unified Video-Action Joint Denoising for Dexterous Action and Data Generation

    Jun 2, 2026Dingrui Wang, YuAn Wang, Jinkun Liu +4Action-Conditioned Video GenerationVideo Diffusion Models

  31. Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization

    Jun 1, 2026Jingyun Liang, Min Wei, Shikai Li +5Action-Conditioned Video GenerationVideo Diffusion Models

  32. PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion

    May 31, 2026Heyuan Gao, Bangxun Tang, Yiren Song +4Action-Conditioned Video GenerationVideo Diffusion Models

  33. Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends

    May 31, 2026Jiuming Liu, Chaojun Ni, Mengmeng Liu +7Action-Conditioned Video GenerationLong-Horizon Video Generation

  34. τ0τ_0-WM: A Unified Video-Action World Model for Robotic Manipulation

    May 31, 2026Pengfei Zhou, Shengcong Chen, Di Chen +17Action-Conditioned Video GenerationLong-Horizon Robotic Manipulation

  35. Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation

    May 29, 2026Hanlin Chen, Jiaxin Wei, Xibin Song +5Action-Conditioned Video GenerationLong-Horizon Video Generation

  36. SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models

    May 22, 2026Zizhao Tong, Yeying Jin, Hongfeng Lai +11Action-Conditioned Video GenerationVideo Diffusion Models

  37. Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls

    May 19, 2026Abdul Mohaimen Al Radi, Kunyang Li, Yuzhang Shang +2Action-Conditioned Video GenerationAerial Robotics

  38. Nano World Models: A Minimalist Implementation of Future Video Prediction

    May 17, 2026Siqiao Huang, Partha Kaushik, Michael Chen +5Action-Conditioned Video GenerationLong-Horizon Video Generation

  39. DiLA: Disentangled Latent Action World Models

    May 15, 2026Tianqiu Zhang, Muyang Lyu, Yufan Zhang +2Action-Conditioned Video GenerationLatent Action Learning