Video World Models

Momentum

42 papers in the last four weeks, up 320% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 183

All topics
CardsList
  1. World Models' Last Exam in Physics

    Oct 6, 2026Mingju Gao, Qingle Liu, Yuzhao Peng +8Video World ModelsLong-Video Benchmarks

  2. PlaySuite: A Large-Scale Benchmark for Interactive Visual Intelligence

    Oct 5, 2026Dheeraj Varghese, Anna Vettoruzzo, Walter Simoncini +5Evaluation BenchmarksVideo World Models

  3. HLA-WM: Hybrid Linear Attention for Long-Horizon Video World Models

    Oct 5, 2026Zhuokun Chen, Feng Chen, Xi Lin +4Video World ModelsLong-Horizon Inference

  4. 4Director: Controlling Video World Models with Rigid 3D Geometry

    Oct 1, 2026Wei Cao, Hao Zhang, Vikram Voleti +53D MotionVideo World Models

  5. Oneira: From Open-Ended Generation to Open-World Interaction in Video World Models

    Oct 1, 2026Xindi Yang, Baolu Li, Liam Lee +8Video World ModelsOpen-World

  6. AutoGUIWorld: Image Generators as Visual World Models for GUI Agent

    Oct 1, 2026Cheng Yang, Yifan Wu, Yutao Huang +18Visual GenerationAction Generation

  7. PhysicsLENS: Diagnosing Physical Property Blindness in Video Generation Models

    Oct 1, 2026Isaiah Milkey, Som Sagar, Aditya Taparia +3Physical PlausibilityGenerative Video Models

  8. Physis-Lang: Self-Evolving Language as a Physical Representation for Video World Model

    Sep 30, 2026Liming Lu, Xianzheng Ma, Wenkun He +14Video World ModelsGenerative Video Models

  9. LOCI: Spatial Linear Memory for Streaming World Models

    Sep 30, 2026Ji Xia, Tingting Liao, Xuezhi Liang +2Spatial MemoryRecurrent Model

  10. Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE

    Sep 29, 2026Yu Xu, Yuxin Zhang, Xiao Yang +7Video Diffusion ModelsLocalized Lora-Moe

  11. HelixWorld: A Real-time Interactive Audio-Visual World Model

    Sep 29, 2026Lei Ke, Jiahao Pan, Zeyue Tian +13Video World ModelsSpatial Audio

  12. Honeycomb: Constant-Size Scene Memory Representation for Video World Models

    Sep 29, 2026Jack Wei Lun Shi, Kaichen Zhou, Haoyu Chen +6Video World ModelsLong Videos

  13. Waypoint-1.5: A Real-Time Video World Model for Consumer Hardware

    Sep 29, 2026Rajit Rajpal, Shahbuland Matiana, Liew Wei Pyn +12Video World ModelsInteractive Video Generation

  14. World2Motion: Turning Video World Models into 3D Human Motion Generators

    Sep 29, 2026Fangyuan Tu, Xiangyue Zhang, Yiyi Cai +83D MotionVideo World Models

  15. MeteoVerse: Unified Weather-Controllable Video World Model

    Sep 29, 2026Renlong Wu, Guanqiao Wang, Xuan Shang +5Video World Models

  16. One from Infinity: Actualizing Futures from Pretrained World Models into Robot Actions

    Sep 29, 2026Bang Du, Yichen Xie, Shuqi Zhao +3Efficient World-Action ModelVideo World Models

  17. RoGSW4RLD: Feed-Forward 4D Gaussian Lifting for Robot World Model Rollouts

    Sep 28, 2026Jin Hyun Kim, Min Young Kim, Soohwan Song +14D ReconstructionFour-Dimensional

  18. OPIS: An Input-Grounded Benchmark for Multi-Object Memory in Video World Models

    Sep 28, 2026Hao Wang, Tao Yu, Liuzhou Zhang +13Video World ModelsMultimodal Memory

  19. WorldAttention: An Efficient Attention Architecture for Interactive Video World Models

    Sep 28, 2026Zeyu Zhang, Jinyuan Mao, Dakai An +6Video World ModelsDynamic Sparse Attention

  20. Precise Editing and Flexible Referencing for Interactable Worlds

    Sep 28, 2026Xinyao Liao, Xianfang Zeng, Zhu Liang +5Video World ModelsPrecise Editing

  21. Dexterous Tactile World Model

    Sep 28, 2026Ziyao Zeng, Xiatao Sun, Hao Wang +6Tactile World ModelContact-Rich Dexterous Manipulation

  22. CAST: Reconstruction-Coupled Acceleration of Interactive World Models

    Sep 28, 2026Leyang Chen, Junyi Wu, Fanqing Kong +2Video World ModelsWorld Models

  23. Underwater C3-JEPA: An Object-Centric Cross-View World Model for ROV Salvage

    Sep 24, 2026Yuncong Yang, Jinlong Li, Yulong Xue +4UnderwaterUnderwater Object Detection

  24. Training Object Permanence in World Models

    Sep 23, 2026Haotian Zhang, Fengyuan Yu, Dezhi Luo +28Video World ModelsWorld Models

  25. Prompt, Probe, Train, or Annotate? Single-camera sports video understanding in amateur settings

    Sep 23, 2026Sai Varun Kodathala, Prashanth Pollishetty, Jaylen CargillFine-Grained Video UnderstandingAthleticism

  26. GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay

    Sep 21, 2026Yiran Wang, Xingyilang Yin, Junfu Pu +12Agentic BenchmarksVideo World Models

  27. WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

    Sep 21, 2026Wangbo Yu, Kunhao Liu, Wenbo Hu +8Video World ModelsCraft

  28. NeuIDO: Neural Intrinsic Dynamics Operator for Physics-Informed 4D World Models

    Sep 21, 2026Jiajing Lin, Xin Zhang, Jianhua SunVideo World ModelsWorld

  29. HappyWorld-Bench

    Sep 21, 2026Zhiqi Bai, Junai Cai, Yixin Chen +33Video World Models

  30. Semantic SLAM in Precision Agriculture using Bayesian Inference

    Sep 17, 2026Ruben Beumer, Sander Doodeman, René van de Molengraft +1Simultaneous Localization And MappingAgricultural Robotics

  31. Astronex-World 1.0: Real-Time Interactive World Model Foundation

    Sep 17, 2026Xin Zhou, Cong MiaoVideo World ModelsAction Space

  32. Modality-Autoregressive World-Action Models

    Sep 15, 2026Adam Hung, Bardienus P. Duisterhof, Deva Ramanan +1Efficient World-Action ModelVideo World Models

  33. Does Video Memory Use What It Retrieves? A Causal Audit of Memory Specificity

    Sep 14, 2026Aditi Tiwari, Akshit Bhalla, Darshan Prasad +1Peak MemoryStreaming Video Understanding

  34. World in World: Explore the World with World Models

    Sep 11, 2026Chenxi Song, Yanming Yang, Chi ZhangVideo World ModelsAutoregressive Video Generation

  35. Programmable World Model

    Sep 9, 2026Zheng-Hui Huang, Guixu Lin, Jiacheng Lin +8Video World ModelsWorld Models

  36. Arti-JEPA: Adapting Video World Model to Real-Time MRI of the Vocal Tract for Speech-Production Analysis

    Sep 9, 2026Hong Nguyen, Sean Foley, Christina Hagedorn +4Vocal Tract ShapeSpeaker

  37. VeriScene: Reconstructing Crime Scenes from Legal Evidence via World-Model Agent

    Sep 8, 2026Kevin Chuanpu Fu, Yongsen Zheng, Zee Kin Yeong +1Video World ModelsViolence Detection

  38. WorldReward: Reward Modeling for Camera-Conditioned World Models

    Sep 3, 2026Yibin Wang, Zehan Wang, Junshu Tang +13Video World ModelsWorld Models

  39. H3-World: Turning Language Understanding into World Control

    Sep 1, 2026Danze Chen, Zeqing Wang, Ziyue Lin +2Video World ModelsHuman Motion Generation

  40. Can Video World Models Track Unobserved World States?

    Aug 31, 2026Joonghyuk Shin, Yicong Hong, Jaesik Park +1Video World ModelsHidden States

  41. PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

    Aug 13, 2026Kaixin Ding, Xi Chen, Minghong Cai +9Video World ModelsWorld Models

  42. Sekai2: From World Exploration to Interactive World Modeling

    Aug 10, 2026Kang He, Wenshuo Peng, Zihui Gao +3Video World ModelsVideo Dataset

  43. Distilling Physical Priors into Streaming World Models

    Aug 8, 2026Liangliang Zhao, Junying Wang, Danni Yang +5Video World ModelsWorld Models

  44. Addressable Memory for Video World Models

    Aug 7, 2026Xindi Wu, Sven Elflein, James Lucas +5Visual MemoryVideo World Models

  45. Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

    Aug 7, 2026Rulin Zhou, Wanhao Liu, Guoheng Ma +8Surgical VideosVideo World Models

  46. GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions

    Aug 6, 2026Chenghao Gu, Hanyang Yu, Jingbo Zhang +7Efficient World-Action ModelVideo World Models