Video Prediction

Momentum

6 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 45

All topics
CardsList
  1. Video Prediction Policy 2: Predict Better, Act Better

    Oct 7, 2026Yanjiang Guo, Haodong Yan, Zhide Zhong +15Visuomotor Policy LearningWorld Action Models

  2. VepAgent: Bridging Causal-Transition via Tool-Augmented Reinforcement Learning for Video Event Prediction

    Oct 5, 2026Qiutong Chen, Yuchan Guo, Zhenlong Yuan +10Video PredictionCausal Reasoning in Videos

  3. Learning Conditional Source Distribution via Flow Reversal for Temporal Flow Matching

    Oct 4, 2026Kuan-Hsun Tu, Hsuan-Chi Liu, Jia-Wei Liao +3Flow MatchingVideo Prediction

  4. Latent-Foresight: End-to-End Learning Predictable Representations for Latent World Models

    Oct 1, 2026Efstathios Karypidis, Spyros Gidaris, Nikos KomodakisVideo PredictionPredictive Representation Learning

  5. MinkowskiPE: Minkowski Positional Encoding for Spatiotemporal Perception

    Sep 27, 2026Yuhao Li, Louie Hong Yao, Tianyi Shi +4Spatiotemporal ReasoningPositional Encoding

  6. CausalWM: Causal Chain-of-Thought Reasoning for Embodied World Model

    Sep 19, 2026Ziming Xu, Shuang Liang, Ruobing Han +10Causal World ModelsAction-Conditioned World Models

  7. Not Another Text Benchmark: Putting the "Visual" Back in Visual Question Answering for Large Video Models

    Sep 15, 2026Rwiddhi Chakraborty, Yinong, Wang +7Video-Language Model EvaluationVideo QA

  8. Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation

    Sep 3, 2026Yingmao Miao, Pengfei Zhang, Chaoran Xu +5Long Video GenerationVideo Generation

  9. GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction

    Aug 10, 2026Khang Minh Le, Hieu Dinh Trung Pham, Luu Thanh Danh +8Video Diffusion ModelsAutonomous Driving

  10. HERA: Historical Evidence Routing Adapter for Physical Prediction in Latent World Models

    Aug 6, 2026Yuanruyi, Yue Cao, Haojia Gao +7Video PredictionLatent World Models

  11. DynaPix: Can Vision-Language Models Identify the Exact Future?

    Aug 6, 2026Thong Nguyen, Vinh-Hien Do, Quynh Vo +2VLM EvaluationVision-Language Models

  12. Overcoming Statistical Bias in Action-Controllable World Models

    Aug 5, 2026Yuhong Shi, Zhenhao Chu, Jie Wei +3World ModelsAction-Conditioned World Models

  13. Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

    Aug 5, 2026Quynh Vo, Thong Nguyen, Vinh-Hien Do +2Cross-Modal RetrievalVideo Prediction

  14. CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction

    Aug 4, 2026Wanhao Liu, Jinsong Lin, Rulin Zhou +11Multi-View Video GenerationMulti-View Learning

  15. SUV: Future Scene Understanding as Video Generation for End-to-End Driving

    Aug 4, 2026Yibo Yuan, Jiacheng Fu, Jiangtong Zhu +8End-to-End Autonomous DrivingAutonomous Driving Perception

  16. ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

    Jul 30, 2026Dongxiu Liu, Haoyi Niu, Peng Cheng +5Robotic ControlLatent Dynamics Modeling

  17. Self Gradient Forcing: Native Long Video Extrapolation

    Jul 22, 2026Junhao Zhuang, Shiyi Zhang, Yuxuan Bian +11Video Diffusion ModelsAutoregressive Diffusion

  18. LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

    Jul 9, 2026Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang +4Event-Based VisionVideo Diffusion Models

  19. Prompt-Adapter Context Routing for Parameter-Efficient Multi-Shot Long Video Extrapolation

    Jul 7, 2026Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo +4Video Diffusion ModelsVideo Prediction

  20. SUNTA: Hierarchical Video Prediction with Surprise-based Chunking

    Jul 2, 2026Tomoshi Iiyama, Masahiro Suzuki, Yutaka MatsuoVideo PredictionState Space Models

  21. Learning Video Dynamics with Predictive Differentiable Rendering

    Jun 30, 2026Yujin Tang, Tian Zhou, Xin Lin +5Differentiable RenderingVideo Prediction

  22. Prediction of Viscoelastic Droplet Impact Dynamics Using a Vision Transformer-Based Approach

    Jun 22, 2026Diego A. de Aguiar, Cassio M. OishiPDE Surrogate ModelingVideo Prediction

  23. SurgVista: Long-Horizon Surgical World Modeling with Plausible Instrument-Tissue Dynamics

    Jun 18, 2026Wentao Pan, Wuyang Li, Shengyuan Liu +3World ModelsVideo Prediction

  24. Video-Based Prediction of In-Flight Particle Characteristics in Atmospheric Plasma Spraying

    Jun 5, 2026Abhijeet Praveen, Sareh Soleimani, Cormac Cureton +4Materials ScienceVideo Prediction

  25. Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction

    Jun 4, 2026Tianxiang Jiang, Linquan Wu, Sheng Xia +5Large Vision-Language ModelsLatent Visual Reasoning

  26. Reinforcement Learning from Cross-domain Videos with Video Prediction Model

    Jun 2, 2026Zhao Yang, Xinrui Zu, Jacob E. Kooi +5RL for RoboticsImitation Learning

  27. ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation

    May 26, 2026Akide Liu, Jinbo Xing, Chaojie Mao +8Long Video GenerationVideo Prediction

  28. CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models

    May 22, 2026León Begiristain, Olaf Dünkel, Adam KortylewskiCounterfactual EvaluationPhysical Consistency in Video Generation

  29. Nano World Models: A Minimalist Implementation of Future Video Prediction

    May 17, 2026Siqiao Huang, Partha Kaushik, Michael Chen +5Action-Conditioned Video GenerationLong-Horizon Video Generation

  30. Identifiable Token Correspondence for World Models

    May 15, 2026Youngin Kim, Ray Sun, Inho Kim +2World Model LearningTransformer-Based RL

  31. Latent Video Prediction for World Modeling: An Evaluation Uncovering Intriguing Favorable Evidence

    May 15, 2026Ali J Alrasheed, Aryan Yazdan Parast, Basim Azam +2Video Representation LearningVideo Prediction

  32. CausalGS: Learning Physical Causality of 3D Dynamic Scenes with Gaussian Representations

    May 11, 2026Nengbo Lu, Minghua PanDynamic Scene ReconstructionVideo Prediction

  33. VeloGauss: Learning Physically Consistent Gaussian Velocity Fields from Videos

    May 11, 2026Nengbo Lu, Bin Zhao3D Gaussian SplattingDynamic Scene Reconstruction

  34. Towards Generative Predictive Display for Vision-Based Teleoperation: A Zero-Shot Benchmark of Off-the-Shelf Video Models

    May 10, 2026Aws Khalil, Jaerock KwonVideo Diffusion ModelsRobot Teleoperation

  35. CNN-based Multi-In-Multi-Out Model for Efficient Spatiotemporal Prediction

    May 2, 2026Hyeonseok JinEfficient Neural Network InferencePrecipitation Forecasting

  36. FlowC2S: Flowing from Current to Succeeding Frames for Fast and Memory-Efficient Video Continuation

    Apr 19, 2026Hovhannes Margaryan, Quentin Bammey, Christian SandorFlow MatchingText-to-Video Generation

  37. UniE2F: A Unified Diffusion Framework for Event-to-Frame Reconstruction with Video Foundation Models

    Feb 22, 2026Gang Xu, Zhiyu Zhu, Junhui HouEvent-Based VisionVideo Prediction

  38. UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

    Jan 7, 2026Zhexiao Xiong, Xin Ye, Burhan Yaman +5Vision-Language ModelsWorld Model Learning

  39. Event-based Scene Synthesis via Inter-Frame Residual Alignment

    Dec 19, 2025Jiyun Kong, Jun-Hyuk Kim, Jong-Seok LeeEvent-Based VisionVideo Prediction

  40. Auto-Regressive Models Need Structural Registers: Semantic Foresight Improves Coherent Driving Video Continuation

    Dec 4, 2024Ruibo Ming, Jingwei Wu, Zhewei Huang +4Video PredictionAutoregressive Video Generation