World Model Evaluation

Momentum

29 papers in the last four weeks, up 123% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 146

All topics
CardsList
  1. AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

    Jul 20, 2026Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva +2World Model LearningAI Agent Benchmarks

  2. Thinking in Video: Can Video Generators Really Reason About the Real World?

    Jul 20, 2026Yongheng Zhang, Guang Yang, Ruihan Hou +12Video ReasoningCausal Reasoning in Videos

  3. Towards Spatial Supersensing in the Wild

    Jul 15, 2026Tianjun Gu, Tianyu Xin, Kuan Zhang +12Long-Video UnderstandingWorld Model Evaluation

  4. A Control Theory of Predictability in Latent World Models

    Jul 11, 2026Hanzhe You, Yonggang Zhang, Maohao Ran +6Model Predictive ControlLatent World Models

  5. Validate the Dream Before You Trust Its Verdict: Admissibility for World-Model Simulators

    Jul 8, 2026Christian Oefinger, Finn Rasmus Schäfer, Korbinian Moller +2World Models for Autonomous DrivingWorld Model Evaluation

  6. Grounding Spatial Relations in a Compact World Model: Instruction Leakage and a Goal-Free Dynamics Fix

    Jul 8, 2026Yufeng Wang, Lu Wei, Haibin LingWorld Model LearningVisual Grounding

  7. Imagined Rollouts are Kinematic, Not Dynamic: A Diagnosis of Long-Horizon World-Model Failure

    Jul 7, 2026Finn Rasmus Schäfer, Korbinian Moller, Yuan Gao +3World ModelsWorld Model Evaluation

  8. Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

    Jul 6, 2026Hongyu Li, Wanjia Fu, Xiaoyan Cong +11World ModelsDeformable Object Manipulation

  9. Multiplayer Interactive World Models with Representation Autoencoders

    Jul 6, 2026Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary +24Action-Conditioned World ModelsLatent World Models

  10. MoP-JEPA: Hard-Assigned Predictor Mixtures for Stochastic JEPA World Models

    Jul 6, 2026Zhi Song, Ximing Xing, Zhenchao Tang +8World Model LearningLatent Dynamics Modeling

  11. GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

    Jul 2, 2026GigaWorld Team, Angyuan Ma, Boyuan Wang +24Robot Foundation ModelsAction-Conditioned World Models

  12. WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

    Jun 30, 2026Ting-Bing Xu, Jiacheng Sui, Zhe Gao +12World Model EvaluationInteractive World Models

  13. World-Model Collapse as a Phase Transition

    Jun 30, 2026Xinyuan Song, Zekun CaiPhase TransitionsModel Collapse

  14. A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models

    Jun 27, 2026Nuo Chen, Lulin Liu, Zihao Li +12Physical Consistency in Video GenerationAutonomous Driving Safety Evaluation

  15. Event-Conditioned Diagnostics of Kinematic, Contact, and Object-Permanence Fields in Passive Object-State World Models

    Jun 26, 2026Yang Liu, Yuming ChenLatent Dynamics ModelingLatent World Models

  16. Understanding Rollout Error in Graph World Models

    Jun 26, 2026Xinyuan Song, Zekun CaiWorld Model LearningWorld Models

  17. MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

    Jun 25, 2026Haoyu Chen, Kaichen Zhou, Hang Hua +11Physical Consistency in Video GenerationWorld Model Evaluation

  18. World Models in Pieces: Structural Certification for General Agents

    Jun 23, 2026Yikai Lu, Yifei Wu, Xinyu Lu +1Long-Horizon Agent EvaluationModel-Based Planning

  19. Qwen-AgentWorld: Language World Models for General Agents

    Jun 23, 2026Yuxin Zuo, Zikai Xiao, Li Sheng +30LLM World ModelsAgentic RL

  20. Trimming the Long-Tail of Visual World Modeling Evaluation

    Jun 23, 2026Bingxuan Li, Yining Hong, Cheng Qian +6Neural Network GeneralizationPhysical Consistency in Video Generation

  21. Conformal Orbit-Valid Trust Horizons for Equivariant World Models

    Jun 23, 2026Hongbo WangEquivariant Neural NetworksConformal Prediction

  22. RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis

    Jun 22, 2026Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen +10VLM EvaluationRobot Manipulation Benchmarks