Action Prediction

Momentum

35 papers in the last four weeks, up 483% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 113

All topics
CardsList
  1. UniWAM: Unified World-Action Model

    Oct 1, 2026Jiayi Chen, Wenxuan Song, Jingbo Wang +13Action PredictionWorld Models

  2. ATI-VLA: Action-Centric Predictive Vision-Language-Action Models via Actionable Alignment Then Adaptive Injection

    Oct 1, 2026Yijie Zhu, Rui Shao, Jie He +8Diffusion-Based Vision-Language-ActionsAction Prediction

  3. CtrlWAM: Controllable World Action Models with Aligned Intent and Foresight

    Oct 1, 2026Chensheng Peng, Wenhao Ding, Ran Tian +9Efficient World-Action ModelFaster-Wam

  4. MotionWeave: Learning Motion-Centered Future Dynamics for Vision-Language-Action Policies

    Sep 30, 2026Jingqiu Wang, Yan WangAction PredictionWeave

  5. ReSAIL: Mitigating Collapse in Iterative Agent Self-Distillation

    Sep 30, 2026Shengjie Jin, Hengbo Xu, Zelong Sun +2Self-Improving AgentsRecursive Self-Improvement

  6. The Planning Limits of Latent World Models

    Sep 30, 2026Ali Alrasheed, Basim Azam, Naveed AkhtarLatent World ModelsWorld Models

  7. MVG-WAM: Multiple View Geometry-Aware World-Action Modeling for Robotic Manipulation

    Sep 29, 2026Wenbo Chen, Tianfu Li, Haoxuan Xu +9Efficient World-Action ModelRobotic Manipulation

  8. RawVLA: Embodied Neural Image Signal Processor For Robotic Manipulation

    Sep 29, 2026Shuhong Liu, Heng Zhou, Lingfeng Qian +7CameraAction Prediction

  9. SCA: Spatial Credit Assignment for Reinforcement Learning of GUI Agents

    Sep 29, 2026Shengtian Yang, Ziyu Xiong, Kaibing Yang +6Credit AssignmentGroup-Based Reinforcement Learning

  10. Where Predictive Supervision Goes Shapes What VLA Policies Learn

    Sep 29, 2026Hanseul Kim, Jewon Yeom, Youngjoon Jeong +2Generalizable Vision-Language-Action PoliciesAction Prediction

  11. RoboChrono: A Real Robot Benchmark for Streaming Task Understanding

    Sep 29, 2026Yuzhou Wu, Longteng Fan, Zimeng Li +22Robotic ManipulationRobot Systems

  12. Probe to Act: Elevating Browser-Use Agent via Active Visual Probing

    Sep 27, 2026Keliang Li, Heng Wang, Chen Hu +3Browser AgentProactive

  13. SLIP-VLA: Single-Step Latent Imagination for Policy Learning in Vision-Language-Action Models

    Sep 27, 2026Tianfu Li, Haoxuan Xu, Wenbo Chen +7Action PredictionImagination

  14. FRAM: Trajectory-Guided Visual Feature Selection for Compact Language-Conditioned Robot Manipulation

    Sep 25, 2026Hiroshi Ito, Hyogo Hiruma, Yoshiki Kanai +3Robotic ManipulationAction Prediction

  15. The Fellowship of the Query: Learning Retrieval Actions

    Sep 23, 2026Mohammed Al-Maamari, Saber Zerhoudi, Michael Granitzer +1Fine-Grained ActionsModel Fine-Tuning

  16. RoboMP-DINOv2: Prompts, Not Filters for Robust Robot Manipulation

    Sep 22, 2026Han Qi, Heng YangVisuomotor ControlRobot Systems

  17. GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies

    Sep 17, 2026Xin Chen, Sen Chen, Yujuan Ding +5Action ChunksFlow-Matching Vision-Language-Action

  18. TRACER: Adaptive Multi-Robot Social Navigation via Joint Human-Response Prediction and Interaction-Aware Replanning

    Sep 16, 2026Lan Hu, Minghui Liwang, Wenbo Zhu +4Robot NavigationAction Prediction

  19. VLA-ULAP: Interleaving Cloud VLA Calls with Ultra-Lightweight Local Action Prediction at the Edge

    Sep 16, 2026Deyu Cao, Ryuji Oi, Kosuke Matsushima +4Action PredictionRemote

  20. FIVE-VLA: Fast and EffectIVE Autonomous Driving with Recurrent Action Memory

    Sep 16, 2026Kemal Oksuz, Alexandru Buburuzan, Yuhan Yao +1Diffusion-Based Vision-Language-ActionsAutonomous Driving

  21. ForceDelta-VLA: Distilling Force-Conditioned ActionCorrections for Contact-Rich Manipulation

    Sep 16, 2026Ju Dong, Yu Fu, Jian Chen +9Contact-Rich ManipulationAction Prediction

  22. Language-Augmented Video Action Anticipation: Design Fundamentals, Benchmarks, and Open Challenges

    Sep 15, 2026Mahsa Mohammadi, Zeyu Fu, Sareh RowlandsAction PredictionChallenges

  23. Uncertainty-Guided Sparse Refinement for Action Chunking Transformer Policies

    Sep 14, 2026Chenyang Wang, Yuntian Wang, Xiaoxiong Yang +3Visuomotor PolicyAction Chunks

  24. StereoPatch: Patch-Aligned RGB-Depth Fusion for Spatial Perception in Robot Manipulation

    Sep 14, 2026Yanan Zhou, Zhaoyan Qian, James Zhao +1Robotic PerceptionVisuomotor Policy

  25. GRAVA: Grounded Reasoning-to-Action Representation and Learning for Autonomous Driving

    Sep 14, 2026Xiao Liu, Haoyu Li, Jianghao Leng +2Autonomous DrivingAction Prediction

  26. UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling

    Sep 11, 2026Wei Li, Rui Shao, Jie He +3Action PredictionVisual Memory

  27. Leveraging contextual events on structure-aware next activity prediction

    Sep 8, 2026Alessandro Mele, Claudia Diamantini, Domenico PotenaNext-State PredictionContext-Awareness

  28. Unified Vision-Centric Pedestrian Crossing Action Prediction via Adaptive Patch Projection and Proactive Spatial Rectification

    Sep 7, 2026Yao Tian, Le Yang, Binglu WangPedestrian Trajectory PredictionAction Prediction

  29. EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents

    Sep 1, 2026Wei Wang, Wenqiao Zhang, Yutong Lin +14Generalizable Vision-Language-Action PoliciesEmbodied Agents

  30. PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies

    Aug 31, 2026Botong Zhao, Fang Yu, Tim Yu +3Generalizable Vision-Language-Action PoliciesAction Prediction

  31. Diagnosing JEPA World Models with Action-Conditioned Predictive Consistency

    Aug 13, 2026Guo An, Zijing Wu, Honghua Dong +7Action PredictionWorld Models

  32. Foresight Without Seeing: Latent Futures for World Action Models

    Aug 12, 2026Jiakai Huang, Zhongbo Wu, Siyu Xu +5Action PredictionForesight

  33. How Can Driving World Models Do Counterfactual Prediction?

    Aug 12, 2026Jiaru Zhang, Can Cui, Yi Xu +3Counterfactual GenerationCounterfactuals

  34. SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

    Aug 11, 2026Zhou Liu, Ligang Huang, Zeli Su +5Multimodal AgentsAction Prediction

  35. SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models

    Aug 9, 2026Junjie He, Junfeng Li, Zhide Zhong +9Efficient World-Action ModelFaster-Wam

  36. SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

    Aug 7, 2026Zongchuang Zhao, Xin Zhou, Tianyang Xu +6Recent World-Action ModelsAutonomous Driving

  37. The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

    Aug 6, 2026Weiwei Li, Junzhuo Liu, Tong Chu +2Graphical User Interface AgentsHindsight

  38. Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

    Aug 6, 2026Haodong Yan, Junfeng Li, Junjie He +12Recent World-Action ModelsFaster-Wam

  39. World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

    Aug 5, 2026Yuhao Pan, Haosong Peng, Zhengshen Zhang +8Robotic ManipulationEfficient World-Action Model

  40. Overcoming Statistical Bias in Action-Controllable World Models

    Aug 5, 2026Yuhong Shi, Zhenhao Chu, Jie Wei +3Efficient World-Action ModelAction Prediction

  41. Faster-WAM: Do World Action Models Need Deep Action Modules?

    Aug 3, 2026Liheng Ma, Rui Heng Yang, Zhanguang Zhang +4Faster-WamAction Prediction

  42. Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving

    Jul 31, 2026Jiwei Yang, Zhengxian Chen, Chaosheng Huang +1Autonomous DrivingVideo Joint Embedding Predictive Architecture

  43. RoboBRIDGE: A Modular Framework for Bridging Policies to Robust Real-World Robotic Agents

    Jul 30, 2026Sihyung Yoon, Minjong Yoo, Sanghyun Ahn +2RobocasaAction Prediction

  44. FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking

    Jul 27, 2026Hai Jiang, Yixian Zou, Binbin Liang +3Action PredictionRobot Systems

  45. URF: A Unified Robot Control-Policy Framework for Stable Contact Aware Manipulation

    Jul 23, 2026Jiyou Shin, Youngjin Seo, Jaeseog Won +5Robotic Manipulation PoliciesImpedance Control

  46. SportD: How do VLMs physically strategize?

    Jul 16, 2026Jasin Cekinmez, Addison J. Wu, Haotian Xia +6Action Prediction

  47. Speculate with Memory: Lossless Acceleration for LLM Agents

    Jul 14, 2026Yu Li, Qinyuan Ye, Prafulla Kumar Choubey +2Self-SpeculativeLarge Language Model Agents

  48. Affordance-Based Manipulation Planning with Text Goals and Sim-to-Real Generalisation via Real-to-Sim Image Conversion

    Jul 13, 2026Solvi Arnold, Rin Karashima, Tadashi Adachi +2AffordancesRobot Systems

  49. Pelican-VLA 0.5: Attending Before Acting Benefits Generalization

    Jul 7, 2026Zeyuan Ding, Wenhai Liu, Yang Xu +6Action PredictionPhotometric Supervision

  50. From World Models to World Action Models: A Concise Tutorial for Robotics

    Jul 1, 2026Xiaoxiong Zhang, Xiong Zeng, Wei ZhangWorld ModelsAction Prediction

  51. Orca: The World is in Your Mind

    Jun 29, 2026Yihao Wang, Yuheng Ji, Mingyu Cao +54Latent World ModelsAction Prediction