Action Generation

Momentum

14 papers in the last four weeks, up 180% on the four weeks before. 0.2% of all new papers.

Jul 6Week of Sep 21

Latest papers 112

All topics
CardsList
  1. Ghost Attractor Networks: Basin-Structured Dynamical Decoders for Closed-Loop Sequential Generation

    Jun 16, 2026Tianyu Wang, Ying Wang, Zhihao Liu +2AttractorsLatent Variable

  2. Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies

    Jun 16, 2026Meipo Dai, Qiyuan Zhuang, He-Yang Xu +4Robot PoliciesAction Generation

  3. PATCH: Action-Chunk-Conditioned Latent Patch Innovation Monitoring for Robot Manipulation

    Jun 15, 2026Yanan Zhou, Ranpeng Qiu, Yincong Chen +2Robotic ManipulationRobot Systems

  4. ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation

    Jun 12, 2026Yanzhao Guo, Wenkai Chen, Jianwei ZhangDiffusion-Based Vision-Language-ActionsAction Generation

  5. Self-Improving VLA Policies: Selected Diffusion Noise for Spurious-Robust Action Smoothing

    Jun 12, 2026Duc Minh Nguyen, Bao-Ngoc Dao, Tung M. Luu +15Generalizable Vision-Language-Action PoliciesDiffusion-Based Vision-Language-Actions

  6. GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation

    Jun 11, 2026Xiangyu Zhu, Renjun Wu, Luzhou Ge +2Action GenerationGeogs-Slam

  7. DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model

    Jun 10, 2026Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga +4Diffusion-Based Vision-Language-ActionsAction Generation

  8. Dynamic Execution Horizon Prediction for Chunk-based Robot Policies

    Jun 9, 2026Yuchi Zhao, Miroslav Bogdanovic, Arjun Sohal +5Action ChunksLong-Horizon Manipulation

  9. Test-time Adversarial Takeover: A Real-time Hijacking Interface against Robotic Diffusion Policies

    Jun 9, 2026Zi Yin, Peilin Chai, Siyuan Huang +1Diffusion PoliciesVisuomotor Policy

  10. ActProbe: Action-Space Probe for Early Failure Detection of Generative Robot Policies

    Jun 7, 2026Bingjia Huang, Xiangyu Li, Xiang Wang +7Robot PoliciesAction Generation

  11. Light-WAM: Efficient World Action Models with State-Fusion Action Decoding

    Jun 6, 2026Ziang Li, Dongzhou Cheng, Yibin Wang +5Efficient World-Action ModelAction Prediction

  12. AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding

    Jun 4, 2026Qize Yu, Jiadi You, Yuran Wang +10Robotic ManipulationAffordances

  13. Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models

    Jun 4, 2026Yitong Chen, Shiduo Zhang, Jingjing Gong +1Action GenerationNoise-Aware

  14. WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation

    Jun 3, 2026Ning Yang, Yan Huang, Kaiwen Peng +9Object Goal NavigationEfficient World-Action Model

  15. Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry

    May 31, 2026Zemin Yang, Yaoyu He, Yiming Zhong +5Temporally Coherent Imitation LearningImitation Learning

  16. Continuous Reasoning for Vision-Language-Action

    May 29, 2026Yueh-Hua Wu, Tatsuya Matsushima, Kei OtaAction GenerationReasoning Skills

  17. Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely

    May 29, 2026Chalamalasetti Kranti, Sherzod Hakimov, David SchlangenSpatial ReasoningAction Generation

  18. GPS-Enhanced Tourist Mobility Modeling with Seasonal Spatial Priors and LLM-Based Activity Chain Generation

    May 28, 2026Yifan Liu, Yanling Sang, Xishun Liao +6MobilityUrban Mobility

  19. ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

    May 28, 2026Ye Li, Huanan Liu, Kangye Ji +7Diffusion-Based Vision-Language-ActionsAction Generation

  20. Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

    May 27, 2026Fangfu Liu, Kai He, Tianchang Shen +7Video World ModelsWorld Models

  21. SANTS: A State-Adaptive Scheduler for World Action Models

    May 27, 2026Yirui Sun, Guangyu Zhuge, Keliang Liu +4Action GenerationWorld Models

  22. Frequency-Guided Action Diffusion via Sub-Frequency Manifold Traversal

    May 27, 2026Junlin WangDiffusion PoliciesVisuomotor Policy

  23. Jointly Learning Predicates and Actions Enables Zero-Shot Skill Composition

    May 20, 2026Benedict Quartey, Sebastian Castro, Eric Rosen +3Visuomotor PolicyAction Generation

  24. Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning

    May 19, 2026Dongjie Yu, Kun Lei, Zhennan Jiang +2Robot PoliciesTemporally Coherent Imitation Learning

  25. SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation

    May 17, 2026Jingzhi Huang, Junkai Huang, Wenxuan Song +4Vision-Language NavigationMultimodal Large Language Models

  26. FLASH: Efficient Visuomotor Policy via Sparse Sampling

    May 15, 2026Jiaqi Bai, Jindou Jia, Yuxuan Hu +5Visuomotor PolicyAction Generation

  27. Test-time Sparsity for Extreme Fast Action Diffusion

    May 13, 2026Kangye Ji, Yuan Meng, Jianbo Zhou +3Diffusion TransformersDiffusion Policies

  28. World Action Models: The Next Frontier in Embodied AI

    May 12, 2026Siyin Wang, Junhao Shi, Zhaoyang Fu +11Recent World-Action ModelsWorld Models

  29. HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models

    May 11, 2026Qiuxuan Feng, Jiale Yu, Jiaming Liu +8Efficient World-Action ModelWorld Models

  30. CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving

    May 11, 2026Minqing Huang, Yujiao Xiang, Zihan Liang +7Autonomous DrivingAction Generation

  31. Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs

    May 11, 2026Jianchao Zhao, Huoren Yang, Yusong Hu +6Vision-Language-Action FrameworkAction Generation

  32. Geometry Guided Self-Consistency for Physical AI

    May 9, 2026Yinwei Dai, Zhuofu Chen, Lijie Yang +1Action GenerationDiffusion Policies

  33. Failing Forward: Adaptive Failure-Informed Learning for Vision-Language-Action Models

    May 8, 2026Meng Zheng, Samhita Marri, Anwesa Choudhuri +6Action GenerationNegative Results

  34. iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework

    May 5, 2026Jianjie Fang, Yingshan Lei, Qin Wan +8Video World ModelsWorld Models

  35. Action Agent: Agentic Video Generation Meets Flow-Constrained Diffusion

    May 2, 2026Jeffrin Sam, Nguyen Khang, Yara Mahmoud +2Action GenerationVideo Agent

  36. Recovering Hidden Reward in Diffusion-Based Policies

    May 1, 2026Yanbiao Ji, Qiuchang Li, Yuting Hu +7Diffusion PoliciesOffline Reinforcement Learning

  37. CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies

    Apr 27, 2026Fan Du, Feng Yan, Jianxiong Wu +8Action Generation

  38. CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors

    Apr 23, 2026Dachong Li, ZhuangZhuang Chen, Jin Zhang +1Action GenerationSparse Spatial Anchors

  39. ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures

    Apr 23, 2026Xiyin Zeng, Yuyu Sun, Haoyang Li +2Action PredictionAction Generation

  40. Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks

    Apr 22, 2026Xiyang Wu, Zongxia Li, Guangyao Shi +5Agent Skill RetrievalLarge Language Model Decisions

  41. InCoM: Intent-Driven Perception and Structured Coordination for Mobile Manipulation

    Feb 26, 2026Jiahao Liu, Cui Wenbo, Zhongpu Xia +3Real-World Manipulation TasksLatent Motion

  42. Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos

    Dec 1, 2025Xavier Thomas, Youngsun Lim, Ananya Srinivasan +2Human Motion GenerationHuman Motion

  43. StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

    Jul 7, 2025Meng Wei, Chenyang Wan, Xiqian Yu +9Vision-Language NavigationStreaming

  44. 3D-MoE: Towards Spatial Intelligence with Mixture-of-Experts for 3D Reasoning and Action Generation

    Jan 28, 2025Yueen Ma, Zenglin Xu, Irwin KingDiffusion-Based Vision-Language-ActionsAction Generation

  45. AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models

    Date pendingSunghwan Han, Youngtae Han, Youngmin YiFlow-Matching Vision-Language-ActionAction Generation