Action Generation

Momentum

14 papers in the last four weeks, up 180% on the four weeks before. 0.2% of all new papers.

Jul 6Week of Sep 21

Latest papers 112

All topics
CardsList
  1. Selection-Based Structured Reasoning: Toward Efficient Multimodal Search Agents

    Oct 1, 2026Feiyu Gavin Zhu, Xiaoyu Zhu, Jiqi Yang +9Multimodal Search AgentsMultimodal Agents

  2. AutoGUIWorld: Image Generators as Visual World Models for GUI Agent

    Oct 1, 2026Cheng Yang, Yifan Wu, Yutao Huang +18Visual GenerationAction Generation

  3. Kinematic MeanFlow: One-Step Action Generation Policy for Robotic Foundation Models

    Oct 1, 2026Jiawei Fan, Sifeng Wang, Yuqing Hou +1MeanflowMultimodal Action Distributions

  4. ActionGuard: Tool Call Authorization under Poisoned Skills

    Sep 30, 2026Jihun Han, Yejin Jang, Byung Il Kwak +1Tool InvocationAuthorization

  5. Direct Experience World-Model Optimization: Learning the World Beyond Action Imitation

    Sep 29, 2026Xiangcheng Zhan, Zirui Chen, Yicheng Zhao +2Efficient World-Action ModelWorld Models

  6. V-JEPA Policy: Building Effective World-Action Models on Predictive Visual Latents

    Sep 29, 2026Yang Zhang, Jiangyuan Zhao, Chenyou Fan +4Video Joint Embedding Predictive ArchitectureRecent World-Action Models

  7. Reactive Real-Time Flow Policies via Asynchronous Distribution Alignment

    Sep 29, 2026Moritz Zoellner, Reece O'Mahoney, Ioannis Havoutis +1Asynchronous ExecutionRobot Policies

  8. Staircase Policy: Streaming Inference for World-Action Models with Large Action Chunks

    Sep 29, 2026Guoheng Sun, Chen Chen, Jin Wang +2Efficient World-Action ModelAction Chunks

  9. QAMM: Adjoint MeanFlow Matching for Few-Step Offline Reinforcement Learning

    Sep 28, 2026Yuehu Gong, Shutong Ding, Mokai Pan +4Flow PoliciesMeanflow

  10. Beyond End-to-End Black Box Mapping: An Intentional Agent Framework for Cognitive-driven Facial Reaction Generation

    Sep 28, 2026Hanzhong Zhang, Jindong Wang, Siyang SongFacial Expression RecognitionAgentic Framework

  11. RAVEL: Asynchronous Rolling Inference for Flow-Based Vision-Language-Action Models

    Sep 28, 2026Yuhan Chen, Ke Yu, Pengfei Liu +3Flow-Matching Vision-Language-ActionInference Latency

  12. Design and Evaluation of LLM Chaining-Based Task Planning for General Purpose Service Robots

    Sep 24, 2026Lucas Da Mota Bruno, Jiahao Sim, Yoshinobu HagiwaraLarge Language Model PlanningRobocasa

  13. Latent evolving World Action Model

    Sep 23, 2026Xueji Fang, Boqiang Duan, Hua Wu +2Action GenerationWorld Models

  14. An Action Is Worth One Patch: Unified World-Action Modeling with PatchWAM

    Sep 22, 2026Tianheng Wang, Zhou Xie, Heng Jia +3Action GenerationVisuomotor Control

  15. MedVLA: A Hierarchical Vision-Language-Action Framework for Closed-Loop Precision Medical Robot Manipulation

    Sep 22, 2026Junjie Xie, Chuxuan He, Angen Ye +2Medical Vision-Language ModelsRobotic Manipulation

  16. Learning Foresight without Explicit Trajectories for 3D Diffusion Policies

    Sep 17, 2026Zhongbo Zhang, Zaibin Zhang, Yifan Wang +3Diffusion PoliciesAction Generation

  17. LYRIC: Language-Driven Physics-Based Character Control for Contact-Rich Whole-Body Object Interaction

    Sep 17, 2026Zeyu Han, Zichong Meng, Julian Tanke +8Action GenerationMotion Planning

  18. OpenDexGrasp: Open-vocabulary Task-Oriented Dexterous Grasping

    Sep 16, 2026Jiyao Zhang, Junhan Wang, Tianyu Wang +4Robotic GraspingOpen-Vocabulary

  19. A Comprehensive Review of Generative Physical Artificial Intelligence

    Sep 16, 2026Satyam Gaba, Krutiksinh Rana, Siva Sai +2Embodied Artificial IntelligenceAction Generation

  20. Technical Report: One-Step Drifting Action Heads for GR00T N1.7

    Sep 16, 2026Xihe ShaoAction GenerationTechnical Report

  21. Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models

    Sep 14, 2026Jianman Lin, Shailesh Shailesh, Zhongyi Luo +1Action GenerationEnd-Effector Pose

  22. IMLE-VLA: Fast Single-Step Action Generation for Vision-Language-Action Policies

    Sep 11, 2026Kian Hosseinkhani (Simon Fraser University), Qinhe Peng (University of Pennsylvania), George Shramko (Simon Fraser University) +7Action GenerationMultimodal Action Distributions

  23. MoPA: Coordinated Mobile Manipulation via Subsystem-Specific Perception Alignment

    Sep 10, 2026Guangyu Chen, Qiwei Liang, Shaolong Zhu +7Perception PipelineMultimodal Action Distributions

  24. Do GUI Agents Know When Not to Act? Enabling Conflict-Aware Termination for Multimodal GUI Agents

    Sep 3, 2026Zhaoyuan Huang, Tianjie Ju, Pengzhou Cheng +7Graphical User Interface AgentsGraphical User Interface

  25. DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

    Aug 30, 2026Yuxuan Gao, Shiqi Zhang, Yedong Shen +6Generalist Vision--Language--ActionAction Generation

  26. TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

    Aug 26, 2026Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang +9Tactile World ModelTactile

  27. Generative Action-Chunk Sampling for Adaptive Stiffness Control in Physical Human-Robot Collaboration

    Aug 26, 2026Aoi Otake, Ferdinand Hartmann, Ko Igari +1Human-Robot CollaborationAction Generation

  28. MAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy

    Aug 17, 2026Aniri, Chen Yilin, Jinhe Bi +7Vision-Language-Action FrameworkLatent Actions

  29. FACT: Failure-Aware Causal Training for World-Action Models

    Aug 10, 2026Quanquan Peng, Yutong Liang, Rui Yan +2Efficient World-Action ModelAction Generation

  30. DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation

    Aug 2, 2026Zheng Yang, Wenjie Zhang, Xiangyu Chen +7Action GenerationMotion Planning

  31. STAGE: STyle-controllable Action GEneration for personalized autonomous driving

    Jul 31, 2026Zihao Liu, Xing Liu, Yizhai Zhang +1Action GenerationImitation Learning

  32. Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration

    Jul 31, 2026Dylan Miller, Martin JagersandRobot PoliciesScalable Robot Learning

  33. WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

    Jul 27, 2026Sen Wang, R. Gnana Praveen, Bidhan Roy +1Action GenerationDiffusion Transformers

  34. STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models

    Jul 20, 2026Kasra Torshizi, Anukriti Singh, Sidharth Mathur +3Signal Temporal LogicAction Generation

  35. BadWAM: When World-Action Models Dream Right but Act Wrong

    Jul 16, 2026Qi Li, Xingyi Yang, Xinchao WangAction GenerationBlack-Box Adversarial Attacks

  36. GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch

    Jul 15, 2026GigaWorld Team, Angen Ye, Angyuan Ma +26Efficient World-Action ModelRobot Policies

  37. Reducing Temporal Redundancy for Efficient Vision-Language-Action Inference

    Jul 14, 2026Yuzhou Wu, Yuxin Zheng, Muchun Niu +6Diffusion-Based Vision-Language-ActionsVision-Language-Action Framework

  38. SUREFlow: State-space Uncertainty-aware REsidual Flow Matching for Robust Robot Manipulation

    Jul 11, 2026Md Tanvir Islam, Sai Navaneet Peddapalli, Sangmoon Lee +1Flow-Matching Vision-Language-ActionRobotic Manipulation

  39. PIER-Flow: Physics-Informed Efficient Rectified Flow for Real-Time Mobile Robot Navigation

    Jul 11, 2026Shibo Li, Zhongcheng Wang, Jiahe Cao +2Flow PoliciesRobot Navigation

  40. Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

    Jul 8, 2026Hongyu Qu, Jianzhe Gao, Xiaobin Hu +6Generalist Vision--Language--ActionVision-Language-Action Framework

  41. InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

    Jul 6, 2026Haoxiang Ma, Junhao Cai, Xiaoxu Xu +26Action GenerationForesight

  42. Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models

    Jul 4, 2026Xinyi Xie, Zican Hu, Zhanyu Liu +7Frozen Vision-Language ModelsAction Generation

  43. Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

    Jul 2, 2026Mingzhe Du, Luu Anh Tuan, Tianyi Wu +4Repository-Level Code UnderstandingAutomated Program Repair

  44. Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments

    Jun 30, 2026Xiaopeng Lin, Ruoqi Yang, Shijie Lian +14Egocentric VideoTeleoperation

  45. SIR: Structured Image Representations for Explainable Robot Learning

    Jun 29, 2026Paul Mattes, Jan Schwab, Jens Bosch +5Robot PoliciesScalable Robot Learning

  46. OpenSPM: An Environment-Transferable Robotic Key Spatial Pose Memory and Closed-Loop High-Frequency Flow-Matching Action Generation Model

    Jun 29, 2026Iok Tong Lei, Qingchen Xie, Yifan Wang +2Robotic ManipulationAction Generation

  47. World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays

    Jun 25, 2026Manish Kumar Govind, Dominick Reilly, Smit Patel +2Efficient World-Action ModelAction Generation

  48. PAMAE: Phase-Aware-MoE Action Experts Towards Reliable Flow-Matching Vision-Language-Action Policies

    Jun 25, 2026Jiayu Yang, Tao Yang, Xiang Chang +3Flow-Matching Vision-Language-ActionAction Generation

  49. Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models

    Jun 24, 2026Tiecheng Guo, Meng GuoAction GenerationRobotic Manipulation

  50. iFLYTEK-Embodied-Omni Technical Report

    Jun 24, 2026Yuan Zhang, Jingfei Ni, Guanchen Lu +12Action GenerationCross-Modal Attention

  51. MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models

    Jun 23, 2026Pablo Valle, Shaukat Ali, Aitor Arrieta +1Action GenerationTest Generation

  52. ARP: Enhancing Quantized Skill Abstractions via Visual Alignment and Iterative Refinement for Robotic Manipulation

    Jun 21, 2026Yuntian Wang, Zesheng Jia, Yuhui Duan +5Robotic ManipulationAction Generation

  53. VLA-FAIL: Efficient Task Failure Detection for Finetuned Vision-Language-Action Models

    Jun 19, 2026Florian Seligmann, Emiliyan Gospodinov, Enes Ulas Dincer +1Action GenerationRobotic Manipulation

  54. Co-policy: Responsive Human-Robot Co-Creation for Musical Performances

    Jun 18, 2026Xuetao Li, Wenke Huang, Mang Ye +4Human-Robot CollaborationRobot Policies

  55. Start Right, Arrive Right: Asynchronous Execution via Initial Noise Selection

    Jun 18, 2026Trong-Bao Ho, Quang-Tan Nguyen, Thien-Loc Ha +7Action ChunksRobot Policies

  56. ROBOSHACKLES: A Safety Dataset for Human-Injury Prevention in Embodied Foundation Models

    Jun 17, 2026Zhuowen Yin, Chongyang Liu, Wenzhang Yang +2Large-Scale Robot Demonstration DatasetsRobocasa

  57. LAGO Policy: Latency-Aware Asynchronous Diffusion Policies with Goal-Directed Collision-Free Planning for Smooth Manipulation

    Jun 16, 2026Guowei Shi, Xupeng Xie, Yiming Luo +3Visuomotor PolicyCollision-Free Trajectories