Spatio-Temporal Attention

Latest papers 46

All topics
CardsList
  1. Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training

    Oct 4, 2026Shuyuan Tu, Qi Tian, Yinming Huang +8Audio-Video GenerationSpatio-Temporal Attention

  2. RoLA: Rotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers

    Sep 6, 2026Zekun Zhang, Yixiang Cai, Yuxi Liu +9Video Diffusion ModelsSpatio-Temporal Attention

  3. Beyond Pixels: From Video Priors to 4D Worlds

    Aug 11, 2026Zihao Liu, Xiaolong Shen, Zhenglin Zhou +24D GenerationVideo Latents

  4. Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding

    Aug 6, 2026Bo Zhang, Wenxin Wang, Feng Chen +4Video UnderstandingSpatio-Temporal Attention

  5. Token Radius Attention for Efficient Video Generation

    Aug 3, 2026Jiayu Chen, Zhikun Jiang, Maoliang Li +6Spatio-Temporal AttentionVisual Tokenizers

  6. Attention-Steered Vision-Language Models for Sign Language Translation

    Jul 31, 2026Meibo Hu, Guohao Sun, Annemarie D. Ross +2Gloss-Free Sign Language TranslationSign Language Translation

  7. Learning Spatiotemporal Decision Priors for Efficient Path Planning under Partial Observability

    Jul 24, 2026Yi Liu, Hongda Zhang, Leyao Zou +7Path PlanningPartial Observability

  8. FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

    Jul 17, 2026Hao Liu, Chenghuan Huang, Ye Huang +7Dynamic Sparse AttentionSpatio-Temporal Attention

  9. VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

    Jul 16, 2026Nhat Thanh Tran, Fanghui Xue andShuai Zhang, Jiancheng Lyu +3Fine-Grained Video UnderstandingSpatio-Temporal Attention

  10. TSCA-Net: Temporal-Spatial Clique Attention for Interpretable Multimodal Pedestrian Trajectory Prediction

    Jul 11, 2026Md Mustafizur Rahman, Guangchao Yang, A F M Abdun Noor +3Pedestrian Trajectory PredictionSpatio-Temporal Attention

  11. SAGE: Synchronized Action-Gaze Recognition and Anticipation for Human Behavior Understanding

    Jul 4, 2026Chenyi Kuang, Nakul AgarwalGaze BehaviorHand-Object Interaction Detection

  12. Reweighting Framewise Attention in Video Transformers for Facial Expression Understanding

    Jun 29, 2026Seongro Yoon, Donghyeon Cho, Jinsun Park +1Facial Expression RecognitionSelf-Supervised Vision Transformers

  13. SAFE-DiT: Semantics-Aware Fast-path Execution for High-Resolution Diffusion Transformers

    Jun 28, 2026Xuanhua Yin, Yuxuan Jia, Chuanzhi Xu +1Diffusion TransformersSpatio-Temporal Attention

  14. Long-Term Prediction of Local and Global Human Motion with Occlusion Recovery

    Jun 26, 2026Qiaoyue Yang, Sven Heutger, Christopher Niemann +3Human Motion PredictionHuman Motion

  15. ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

    Jun 22, 2026Ruiliang Zhou, Xuecheng Wu, Kang He +6Dynamic Sparse AttentionDiffusion Transformers

  16. SpikeTAD: Spiking Neural Networks for End-to-End Temporal Action Detection

    Jun 10, 2026Min Yang, Mi Zhou, Limin WangTemporal Action LocalizationTime-To-First-Spike

  17. FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion

    Jun 9, 2026Yu Lu, Junjie Yang, Piotr Koniusz +2Autoregressive Video Diffusion ModelsAutoregressive Video Generation

  18. Trio: Learning Time-Series Forecasting with Temporal-Spatial-Sample Attention and Structural Causal Priors

    Jun 5, 2026Tao Chen, Yexu Zhou, Zhi Gong +9Time Series ForecastingTime Series

  19. Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting

    Jun 4, 2026Kevin Dave, Sai Aditya Patkuri, Chhaya Kumar Das +3Visual TokenizersSpatio-Temporal Attention

  20. Linear Scaling Video VLMs for Long Video Understanding

    May 29, 2026Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos NieblesLong-Video BenchmarksSpatio-Temporal Attention

  21. Veda: Scalable Video Diffusion via Distilled Sparse Attention

    May 28, 2026Shihao Han, Hao Yang, Xinting Hu +3Video Diffusion ModelsDynamic Sparse Attention

  22. RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers

    May 20, 2026Yuxi Liu, Zekun Zhang, Yixiang Cai +3Diffusion TransformersDynamic Sparse Attention

  23. Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion

    May 15, 2026Kunyang Li, Mubarak Shah, Yuzhang ShangAutoregressive Video Diffusion ModelsSpatio-Temporal Attention

  24. Federated Client Selection under Partial Visibility: A POMDP Approach with Spatio-Temporal Attention

    May 12, 2026Qijun Hou, Yuchen Shi, Pingyi Fan +1Federated LearningPartially Observable Markov Decision Process

  25. LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention

    May 6, 2026Shitong Shao, Zikai Zhou, Haopeng Li +4Dynamic Sparse AttentionVideo Editing

  26. PKS4\text{PKS}^4:Parallel Kinematic Selective State Space Scanners for Efficient Video Understanding

    Apr 29, 2026Lingjie Zeng, Hailun Zhang, Xiwen Wang +1Spatio-Temporal AttentionVision State Space Models

  27. DynamicRad: Content-Adaptive Sparse Attention for Long Video Diffusion

    Apr 22, 2026Yongji Long, Shijun Liang, Jintao Li +1Video Diffusion ModelsSpatio-Temporal Attention

  28. Memorize When Needed: Decoupled Memory Control for Spatially Consistent Long-Horizon Video Generation

    Apr 20, 2026Yanjun Guo, Zhengqiang Zhang, Pengfei Wang +3Video GenerationSpatio-Temporal Attention

  29. Towards Long-Form Spatio-Temporal Video Grounding

    Feb 26, 2026Xin Gu, Bing Fan, Jiali Yao +5Video Temporal GroundingSpatio-Temporal Attention

  30. VRWKV-Editor: Reducing quadratic complexity in transformer-based video editing

    Sep 30, 2025Abdelilah Aitrouga, Youssef Hmamouche, Amal El Fallah SeghrouchniVideo EditingSpatio-Temporal Attention

  31. DiDA: Video Object Segmentation with Distillation Learning of Deformable Attention

    Jan 25, 2024Quang-Trung Truong, Duc Thanh Nguyen, Binh-Son Hua +1Video Object SegmentationSpatio-Temporal Attention