Spatial Tokens

Latest papers 25

All topics
CardsList
  1. PrecipJEPA: JEPA-Regularized Future-State Prediction with Motion-Source Rendering for Precipitation Nowcasting

    Sep 30, 2026Yufeng Zhu, Dan Niu, Qiliang Wu +4Precipitation NowcastingS-Jepa

  2. Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation

    Sep 17, 2026Haocheng Xi, Yiming Xie, Hexu Zhao +8Video Diffusion ModelsVideo Generation

  3. Hyper-RED: Scalable Event Pre-training via Semantic Hypergraph Distillation

    Sep 15, 2026Meisen Wang, Zhiqiang Tian, Wei Bao +3Spatial TokensRepresentation Learning

  4. Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

    Aug 10, 2026Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian +4Spatial ReasoningSpatial Grounding

  5. Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

    Jul 27, 2026Tianyi Gao, Han Fang, Tianyi Ding +9Multimodal ReasoningMultimodal Large Language Models

  6. TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution

    Jul 24, 2026Sicheng Gao, Zhuyun Zhou, Yixuan Liu +3Diffusion TransformersSpatial Tokens

  7. STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation

    Jul 3, 2026Syed Ariff Syed Hesham, Yun Liu, Guolei Sun +4Spatial TokensToken Compression

  8. VSANet: View-aware Sparse Attention Network for Light Field Image Denoising

    Jun 23, 2026Gargi Panda, Soumitra Kundu, Saumik Bhattacharya +1Sparse-ViewIterative Denoising Methods

  9. Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models

    Jun 18, 2026Jindi Lv, Aoyu Li, Yuhao Zhou +6Vision State Space ModelsSpatial Tokens

  10. MambaCount: Efficient Text-guided Open-vocabulary Object Counting with Spatial Sparse State Space Duality Block

    Jun 16, 2026Hao-Yuan Ma, Li Zhang, Minjie Qiang +1Vision State Space ModelsSpatial Tokens

  11. WAM4D: Fast 4D World Action Model via Spatial Register Tokens

    Jun 12, 2026Ying Li, Xiaobao Wei, Jiajun Cao +10Efficient World-Action ModelFaster-Wam

  12. TrajTok: Adaptive Spatial Tokenization for Trajectory Representation Learning

    May 19, 2026Zhen Xiong, Shang-Ling Hsu, Cyrus ShahabiSpatial TokensTraccia

  13. UniRefiner: Teaching Pre-trained ViTs to Self-Dispose Dross via Contrastive Register

    May 19, 2026Congpei Qiu, Zhaoyu Hu, Wei Ke +3Self-Supervised Vision TransformersVision Transformer

  14. EventPrune: Cascaded Event-Assisted Token Pruning for Efficient First-Person Dynamic Spatial Reasoning

    May 19, 2026Pengtao Ma, Ziliang Zhou, Ciyu Ruan +7Spatial TokensVisual Token Pruning

  15. Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling

    May 18, 2026Yihang Wu, Yihang Sun, Shaofeng Zhang +4Novel View SynthesisSpatial Tokens

  16. Representative Attention For Vision Transformers

    May 14, 2026Yuntong Li, Hainuo Wang, Hengxing Liu +2Self-Supervised Vision TransformersVision Transformer

  17. Uncertainty-Aware Token Importance Estimation in Spiking Transformers

    May 10, 2026Wenxuan Liu, Zecheng Hao, Tong Bu +2Spatial TokensTransformer Architectures

  18. SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models

    May 8, 2026Jiesong Lian, Zixiang Zhou, Ruizhe Zhong +6Video Diffusion ModelsHierarchical Semantic Alignment

  19. Vision SmolMamba: Spike-Guided Token Pruning for Energy-Efficient Spiking State-Space Vision Models

    Apr 28, 2026Dewei Bai, Hongxiang Peng, Yunyun Zeng +3Self-Supervised Vision TransformersVisual Token Pruning

  20. ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving

    Apr 21, 2026Lin Sha, Haiyun Guo, Tao Wang +4Visual Token PruningAutonomous Driving

  21. Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors

    Apr 16, 2026Mingqian Ji, Shanshan Zhang, Jian Yang3D Object DetectionSelf-Supervised Vision Transformers

  22. History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation

    Mar 6, 2026Qitong Wang, Yijun Liang, Ming Li +2Vision-Language NavigationVisual Token Pruning

  23. Spiking Patches: Asynchronous, Sparse, and Efficient Tokens for Event Cameras

    Oct 30, 2025Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros NalpantidisSpatial TokensFine-Grained Video Understanding