Visual Token Compression

Latest papers 184

All topics
CardsList
  1. An Efficient Token Compression Framework for Visual Object Tracking

    May 8, 2026Weijing Wu, Qihua Liang, Bineng Zhong +3Visual Object TrackingEfficient ViTs

  2. One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy

    May 8, 2026Zuojin Tang, Shengchao Yuan, Xiaoxin Bai +4Action-Conditioned World ModelsEfficient VLA Models

  3. Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding

    May 8, 2026Hang Wu, Sherin Mary Mathews, Yujun Cai +2Streaming Video UnderstandingEfficient VLM Inference

  4. Spark3R: Asymmetric Token Reduction Makes Fast Feed-Forward 3D Reconstruction

    May 7, 2026Zecheng Tang, Jiaye Fu, Qiankun Gao +53D ReconstructionEfficient ViTs

  5. Learning Discrete Autoregressive Priors with Wasserstein Gradient Flow

    May 7, 2026Bowen Zheng, Yihong Luo, Tianyang HuImage TokenizationVisual Tokenization

  6. VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading

    May 7, 2026Cheng Xu, Xiaofeng Hou, Jiacheng Liu +1Expert OffloadingVision-Language Models

  7. VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding

    May 7, 2026Kuanwei Lin, Wenhao Zhang, Ge LiEfficient VLM InferenceLong-Video Understanding

  8. Visual Text Compression as Measure Transport

    May 6, 2026Lv Tang, Tianyi Zheng, Yang Liu +2Efficient VLM InferenceVisual Tokenization

  9. ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters

    May 6, 2026Philippe Hansen-Estruch, Jiahui Chen, Vivek Ramanujan +9Image TokenizationAutoencoders

  10. CoVSpec: Efficient Device-Edge Co-Inference for Vision-Language Models via Speculative Decoding

    May 4, 2026Yuanyuan Jia, Shunpu Tang, Qianqian YangEfficient VLM InferenceEdge Computing

  11. Make Your LVLM KV Cache More Lightweight

    May 1, 2026Xihao Chen, Yangyang Guo, Roger ZimmermannKV CachingEfficient VLM Inference

  12. End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

    May 1, 2026Wenda Chu, Bingliang Zhang, Jiaqi Han +4Image TokenizationVisual Tokenization

  13. RTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR Inference

    May 1, 2026Ben Wan, Yan Feng, Zihan Tang +4Efficient VLM InferenceOptical Character Recognition

  14. Progressive Semantic Communication for Efficient Edge-Cloud Vision-Language Models

    Apr 29, 2026Cyril Shih-Huan Hsu, Wig Yuan-Cheng Cheng, Chrysa PapagianniEfficient VLM InferenceEdge Computing

  15. VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

    Apr 27, 2026Maitreya Patel, Jingtao Li, Weiming Zhuang +2Image TokenizationVisual Tokenization

  16. Geometry-Guided 3D Visual Token Pruning for Video-Language Models

    Apr 20, 2026Han Li, Zehao Huang, Jiahui Fu +2Visual Token PruningVisual Token Compression

  17. StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression

    Apr 16, 2026Xuanyi Liu, Chunan Yu, Deyi Ji +63D ViTsStreaming 3D Reconstruction

  18. Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors

    Apr 16, 2026Mingqian Ji, Shanshan Zhang, Jian YangMulti-View 3D Object DetectionEfficient ViTs

  19. DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression

    Mar 15, 2026Bingzhou Li, Tao HuangAudio-Visual UnderstandingEfficient Multimodal Inference

  20. StructSAM: Structure- and Spectrum-Preserving Token Merging for Segment Anything Models

    Mar 7, 2026Duy M. H. Nguyen, Tuan A. Tran, Duong Nguyen +17Token MergingImage Segmentation

  21. Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding

    Mar 5, 2026Jiaqi Li, Shuntian Zheng, Yixian Shen +4Temporal Video GroundingVision-Language Grounding

  22. Stateful Token Reduction for Long-Video Hybrid VLMs

    Feb 27, 2026Jindong Jiang, Amala Sanjay Deshmukh, Kateryna Chumachenko +7Efficient VLM InferenceVideo-Language Models

  23. AFFMAE: Scalable Vision Pre-Training for High-Resolution Microscopy Segmentation on Desktop Hardware

    Feb 18, 2026David Smerkous, Zian Wang, Behzad NajafianMasked AutoencodersSelf-Supervised Pre-Training

  24. LGQ: Learnable Geometric Quantization for Image Tokenization

    Feb 17, 2026Idil Bilge Altun, Mert Onur Cakiroglu, Elham Buxton +2Image TokenizationVector Quantization

  25. CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding

    Jan 29, 2026Jiahao Huo, Yu Huang, Yibo Yan +7Multimodal EmbeddingMulti-Vector Retrieval