Visual Token Compression

Latest papers 184

All topics
CardsList
  1. Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models

    Jun 18, 2026Jindi Lv, Aoyu Li, Yuhao Zhou +6Visual SSMsVisual Token Pruning

  2. FrequencyFormer: A Co-Designed Sensor-to-Processor Pipeline for Frequency-Domain Vision Transformer Inference

    Jun 17, 2026Chengwei Zhou, Ovishake Sen, Xuming Chen +5Edge InferenceEfficient ViTs

  3. RegimeVGGT: Layer-Wise Spatially Preserving Redundancy Removal for Visual Geometry Grounded Transformer

    Jun 16, 2026Jinhao You, Shuo Lyu, Zhuohang Lyu +53D ViTsMulti-View 3D Reconstruction

  4. TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization

    Jun 16, 2026Weiliang Chen, Yuanhui Huang, Xuebo Wang +1Visual TokenizationVideo Token Compression

  5. DCP-Prune: Ultra-Low Token Pruning with Distribution Consistency Preservation

    Jun 15, 2026Xifeng Xue, Xiaokang Wang, Zirui Li +2Efficient VLM InferenceVisual Token Pruning

  6. One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

    Jun 12, 2026Yongru Chen, Kai Zhang, Zeliang Zong +4Efficient VLM InferenceLarge Vision-Language Models

  7. HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

    Jun 11, 2026Guozhen Zhang, Xuerui Qiu, Yutao Cui +11Unified Multimodal ModelsVision Transformer

  8. Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

    Jun 10, 2026Biao Tang, Xu Chen, Shuxiang Gou +3Multimodal Large Language ModelsLong-Video Understanding

  9. Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

    Jun 10, 2026Tianhao Chen, Yuheng Wu, Kelu Yao +3KV CachingMultimodal Large Language Models

  10. IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder

    Jun 9, 2026Yitong Chen, Zijie Diao, Junke Wang +5Visual Representation LearningImage Tokenization

  11. RAPID: Layer-Wise Redundancy-Aware Pruning and Importance-Driven Token Merging for Efficient ViT

    Jun 6, 2026Kyumin Choi, Ikbeom JangVision TransformerEfficient ViTs

  12. AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

    Jun 5, 2026Xiaocheng Lu, Yuxi Chen, Jie Zhang +5Image TokenizationVisual Tokenization

  13. Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors

    Jun 5, 2026Hanxun Yu, Xuan Qu, Lei Ke +43D Spatial Reasoning3D VQA

  14. Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting

    Jun 4, 2026Kevin Dave, Sai Aditya Patkuri, Chhaya Kumar Das +3Visual TokenizationVideo Token Compression

  15. Balancing Image Compression and Generation with Bootstrapped Tokenization

    Jun 4, 2026Haozhe Chi, Jinghan Li, Hao Jiang +4Learned Image CompressionImage Tokenization

  16. Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

    Jun 3, 2026SooHwan Eom, Jay Shim, Gwanhyeong Koo +4MambaEfficient VLM Inference

  17. ChannelTok: Efficient Flexible-Length Vision Tokenization

    Jun 3, 2026Sukriti Paul, Arpit Bansal, Tom GoldsteinImage TokenizationVisual Tokenization

  18. Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation

    Jun 2, 2026Dongsheng Wang, Dawei Su, Hui Huang3D VQAVisual Token Compression

  19. AdaCodec: A Predictive Visual Code for Video MLLMs

    Jun 1, 2026Haowen Hou, Zhen Huang, Zheming Liang +8Predictive CodingEfficient VLM Inference

  20. InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models

    Jun 1, 2026Xinxin Liu, Shiwei Gan, Xiao Liu +3Efficient VLM InferenceVideo-Language Models

  21. EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models

    Jun 1, 2026Hongyu Lu, Feng Zhang, Wenwei Jin +5Efficient VLM InferenceLarge Vision-Language Models

  22. Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference

    Jun 1, 2026Hyeonwoo Cho, Donghyeon Baek, Yewon Kim +1Efficient Multimodal InferenceMultimodal Large Language Models

  23. ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs

    May 30, 2026Yiling Gao, Hongchen Wei, Zhenzhong ChenEfficient VLM InferenceLarge Vision-Language Models

  24. PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding

    May 28, 2026Selim Kuzucu, Alessio Tonioni, Vasile Lup +3Image TokenizationEfficient VLM Inference

  25. EarlyTom: Early Token Compression Completes Fast Video Understanding

    May 28, 2026Hesong Wang, Xin Jin, Lu Lu +4Video UnderstandingEfficient VLM Inference

  26. CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models

    May 27, 2026Fengze Yang, Bo Yu, Xuewen Luo +2Efficient VLM InferenceKV-Cache Compression

  27. Structure over Pixels: Learning Variable-Length Visual Programs

    May 26, 2026Piotr Wyrwiński, Kacper Dobek, Krzysztof KrawiecVisual Representation LearningImage Tokenization