Visual Token Compression

Latest papers 184

All topics
CardsList
  1. AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers

    May 26, 2026Semi Lee, Hyejin Go, Hyesong ChoiToken MergingSelf-Attention

  2. Channel-wise Vector Quantization

    May 25, 2026Wei Song, Tianhang Wang, Yitong Chen +5Image TokenizationVisual Tokenization

  3. Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention

    May 22, 2026Bingtian Qiao, Yue Shi, Yingjie Zhou +3Diffusion Models for Image RestorationDiffusion Model Inference Acceleration

  4. ASAP: Attention Sink Anchored Pruning

    May 21, 2026Jaehyuk Lee, Hanyoung Kim, Yanggee Kim +1Self-AttentionEfficient ViTs

  5. MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering

    May 21, 2026Junbin Xiao, Jiajun Chen, Tianxiang Sun +2KV CachingVideo QA

  6. Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding

    May 21, 2026Bingjun Luo, Tony Wang, Hanqi Chen +1Video-Language ModelsMultimodal Token Compression

  7. Head-Aware Key-Value Compression for Efficient Autoregressive Image Generation

    May 20, 2026Guotao Liang, Baoquan Zhang, Zhiyuan Wen +1KV CachingAutoregressive Image Generation

  8. Vision Foundation Models as Generalist Tokenizers for Image Generation

    May 18, 2026Anlin Zheng, Qi Han, Xin Wen +5Vision Foundation ModelsImage Tokenization

  9. A More Word-like Image Tokenization for MLLMs

    May 18, 2026Hyun Lee, Hyemin Jeong, Yejin Kim +4Image TokenizationEfficient VLM Inference

  10. An Efficient Streaming Video Understanding Framework with Agentic Control

    May 18, 2026Jinming Liu, Jianguo Huang, Zhaoyang Jia +7Streaming Video UnderstandingAdaptive Model Routing

  11. LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs

    May 17, 2026Jihwan Kim, Nikhil Parthasarathy, Danfeng Qin +5Efficient VLM InferenceVideo-Language Models

  12. LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs

    May 15, 2026Hongyu Lu, Feng Zhang, Wenwei Jin +5Efficient VLM InferenceLarge Vision-Language Models

  13. Representative Attention For Vision Transformers

    May 14, 2026Yuntong Li, Hainuo Wang, Hengxing Liu +2Vision TransformerEfficient ViTs

  14. AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding

    May 13, 2026Xiao Yang, Yingzhe Ma, Haoxuan Yu +2Efficient VLM InferenceLong-Video Understanding

  15. G2^2TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models

    May 12, 2026Junxian Li, Kai Liu, Zizhong Ding +4Efficient Multimodal InferenceUnified Multimodal Models

  16. See What Matters: Differentiable Grid Sample Pruning for Generalizable Vision-Language-Action Model

    May 12, 2026Yixu Feng, Zinan Zhao, Yanxiang Ma +4Vision-Language-Action ModelsVLMs for Robotics

  17. OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

    May 12, 2026Minseok Kang, Minhyeok Lee, Jungho Lee +6Efficient VLM InferenceVideo-Language Models

  18. DORA: Dynamic Online Reinforcement Agent for Token Merging in Vision Transformers

    May 12, 2026Kaixuan He, Song Chen, Yi KangEfficient ViTsVisual Token Merging

  19. ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction

    May 11, 2026Amirhossein Abaskohi, Yuhang He, Peter West +3Computer-Use AgentsLong-Horizon Agent Tasks

  20. Mutual Enhancement Between Global Tokens and Patch Tokens: From Theory to Practice

    May 11, 2026Xiusheng Huang, Xin Jiang, Jun Zhao +2Learned Image CompressionImage Tokenization

  21. Network-Efficient World Model Token Streaming

    May 11, 2026Shatadal Mishra, Ahmadreza Moradipari, Nejib AmmarIntelligent Transportation SystemsWorld Models

  22. Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs

    May 10, 2026Yigui Feng, Qinglin Wang, Yang Liu +1Efficient VLM InferenceVisual Tokenization

  23. LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?

    May 9, 2026Kechen Fang, Yihua Qin, Chongyi Wang +3Efficient VLM InferenceMultimodal Large Language Models