Visual Token Compression

Latest papers 186

All topics
CardsList
  1. Look Back, Think Ahead: Visual Memory on Demand for Efficient Multimodal Reasoning

    Oct 8, 2026Yicheng Xue, Han Wu, Jufeng Yang +4VLM ReasoningEfficient Multimodal Inference

  2. V-CoLA: Vision Token Compression with Linear Attention

    Oct 8, 2026Hao Jiang, Yiru Mao, Tianpeng Bu +9Visual Token CompressionEfficient VLM Inference

  3. QuadTok: Quadtree Visual Tokenizer for Autoregressive Image Generation

    Oct 7, 2026Yucheng Mao, Zeyuan Chen, Xiaojun Shan +4Visual TokenizationAutoregressive Image Generation

  4. Understanding and Mitigating Token-Pruning-Induced Vulnerabilities in VLMs

    Oct 7, 2026Shuailong Wang, Xinyu Lyu, Shengming Yuan +3Visual Token PruningVLM Robustness

  5. Adaptive Visual Token Reduction for Accelerated Image Understanding

    Oct 7, 2026Seyoung Jeong, Jong Pil Yun, Sang Jun LeeEfficient VLM InferenceVisual Token Pruning

  6. VisionWeave: Weaving Elastic Visual Representations as a Native Capability of MLLMs

    Oct 6, 2026Yuan Feng, Qize Yang, Ruizhe Chen +9Efficient Multimodal InferenceMultimodal Large Language Models

  7. Foveated Compression: Selective High-Resolution Preservation for Token-Efficient VLMs

    Oct 6, 2026Donghyun Han, Jangho Park, Yuseok BaeEfficient VLM InferenceVisual Token Pruning

  8. Level-of-Token Diffusion

    Oct 5, 2026Kiyohiro Nakayama, Brian Chao, Jan Ackermann +5Video Diffusion ModelsDiffusion Transformer

  9. VETO: Video Efficient Token Optimization for Vision Language Models

    Oct 1, 2026Gueter Josmy Faure, Hao Ping Wang, Min-Hung Chen +1Efficient VLM InferenceLarge Vision-Language Models

  10. CoVisco: Codec-Native Vision Encoder with Native Token Compression for Unified Image-Video Understanding

    Sep 30, 2026Yulong Liu, Xiaotian Han, Junyuan Shang +6Video UnderstandingEfficient VLM Inference

  11. DC-SAE: Deep Compression Semantic Autoencoder for Faster Diffusion Convergence

    Sep 30, 2026Xu Huang, Ye Huang, Zijun Liao +6AutoencodersDiffusion-Based Image Generation

  12. Feature-Aware Token Attack for Compression-Triggered Stealthy Failures in Large Vision-Language Models

    Sep 30, 2026Shilinlu Yan, Bowen Chen, Yuechen Zhang +3VLM RobustnessAdversarial Attacks on VLMs

  13. Task-Oriented Visual Feature Compression via Residual Vector Quantization for Device-Edge Multimodal Inference

    Sep 29, 2026Luning Pang, Cheng Yuan, Jiawei Shao +2Efficient Multimodal InferenceVisual Token Compression

  14. Representation Dynamics Reveal Semantic Saliency and Similarity for Visual Token Pruning in MLLMs

    Sep 29, 2026Weixuan Li, Zikun Zhou, Xinyi Zhuang +4Efficient VLM InferenceVisual Token Pruning

  15. Aperture: Merge-Consistent Rotary States for Compressed Tokens

    Sep 29, 2026Yuhao Du, Shunian ChenRotary Positional EmbeddingsVisual Token Merging

  16. NesTok: Nested Self-Aligned 1D Tokenizer for Autoregressive Image Generation

    Sep 29, 2026Jiawei Zhang, Shuhao Liu, Rong Huang +4Autoregressive Image GenerationVisual Token Compression

  17. FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution

    Sep 29, 2026FangZhi Zhong, Xuerui Qiu, Yuqi Pan +4Efficient VLM InferenceVLM Reasoning

  18. Rethinking Visual Token Compression for Video Large Language Models: A Simple Yet Strong Baseline

    Sep 28, 2026Xiao Zhang, Wang Zeng, Sheng Jin +3Video UnderstandingVideo-Language Models

  19. Still There, No Longer Seen: Exposing Compression-Induced Risk in Large Vision-Language Models

    Sep 28, 2026Qiankun Li, Yuechen Zhang, Bowen Chen +4VLM RobustnessAdversarial Attacks on VLMs

  20. When Text Matters: Design Principles for Visual Token Pruning in Vision-Language Model

    Sep 28, 2026Minchan Kang, Kyeonghye Park, Seoyoung Cho +2Efficient VLM InferenceVisual Token Pruning

  21. CoViST: Visual Token Compression via Composable States

    Sep 27, 2026Qi Zhang, Xiandong Meng, Ronggang Wang +1Vision-Language ModelsEfficient VLM Inference

  22. Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction

    Sep 26, 2026Junxian Li, Ruixuan Yang, Tianao Zhang +3Efficient VLM InferenceVLM Distillation

  23. VPRune: Efficient Training-free Pre-LLM Visual Token Pruning

    Sep 21, 2026Guangchuan Lv, Dianxing Shi, Dingjie FuEfficient VLM InferenceLarge Vision-Language Models

  24. VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs

    Sep 15, 2026Haoyu Guo, Yuan Feng, Junlin Lv +3Efficient VLM InferenceLong-Video Understanding

  25. SparseTalk - Sparsifying 3D Gaussian Language Fields for Efficient 3D Visual Question Answering

    Sep 14, 2026Davit Soselia, Joseph JaJa, Amitabh Varshney3DGS CompressionLanguage-Embedded 3DGS

  26. TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents

    Sep 9, 2026Yuhao Wang, Mu Qiao, Xindong Zhang +3KV-Cache CompressionVisual Token Pruning

  27. Who Speaks for the Pruned? Visual Token Pruning as Coverage Optimization

    Sep 2, 2026Qingchan Zhu, Weihang You, Hanqi Jiang +3Efficient VLM InferenceVisual Token Pruning

  28. ZipTok3D: High-Fidelity 3D Tokenization with Compact Token Prefixes

    Sep 1, 2026Mingda Lin, Weijie Wang, Zeyu Zhang +73D Reconstruction3D Representation Learning