Visual Token Compression

Latest papers 184

All topics
CardsList
  1. QuadTok: Quadtree Visual Tokenizer for Autoregressive Image Generation

    Oct 7, 2026Yucheng Mao, Zeyuan Chen, Xiaojun Shan +4Visual TokenizationAutoregressive Image Generation

  2. Understanding and Mitigating Token-Pruning-Induced Vulnerabilities in VLMs

    Oct 7, 2026Shuailong Wang, Xinyu Lyu, Shengming Yuan +3Visual Token PruningVLM Robustness

  3. Adaptive Visual Token Reduction for Accelerated Image Understanding

    Oct 7, 2026Seyoung Jeong, Jong Pil Yun, Sang Jun LeeEfficient VLM InferenceVisual Token Pruning

  4. VisionWeave: Weaving Elastic Visual Representations as a Native Capability of MLLMs

    Oct 6, 2026Yuan Feng, Qize Yang, Ruizhe Chen +9Efficient Multimodal InferenceMultimodal Large Language Models

  5. Foveated Compression: Selective High-Resolution Preservation for Token-Efficient VLMs

    Oct 6, 2026Donghyun Han, Jangho Park, Yuseok BaeEfficient VLM InferenceVisual Token Pruning

  6. Level-of-Token Diffusion

    Oct 5, 2026Kiyohiro Nakayama, Brian Chao, Jan Ackermann +5Video Diffusion ModelsDiffusion Transformer

  7. VETO: Video Efficient Token Optimization for Vision Language Models

    Oct 1, 2026Gueter Josmy Faure, Hao Ping Wang, Min-Hung Chen +1Efficient VLM InferenceLarge Vision-Language Models

  8. CoVisco: Codec-Native Vision Encoder with Native Token Compression for Unified Image-Video Understanding

    Sep 30, 2026Yulong Liu, Xiaotian Han, Junyuan Shang +6Video UnderstandingEfficient VLM Inference

  9. DC-SAE: Deep Compression Semantic Autoencoder for Faster Diffusion Convergence

    Sep 30, 2026Xu Huang, Ye Huang, Zijun Liao +6AutoencodersDiffusion-Based Image Generation

  10. Feature-Aware Token Attack for Compression-Triggered Stealthy Failures in Large Vision-Language Models

    Sep 30, 2026Shilinlu Yan, Bowen Chen, Yuechen Zhang +3VLM RobustnessAdversarial Attacks on VLMs

  11. Task-Oriented Visual Feature Compression via Residual Vector Quantization for Device-Edge Multimodal Inference

    Sep 29, 2026Luning Pang, Cheng Yuan, Jiawei Shao +2Efficient Multimodal InferenceVisual Token Compression

  12. Representation Dynamics Reveal Semantic Saliency and Similarity for Visual Token Pruning in MLLMs

    Sep 29, 2026Weixuan Li, Zikun Zhou, Xinyi Zhuang +4Efficient VLM InferenceVisual Token Pruning

  13. Aperture: Merge-Consistent Rotary States for Compressed Tokens

    Sep 29, 2026Yuhao Du, Shunian ChenRotary Positional EmbeddingsVisual Token Merging

  14. NesTok: Nested Self-Aligned 1D Tokenizer for Autoregressive Image Generation

    Sep 29, 2026Jiawei Zhang, Shuhao Liu, Rong Huang +4Autoregressive Image GenerationVisual Token Compression

  15. FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution

    Sep 29, 2026FangZhi Zhong, Xuerui Qiu, Yuqi Pan +4Efficient VLM InferenceVLM Reasoning

  16. Rethinking Visual Token Compression for Video Large Language Models: A Simple Yet Strong Baseline

    Sep 28, 2026Xiao Zhang, Wang Zeng, Sheng Jin +3Video UnderstandingVideo-Language Models

  17. Still There, No Longer Seen: Exposing Compression-Induced Risk in Large Vision-Language Models

    Sep 28, 2026Qiankun Li, Yuechen Zhang, Bowen Chen +4VLM RobustnessAdversarial Attacks on VLMs

  18. When Text Matters: Design Principles for Visual Token Pruning in Vision-Language Model

    Sep 28, 2026Minchan Kang, Kyeonghye Park, Seoyoung Cho +2Efficient VLM InferenceVisual Token Pruning

  19. CoViST: Visual Token Compression via Composable States

    Sep 27, 2026Qi Zhang, Xiandong Meng, Ronggang Wang +1Vision-Language ModelsEfficient VLM Inference

  20. Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction

    Sep 26, 2026Junxian Li, Ruixuan Yang, Tianao Zhang +3Efficient VLM InferenceVLM Distillation

  21. VPRune: Efficient Training-free Pre-LLM Visual Token Pruning

    Sep 21, 2026Guangchuan Lv, Dianxing Shi, Dingjie FuEfficient VLM InferenceLarge Vision-Language Models

  22. VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs

    Sep 15, 2026Haoyu Guo, Yuan Feng, Junlin Lv +3Efficient VLM InferenceLong-Video Understanding

  23. SparseTalk - Sparsifying 3D Gaussian Language Fields for Efficient 3D Visual Question Answering

    Sep 14, 2026Davit Soselia, Joseph JaJa, Amitabh Varshney3DGS CompressionLanguage-Embedded 3DGS

  24. TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents

    Sep 9, 2026Yuhao Wang, Mu Qiao, Xindong Zhang +3KV-Cache CompressionVisual Token Pruning

  25. Who Speaks for the Pruned? Visual Token Pruning as Coverage Optimization

    Sep 2, 2026Qingchan Zhu, Weihang You, Hanqi Jiang +3Efficient VLM InferenceVisual Token Pruning

  26. ZipTok3D: High-Fidelity 3D Tokenization with Compact Token Prefixes

    Sep 1, 2026Mingda Lin, Weijie Wang, Zeyu Zhang +73D Reconstruction3D Representation Learning

  27. Compressing AI Traffic: Standardized Neural Network Coding of Visual-Token Representations in Split Vision-Language Inference

    Sep 1, 2026Reza Heidari, Hamed R. Tavakoli, Juho KannalaVisual Token CompressionVLM Inference

  28. PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

    Aug 27, 2026Junjie Liu, Shengyuan Ye, Xu ChenEfficient VLM InferenceVisual Token Pruning

  29. Token-Oriented Semantic Communication with Pretrained Vision Transformers

    Aug 26, 2026Jiwoong Im, Minwoo Kim, Jaeho Lee +2Learned Image CompressionSemantic Communication

  30. Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

    Aug 21, 2026Zhuoyuan Li, Rui Zhao, Jin Wang +5Vision-Language-Action ModelsVisual Token Pruning

  31. MergeOver: Post-Training Token Merging for Recursive Vision Transformers

    Aug 13, 2026Junseo Kim, Uraz Odyurt, Amirreza YousefzadehVision TransformerEfficient ViTs

  32. When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

    Aug 11, 2026Congyang Ou, Ruike Song, Yang Zhou +3Efficient VLM InferenceLarge Vision-Language Models

  33. Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations

    Aug 10, 2026Weijie Liang, Yuanfeng Song, Xing Chen +3Automated Program RepairAI Coding Agents

  34. Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

    Aug 10, 2026Jingbo Wen, Liang He, Mingyu Cao +4Efficient VLM InferenceVisual Token Compression

  35. AnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document Retrieval

    Aug 9, 2026Haoyu Zuo, Yibo Yan, Xin Zou +4Multi-Vector RetrievalVisual Document Retrieval

  36. Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation

    Aug 9, 2026Jonathan Suprijadi, Raphael Stock, Moritz Langenberg +10Radiology Report GenerationRadiology VLMs

  37. KVAE: Family of Tokenizers for Multimodal Generative Models

    Aug 6, 2026Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov +11Variational AutoencodersAudio Token Compression

  38. HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

    Aug 5, 2026Jiuhe Qu, Yingping Liang, Ying Fu3D Spatial ReasoningVisual Token Pruning

  39. CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding

    Aug 5, 2026Zhenyu Yi, Qiang Hu, Zhenhao Li +33D Medical ImagingMedical VQA

  40. RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

    Aug 4, 2026Jian Zou, Xiaoyu Xu, Zhihua Wang +3Efficient VLM InferenceVisual Token Pruning

  41. OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

    Aug 4, 2026Wanshun Su, Yang Shi, Feihu Liu +10Efficient Multimodal InferenceAudio Token Compression

  42. Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

    Aug 3, 2026Long Qian, Jiaqi Wei, Bingke Zhu +2Efficient VLM InferenceCoreset Selection

  43. Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression

    Aug 3, 2026Tianyu Liang, Xiangxi Zheng, Yilin Wang +1VLM AdaptationMultimodal Token Compression

  44. Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

    Aug 3, 2026Yonghan Gao, Zehong Chen, Lijian Xu +3Multimodal Model EvaluationVisual Token Compression

  45. CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

    Aug 3, 2026Yu Chen, Xiaohong Li, Xiaole Wang +3Efficient VLM InferenceLarge Vision-Language Models

  46. Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

    Aug 2, 2026Jiayang He, Tianling Xu, Diancheng Kang +4Efficient VLM InferenceVideo-Language Models

  47. RAGOCR: Optical Compression of Retrieval-Augmented Text via Visual Representation

    Aug 1, 2026Jiayang Yu, Jialun Zhong, Lei ZouMultimodal RAGRetrieval-Augmented Generation

  48. ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression

    Jul 31, 2026Renjie Liang, Zijian Xu, Jinqian Pan +6Medical VLMsVisual Token Merging

  49. ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding

    Jul 30, 2026Mingkang Dong, Muxin Pu, Jie Li +8Memory-Augmented VLMsStreaming Video Understanding

  50. Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs

    Jul 30, 2026Jiasheng Li, Zhong Ji, Yan Zhang +1VLM RobustnessEfficient VLM Inference

  51. MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models

    Jul 29, 2026Yitao Zhu, Mengjun Liu, Yingji Fu +2Efficient VLM InferenceMedical VLMs

  52. GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models

    Jul 27, 2026Jun Ling, Tao Huang, Junzhuo Liu +2Efficient VLM InferenceLarge Vision-Language Models