Visual Token Compression

Latest papers 184

All topics
CardsList
  1. WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

    Jul 25, 2026Yuhui Zeng, Wang Chen, Jinfa Huang +5Efficient VLM InferenceVideo Token Compression

  2. Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs

    Jul 25, 2026Jouwon Song, Woohyeong Kim, Kyeongbo KongEfficient VLM InferenceLarge Vision-Language Models

  3. TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution

    Jul 24, 2026Sicheng Gao, Zhuyun Zhou, Yixuan Liu +3Diffusion TransformerVideo Super-Resolution

  4. LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR

    Jul 24, 2026Xudong Liu, Bicheng Wan, Yulin JinEfficient VLM InferenceDocument Layout Analysis

  5. dRAE: Representation Autoencoder with Hyper-Spherical Codes

    Jul 24, 2026Tianren Ma, Lin Long, Chuyan Chen +4AutoencodersHyperspherical Representation Learning

  6. Cheap Probes Predict Expensive Training in 3D-CT Vision--Language Models

    Jul 24, 2026Renjie LiangVLM EvaluationMedical VLMs

  7. Out of Sight, Still in Mind: Token Compression for Omni-LLMs

    Jul 23, 2026Suho Yoo, Youngjoon Jang, Hyebin Cho +1Efficient Multimodal InferenceMultimodal Large Language Models

  8. Visual Token Compression Enhances Robustness of MLLMs

    Jul 21, 2026Shishen Gu, Jiequan Cui, Wenbo Hu +3VLM RobustnessAdversarial Attacks on VLMs

  9. SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing

    Jul 19, 2026Kaiwen Jing, Ruixu Jia, Bingyao Li +3Referring Video Object SegmentationMultimodal Large Language Models

  10. Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference

    Jul 17, 2026Tong Jin, Yunpeng Liu, Shuyu Hu +4Visual Place RecognitionEfficient ViTs

  11. Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models

    Jul 15, 2026Xuanyi Hao, Zuoyuan Zhang, Zhibo Wang +4Vision-Language ModelsEfficient VLM Inference

  12. VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

    Jul 14, 2026Yupeng Zheng, Kai Zou, Bin Liu +1Efficient VLM InferenceLarge Vision-Language Models

  13. Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding

    Jul 14, 2026Yifan Lu, Ziqi Zhang, Chunfeng Yuan +3Large Vision-Language ModelsVideo Frame Selection

  14. Spectral Heat Flow for Conservative Token Condensation in Vision-Language Models

    Jul 12, 2026Zhaoyang Li, Yanjun Li, Wangkai Li +2Efficient VLM InferenceVisual Token Pruning

  15. GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models

    Jul 10, 2026Guohuan Xie, Mengqi Lei, Chuan Shi +3Efficient VLM InferenceVideo-Language Models

  16. Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

    Jul 6, 2026Suhyeong Park, Junha Jung, Jungwoo Park +1Token MergingMulti-Vector Retrieval

  17. TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models

    Jul 6, 2026Riccardo Renzulli, Gabriele Spadaro, Shruthi Gowda +2Efficient VLM InferenceVisual Token Pruning

  18. STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation

    Jul 3, 2026Syed Ariff Syed Hesham, Yun Liu, Guolei Sun +4Video ReasoningReasoning Segmentation

  19. When Token Compression Breaks: Structural Pruning vs. Token Reduction for Robust ViT Segmentation under High Compression

    Jul 2, 2026Tien-Phat Nguyen, Ngai-Man CheungDistribution Shift RobustnessVision Transformer

  20. Fusion: A Framework for Unified Sequential Token AdaptatIon in VisiOn TraNsformers

    Jul 1, 2026Aravind Pradeep, Samira Nazari, Mahdi Taheri +1Token MergingEfficient ViTs

  21. SpiralFovea: Input-Adaptive Foveated Tokenization as a Third Lever of Resource-Adaptive Inference

    Jul 1, 2026Kyan Mahajan, Mohammad SaqlainImage TokenizationEfficient ViTs

  22. REDI: Corpus Aware Patch Ranking for DINOv3 Token Reduction

    Jun 30, 2026Chanjong Im, Sebastian Diem, Thomas MandlEfficient ViTsVisual Token Pruning

  23. MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

    Jun 30, 2026Zhongyang Li, Yaqian Li, Faming Fang +6Multimodal Large Language ModelsMultimodal Fusion

  24. Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs

    Jun 28, 2026Junzhou Chen, Jindong Wang, Gang ZhouEfficient VLM InferenceVision-Language-Action Models

  25. ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

    Jun 25, 2026Xumin Yu, Zuyan Liu, Zhenyu Yang +5Visual Representation LearningMultimodal Pretraining

  26. DinoLink: A Token-Centric Representation Compression Framework for Bandwidth-Constrained Collaborative V2X Perception

    Jun 24, 2026Tianle Zhu, Haohua Que, Handong Yao +2Semantic CommunicationV2X Communication

  27. Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding

    Jun 24, 2026Baiyang Song, Yuli Lin, Qiong Wu +5Streaming Video UnderstandingMultimodal Large Language Models

  28. Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

    Jun 23, 2026Zengjie Chen, Yuxiang Cai, Jingcai Guo +3Efficient VLM InferenceMultimodal Large Language Models

  29. Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers

    Jun 18, 2026Dong Hoon Lee, Seunghoon HongToken MergingDiffusion-Based Image Generation