Visual Token Compression

Latest papers 184

All topics
CardsList
  1. PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

    Aug 27, 2026Junjie Liu, Shengyuan Ye, Xu ChenEfficient VLM InferenceVisual Token Pruning

  2. Token-Oriented Semantic Communication with Pretrained Vision Transformers

    Aug 26, 2026Jiwoong Im, Minwoo Kim, Jaeho Lee +2Learned Image CompressionSemantic Communication

  3. Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

    Aug 21, 2026Zhuoyuan Li, Rui Zhao, Jin Wang +5Vision-Language-Action ModelsVisual Token Pruning

  4. MergeOver: Post-Training Token Merging for Recursive Vision Transformers

    Aug 13, 2026Junseo Kim, Uraz Odyurt, Amirreza YousefzadehVision TransformerEfficient ViTs

  5. When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

    Aug 11, 2026Congyang Ou, Ruike Song, Yang Zhou +3Efficient VLM InferenceLarge Vision-Language Models

  6. Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations

    Aug 10, 2026Weijie Liang, Yuanfeng Song, Xing Chen +3Automated Program RepairAI Coding Agents

  7. Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

    Aug 10, 2026Jingbo Wen, Liang He, Mingyu Cao +4Efficient VLM InferenceVisual Token Compression

  8. AnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document Retrieval

    Aug 9, 2026Haoyu Zuo, Yibo Yan, Xin Zou +4Multi-Vector RetrievalVisual Document Retrieval

  9. Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation

    Aug 9, 2026Jonathan Suprijadi, Raphael Stock, Moritz Langenberg +10Radiology Report GenerationRadiology VLMs

  10. KVAE: Family of Tokenizers for Multimodal Generative Models

    Aug 6, 2026Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov +11Variational AutoencodersAudio Token Compression

  11. HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

    Aug 5, 2026Jiuhe Qu, Yingping Liang, Ying Fu3D Spatial ReasoningVisual Token Pruning

  12. CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding

    Aug 5, 2026Zhenyu Yi, Qiang Hu, Zhenhao Li +33D Medical ImagingMedical VQA

  13. RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

    Aug 4, 2026Jian Zou, Xiaoyu Xu, Zhihua Wang +3Efficient VLM InferenceVisual Token Pruning

  14. OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

    Aug 4, 2026Wanshun Su, Yang Shi, Feihu Liu +10Efficient Multimodal InferenceAudio Token Compression

  15. Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

    Aug 3, 2026Long Qian, Jiaqi Wei, Bingke Zhu +2Efficient VLM InferenceCoreset Selection

  16. Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression

    Aug 3, 2026Tianyu Liang, Xiangxi Zheng, Yilin Wang +1VLM AdaptationMultimodal Token Compression

  17. Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

    Aug 3, 2026Yonghan Gao, Zehong Chen, Lijian Xu +3Multimodal Model EvaluationVisual Token Compression

  18. CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

    Aug 3, 2026Yu Chen, Xiaohong Li, Xiaole Wang +3Efficient VLM InferenceLarge Vision-Language Models

  19. Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

    Aug 2, 2026Jiayang He, Tianling Xu, Diancheng Kang +4Efficient VLM InferenceVideo-Language Models

  20. RAGOCR: Optical Compression of Retrieval-Augmented Text via Visual Representation

    Aug 1, 2026Jiayang Yu, Jialun Zhong, Lei ZouMultimodal RAGRetrieval-Augmented Generation

  21. ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression

    Jul 31, 2026Renjie Liang, Zijian Xu, Jinqian Pan +6Medical VLMsVisual Token Merging

  22. ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding

    Jul 30, 2026Mingkang Dong, Muxin Pu, Jie Li +8Memory-Augmented VLMsStreaming Video Understanding

  23. Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs

    Jul 30, 2026Jiasheng Li, Zhong Ji, Yan Zhang +1VLM RobustnessEfficient VLM Inference

  24. MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models

    Jul 29, 2026Yitao Zhu, Mengjun Liu, Yingji Fu +2Efficient VLM InferenceMedical VLMs

  25. GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models

    Jul 27, 2026Jun Ling, Tao Huang, Junzhuo Liu +2Efficient VLM InferenceLarge Vision-Language Models