Video Token Compression

Latest papers 44

All topics
CardsList
  1. VEDJE: Video-Efficient Discriminative Joint Encoder for Scalable Video-Text Retrieval

    Oct 8, 2026Shahaf Wagner, Gabriele Serussi, Dan Ben Ami +2Video RetrievalVision-Language Retrieval

  2. Video Encoders Built on Image Representations

    Oct 5, 2026Jusheng Zhang, Wenhao Wang, Longqi Cai +3Video-Language ModelsVideo Representation Learning

  3. VETO: Video Efficient Token Optimization for Vision Language Models

    Oct 1, 2026Gueter Josmy Faure, Hao Ping Wang, Min-Hung Chen +1Efficient VLM InferenceLarge Vision-Language Models

  4. SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

    Sep 30, 2026Mikhail Dereviannykh, Vikram Voleti, Simon Donne +3Visual TokenizationAutoregressive Video Generation

  5. CoVisco: Codec-Native Vision Encoder with Native Token Compression for Unified Image-Video Understanding

    Sep 30, 2026Yulong Liu, Xiaotian Han, Junyuan Shang +6Video UnderstandingEfficient VLM Inference

  6. DeCoPrune: Efficient KV-Cache Pruning for Autoregressive Video Diffusion via Denoising Consistency

    Sep 30, 2026Zeqi Xiao, Qingle Liu, Kaiwen Zhang +3KV-Cache ManagementAutoregressive Video Generation

  7. OmniRoute: Mapping Temporal Semantic Evidence to Audio-Visual Token Budgets for Efficient Omnimodal Large Language Models

    Sep 29, 2026Yuchen Deng, Zidang Cai, Feidiao Yang +4Efficient Multimodal InferenceAudio Token Compression

  8. GleanVID: Complementary Token Selection for Efficient Video Large Language Models

    Sep 29, 2026Shuo Yang, Changbai Li, Rui Tang +3Efficient VLM InferenceVideo-Language Models

  9. Compress to Remember: Learning Compact Memory via On-Policy Distillation for Long Video Generation

    Sep 28, 2026Xiaoyu Wu, Weihang Guo, Yifei Wang +3Video Diffusion ModelsLong Video Generation

  10. Rethinking Visual Token Compression for Video Large Language Models: A Simple Yet Strong Baseline

    Sep 28, 2026Xiao Zhang, Wang Zeng, Sheng Jin +3Video UnderstandingVideo-Language Models

  11. Summarize Before Grounding: Query-Guided Chunk Condensation for Long-Video Temporal Grounding

    Sep 28, 2026Nanxing Hu, Xiaoyue Duan, Qiwei Yan +3Temporal Video GroundingVideo Token Compression

  12. VideoTok4D: A 4D-Aware Video Tokenizer for Compact World Representation

    Sep 14, 2026Xinyi Chen, Hanxin Zhu, Xijun Wang +4Video Diffusion ModelsVideo Token Compression

  13. KVAE: Family of Tokenizers for Multimodal Generative Models

    Aug 6, 2026Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov +11Variational AutoencodersAudio Token Compression

  14. Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

    Aug 3, 2026Zhenghui Guo, Yilin Yang, Yuanbin Man +5Audio Token CompressionUnified Multimodal Models

  15. CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

    Aug 3, 2026Yu Chen, Xiaohong Li, Xiaole Wang +3Efficient VLM InferenceLarge Vision-Language Models

  16. Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

    Aug 2, 2026Jiayang He, Tianling Xu, Diancheng Kang +4Efficient VLM InferenceVideo-Language Models

  17. Think in Sets for Streaming Video Token Compression

    Aug 2, 2026Moxu Duan, Jingwen Fu, Yuwang WangVideo Token CompressionVisual Token Pruning

  18. OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

    Jul 28, 2026Haoyang Huang, Wenjie Huang, Tianqi Xu +14Efficient Multimodal InferenceAudio Token Compression

  19. WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

    Jul 25, 2026Yuhui Zeng, Wang Chen, Jinfa Huang +5Efficient VLM InferenceVideo Token Compression

  20. Out of Sight, Still in Mind: Token Compression for Omni-LLMs

    Jul 23, 2026Suho Yoo, Youngjoon Jang, Hyebin Cho +1Efficient Multimodal InferenceMultimodal Large Language Models

  21. GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models

    Jul 10, 2026Guohuan Xie, Mengqi Lei, Chuan Shi +3Efficient VLM InferenceVideo-Language Models

  22. STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation

    Jul 3, 2026Syed Ariff Syed Hesham, Yun Liu, Guolei Sun +4Video ReasoningReasoning Segmentation

  23. AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

    Jun 23, 2026Yijing Chen, Wenhui Tan, Xiaoyi Yu +7Audio-Visual UnderstandingMultimodal Large Language Models

  24. TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization

    Jun 16, 2026Weiliang Chen, Yuanhui Huang, Xuebo Wang +1Visual TokenizationVideo Token Compression

  25. Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting

    Jun 4, 2026Kevin Dave, Sai Aditya Patkuri, Chhaya Kumar Das +3Visual TokenizationVideo Token Compression

  26. AdaCodec: A Predictive Visual Code for Video MLLMs

    Jun 1, 2026Haowen Hou, Zhen Huang, Zheming Liang +8Predictive CodingEfficient VLM Inference

  27. InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models

    Jun 1, 2026Xinxin Liu, Shiwei Gan, Xiao Liu +3Efficient VLM InferenceVideo-Language Models

  28. EarlyTom: Early Token Compression Completes Fast Video Understanding

    May 28, 2026Hesong Wang, Xin Jin, Lu Lu +4Video UnderstandingEfficient VLM Inference