Multimodal Token Compression

Momentum

4 papers in the last four weeks, up 33% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 70

All topics
CardsList
  1. DIPrune: Task-Aware Token Pruning with Dual Importance for Efficient Multimodal Language Models

    Oct 6, 2026Shuo Yang, Changbai Li, Linlin Yang +6Multimodal Large Language ModelsToken Pruning

  2. ResComEmb: Effective and Efficient Multimodal Embedding via Residual Homogeneity Compression

    Sep 29, 2026Zijing Cai, Yuzhe Wang, Jingxian Zhu +2Multimodal IRMultimodal Embedding

  3. OmniRoute: Mapping Temporal Semantic Evidence to Audio-Visual Token Budgets for Efficient Omnimodal Large Language Models

    Sep 29, 2026Yuchen Deng, Zidang Cai, Feidiao Yang +4Efficient Multimodal InferenceAudio Token Compression

  4. SLICEChat: Progressive In-Encoder Token Pruning for Whole-Slide Pathology Language Models

    Sep 21, 2026Ali Kerem Bozkurt, Baris Cem Bakay, Ibrahim Kulac +3Efficient Multimodal InferenceMultimodal Large Language Models

  5. SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models

    Sep 1, 2026Shiyu Li, Zi-Yuan Hu, Shijia Huang +3Efficient VLM InferenceMultimodal Large Language Models

  6. Reading is not Reasoning: Bridging the Agentic Policy Gap in Vision-Text Compression

    Aug 9, 2026Cheng Fan, Junyi Zhou, Tingzhang Luo +5Cross-Modal Knowledge DistillationMultimodal Token Compression

  7. Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

    Aug 9, 2026Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim +1Efficient Multimodal InferenceAudio Token Compression

  8. VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

    Aug 9, 2026Yuqi Zhang, Cheng Chen, Yuyu Guo +6Vision-Language ModelsEfficient VLM Inference

  9. KVAE: Family of Tokenizers for Multimodal Generative Models

    Aug 6, 2026Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov +11Variational AutoencodersAudio Token Compression

  10. CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding

    Aug 5, 2026Zhenyu Yi, Qiang Hu, Zhenhao Li +33D Medical ImagingMedical VQA

  11. EvtGraph: Event-Adaptive Compression for Sparse Temporal Graph Learning in Multimodal Time Series

    Aug 5, 2026Ziqian Wang, Tingxiong Xiao, Yuxiao Cheng +1Irregular Time-Series ModelingEfficient Multimodal Inference

  12. OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

    Aug 4, 2026Wanshun Su, Yang Shi, Feihu Liu +10Efficient Multimodal InferenceAudio Token Compression

  13. Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression

    Aug 3, 2026Tianyu Liang, Xiangxi Zheng, Yilin Wang +1VLM AdaptationMultimodal Token Compression

  14. Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

    Aug 3, 2026Zhenghui Guo, Yilin Yang, Yuanbin Man +5Audio Token CompressionUnified Multimodal Models

  15. 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

    Aug 2, 2026Changwoo Baek, Kyeongbo KongMultimodal Token Compression3D VQA

  16. RAGOCR: Optical Compression of Retrieval-Augmented Text via Visual Representation

    Aug 1, 2026Jiayang Yu, Jialun Zhong, Lei ZouMultimodal RAGRetrieval-Augmented Generation

  17. CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

    Jul 31, 2026Wenxin Tang, Jingyu Xiao, Zhenyu Liu +6Efficient Multimodal InferenceMultimodal Large Language Models

  18. MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models

    Jul 29, 2026Yitao Zhu, Mengjun Liu, Yingji Fu +2Efficient VLM InferenceMedical VLMs

  19. OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

    Jul 28, 2026Haoyang Huang, Wenjie Huang, Tianqi Xu +14Efficient Multimodal InferenceAudio Token Compression

  20. OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

    Jul 25, 2026Jinsen Su, Yongdong Luo, Yuexiao Ma +3Efficient Multimodal InferenceAudio Token Compression

  21. Autoregressive EHR Foundation Models with Multimodal Inputs

    Jul 24, 2026Yuxuan Liu, Joshua Placidi, Jinpei Han +3Clinical Outcome PredictionMultimodal Token Compression

  22. Out of Sight, Still in Mind: Token Compression for Omni-LLMs

    Jul 23, 2026Suho Yoo, Youngjoon Jang, Hyebin Cho +1Efficient Multimodal InferenceMultimodal Large Language Models

  23. Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence

    Jul 23, 2026Jay Gor, Karm Dave, Akshita Abrol +3Efficient Multimodal InferenceVLM Quantization

  24. VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

    Jul 14, 2026Yupeng Zheng, Kai Zou, Bin Liu +1Efficient VLM InferenceLarge Vision-Language Models

  25. OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

    Jul 3, 2026Shijie Cao, Qingyu Zhang, Boxi Yu +6Efficient Multimodal InferenceMultimodal Large Language Models

  26. Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning

    Jul 2, 2026Xuehui Wang, Xuankun Yang, Wei ShenEfficient VLM InferenceMultimodal Token Compression

  27. ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

    Jun 30, 2026Yuhao Wang, Mu Qiao, Haiwen Diao +5Efficient VLM InferenceMultimodal Large Language Models

  28. AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

    Jun 29, 2026Kien T. Pham, I Chieh Chen, Qifeng Chen +1Audio-Video GenerationAudio-Visual Alignment

  29. HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

    Jun 26, 2026Artem Ploujnikov, Francesco Verdini, Samir Sadok +1Neural Audio CodecsMultimodal Token Compression

  30. TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

    Jun 25, 2026Tinghao Wang, Yichen Guo, Rui Huang +11Efficient VLM InferenceMultimodal Large Language Models

  31. AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

    Jun 23, 2026Yijing Chen, Wenhui Tan, Xiaoyi Yu +7Audio-Visual UnderstandingMultimodal Large Language Models

  32. Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

    Jun 23, 2026Bin Chen, Yuxiang Cai, Yadan Luo +3Efficient Multimodal InferenceMultimodal Large Language Models

  33. Beyond Uniform Tokens: Adaptive Compression for Time Series Language Models

    Jun 11, 2026Jialin Gan, Xin Qiu, Guangzhe Chen +1LLM Inference AccelerationMultimodal Token Compression

  34. Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning

    Jun 10, 2026Zhirui Chen, Ziwei Chen, Ling ShaoMemory-Augmented Language ModelsMultimodal ICL

  35. One Token per Multimodal Evidence: Latent Memory for Resource-Constrained QA

    Jun 9, 2026Zhi Zheng, Ziqiao Meng, Hao Luan +2Multimodal RAGMultimodal Memory

  36. Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning

    Jun 9, 2026Zihan Meng, Dexiang Hong, Weidong Chen +3Audio-Visual UnderstandingMultimodal Token Compression

  37. Planning-aligned Token Compression for Long-Context Autonomous Driving

    Jun 5, 2026Zhixuan Liang, Yuxiao Chen, Yurong You +12End-to-End Autonomous DrivingVector-Quantized Variational Autoencoder

  38. Differentiable Efficient Operator Search

    Jun 3, 2026Xiaohuan Pei, Jiyuan Zhang, Yuanfan Guo +4Efficient Multimodal InferenceMultimodal Token Compression

  39. InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models

    Jun 1, 2026Xinxin Liu, Shiwei Gan, Xiao Liu +3Efficient VLM InferenceVideo-Language Models

  40. On the Limits of Token Reduction for Efficient Unified Vision Language Training

    May 31, 2026Siyi Chen, Weiming Zhuang, Jingtao Li +1Vision-Language ModelsUnified Multimodal Models

  41. ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs

    May 30, 2026Yiling Gao, Hongchen Wei, Zhenzhong ChenEfficient VLM InferenceLarge Vision-Language Models

  42. OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

    May 26, 2026Guangzhi Sun, Yixuan Li, Yudong Yang +1Streaming Video UnderstandingMultimodal Large Language Models

  43. O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

    May 26, 2026Peiran Wu, Yunze Liu, Chi-Hao Wu +2Audio-Visual UnderstandingEfficient Multimodal Inference

  44. ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs

    May 21, 2026Bingjun Luo, Tony Wang, Chaoqi Chen +1Multimodal Token CompressionVideo Token Compression

  45. Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding

    May 21, 2026Bingjun Luo, Tony Wang, Hanqi Chen +1Video-Language ModelsMultimodal Token Compression

  46. Stage-adaptive Token Selection for Efficient Omni-modal LLMs

    May 19, 2026Zijie Xin, Jie Yang, Ruixiang Zhao +4Efficient Multimodal InferenceMultimodal Large Language Models

  47. OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

    May 12, 2026Yuchen Deng, Zidang Cai, Hai-Tao Zheng +3Audio-Visual UnderstandingEfficient Multimodal Inference

  48. Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs

    May 12, 2026Chaeyoung Jung, Kyeongha Rho, Joon Son ChungAudio-Visual UnderstandingEfficient Multimodal Inference

  49. How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A

    May 9, 2026YiJie Huang, Yiqun Zhang, Zhuoyue Jia +7Efficient VLM InferenceLarge Vision-Language Models

  50. HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

    May 4, 2026Haopeng Jin, Hongzhu Yi, Wenlong Zhao +6Video UnderstandingVideo-Language Models

  51. HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

    Apr 26, 2026Peize He, Yaodi Luo, Xiaoqian Liu +7Audio Token CompressionSelf-Attention