Visual Token Merging

Momentum

1 paper in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 16

All topics
CardsList
  1. Aperture: Merge-Consistent Rotary States for Compressed Tokens

    Sep 29, 2026Yuhao Du, Shunian ChenRotary Positional EmbeddingsVisual Token Merging

  2. MergeOver: Post-Training Token Merging for Recursive Vision Transformers

    Aug 13, 2026Junseo Kim, Uraz Odyurt, Amirreza YousefzadehVision TransformerEfficient ViTs

  3. CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

    Aug 3, 2026Yu Chen, Xiaohong Li, Xiaole Wang +3Efficient VLM InferenceLarge Vision-Language Models

  4. ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression

    Jul 31, 2026Renjie Liang, Zijian Xu, Jinqian Pan +6Medical VLMsVisual Token Merging

  5. Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference

    Jul 17, 2026Tong Jin, Yunpeng Liu, Shuyu Hu +4Visual Place RecognitionEfficient ViTs

  6. Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

    Jul 6, 2026Suhyeong Park, Junha Jung, Jungwoo Park +1Token MergingMulti-Vector Retrieval

  7. Fusion: A Framework for Unified Sequential Token AdaptatIon in VisiOn TraNsformers

    Jul 1, 2026Aravind Pradeep, Samira Nazari, Mahdi Taheri +1Token MergingEfficient ViTs

  8. Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs

    Jun 28, 2026Junzhou Chen, Jindong Wang, Gang ZhouEfficient VLM InferenceVision-Language-Action Models

  9. Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers

    Jun 18, 2026Dong Hoon Lee, Seunghoon HongToken MergingDiffusion-Based Image Generation

  10. RAPID: Layer-Wise Redundancy-Aware Pruning and Importance-Driven Token Merging for Efficient ViT

    Jun 6, 2026Kyumin Choi, Ikbeom JangVision TransformerEfficient ViTs

  11. Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference

    Jun 1, 2026Hyeonwoo Cho, Donghyeon Baek, Yewon Kim +1Efficient Multimodal InferenceMultimodal Large Language Models

  12. MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

    May 29, 2026Luyuan Zhang, Siyuan Li, Zedong Wang +7Variational AutoencodersToken Merging

  13. AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers

    May 26, 2026Semi Lee, Hyejin Go, Hyesong ChoiToken MergingSelf-Attention

  14. G2^2TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models

    May 12, 2026Junxian Li, Kai Liu, Zizhong Ding +4Efficient Multimodal InferenceUnified Multimodal Models

  15. DORA: Dynamic Online Reinforcement Agent for Token Merging in Vision Transformers

    May 12, 2026Kaixuan He, Song Chen, Yi KangEfficient ViTsVisual Token Merging

  16. StructSAM: Structure- and Spectrum-Preserving Token Merging for Segment Anything Models

    Mar 7, 2026Duy M. H. Nguyen, Tuan A. Tran, Duong Nguyen +17Token MergingImage Segmentation