Visual Tokenization

Momentum

2 papers in the last four weeks, with none the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 44

All topics
CardsList
  1. QuadTok: Quadtree Visual Tokenizer for Autoregressive Image Generation

    Oct 7, 2026Yucheng Mao, Zeyuan Chen, Xiaojun Shan +4Visual TokenizationAutoregressive Image Generation

  2. SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

    Sep 30, 2026Mikhail Dereviannykh, Vikram Voleti, Simon Donne +3Visual TokenizationAutoregressive Video Generation

  3. LoopVAE: Recurrent Depth Across Scales for Visual Tokenization

    Sep 11, 2026Zhiying LuVariational AutoencodersAutoencoders

  4. One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

    Jul 30, 2026Rui Tang, Wentao Yang, Peirong Zhang +4Visual TokenizationScene Text Recognition

  5. Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

    Jul 27, 2026Senqiao Yang, Kaichen Zhang, Zhaoyang Jia +20Vision-Language ModelsEfficient VLM Inference

  6. ReFace: Reorganizing Facial Spatiotemporal Representations for Improved Pain Assessment

    Jul 22, 2026Stefanos Gkikas, Yu Fang, Christian Arzate Cruz +2Visual Tokenization

  7. VQ-Transplant: Efficient VQ-Module Integration for Pre-trained Visual Tokenizers

    Jul 21, 2026Xianghong Fang, Yuan Yuan, Dehan Kong +1Visual TokenizationImage Reconstruction

  8. Subtoken Vision Transformer for Fine-grained Recognition

    Jul 10, 2026Jie Zhu, Ivy Zhang, Minchul Kim +1Vision TransformerVisual Tokenization

  9. TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization

    Jun 16, 2026Weiliang Chen, Yuanhui Huang, Xuebo Wang +1Visual TokenizationVideo Token Compression

  10. RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

    Jun 11, 2026Junke Wang, Qihang Zhang, Shuai Yang +5Latent Action LearningWorld Models for Robotics

  11. HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

    Jun 11, 2026Guozhen Zhang, Xuerui Qiu, Yutao Cui +11Unified Multimodal ModelsVision Transformer

  12. ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

    Jun 9, 2026Junke Wang, Xiao Wang, Jiacheng Pan +16Text-Guided Image EditingUnified Multimodal Models

  13. AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

    Jun 5, 2026Xiaocheng Lu, Yuxi Chen, Jie Zhang +5Image TokenizationVisual Tokenization

  14. Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting

    Jun 4, 2026Kevin Dave, Sai Aditya Patkuri, Chhaya Kumar Das +3Visual TokenizationVideo Token Compression

  15. Balancing Image Compression and Generation with Bootstrapped Tokenization

    Jun 4, 2026Haozhe Chi, Jinghan Li, Hao Jiang +4Learned Image CompressionImage Tokenization

  16. ChannelTok: Efficient Flexible-Length Vision Tokenization

    Jun 3, 2026Sukriti Paul, Arpit Bansal, Tom GoldsteinImage TokenizationVisual Tokenization

  17. AdaCodec: A Predictive Visual Code for Video MLLMs

    Jun 1, 2026Haowen Hou, Zhen Huang, Zheming Liang +8Predictive CodingEfficient VLM Inference

  18. Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering

    Jun 1, 2026Dongxing Mao, Jinpeng Wang, Jiahao Tang +6Image TokenizationVisual Tokenization

  19. MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

    May 29, 2026Luyuan Zhang, Siyuan Li, Zedong Wang +7Variational AutoencodersToken Merging

  20. PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding

    May 28, 2026Selim Kuzucu, Alessio Tonioni, Vasile Lup +3Image TokenizationEfficient VLM Inference

  21. Structure over Pixels: Learning Variable-Length Visual Programs

    May 26, 2026Piotr Wyrwiński, Kacper Dobek, Krzysztof KrawiecVisual Representation LearningImage Tokenization

  22. Channel-wise Vector Quantization

    May 25, 2026Wei Song, Tianhang Wang, Yitong Chen +5Image TokenizationVisual Tokenization

  23. LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

    May 25, 2026Xiang An, Yin Xie, Feilong Tang +27VLM EvaluationTemporal Video Grounding

  24. Vision Foundation Models as Generalist Tokenizers for Image Generation

    May 18, 2026Anlin Zheng, Qi Han, Xin Wen +5Vision Foundation ModelsImage Tokenization

  25. WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens

    May 18, 2026Yiwei Guo, Shaobin Zhuang, Zhipeng Huang +4Image TokenizationUnified Multimodal Models