Visual Tokenization

Momentum

2 papers in the last four weeks, with none the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 43

All topics
CardsList
  1. QuadTok: Quadtree Visual Tokenizer for Autoregressive Image Generation

    Oct 7, 2026Yucheng Mao, Zeyuan Chen, Xiaojun Shan +4Visual TokenizationAutoregressive Image Generation

  2. SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

    Sep 30, 2026Mikhail Dereviannykh, Vikram Voleti, Simon Donne +3Visual TokenizationAutoregressive Video Generation

  3. LoopVAE: Recurrent Depth Across Scales for Visual Tokenization

    Sep 11, 2026Zhiying LuVariational AutoencodersAutoencoders

  4. One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

    Jul 30, 2026Rui Tang, Wentao Yang, Peirong Zhang +4Visual TokenizationScene Text Recognition

  5. Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

    Jul 27, 2026Senqiao Yang, Kaichen Zhang, Zhaoyang Jia +20Vision-Language ModelsEfficient VLM Inference

  6. ReFace: Reorganizing Facial Spatiotemporal Representations for Improved Pain Assessment

    Jul 22, 2026Stefanos Gkikas, Yu Fang, Christian Arzate Cruz +2Visual Tokenization

  7. VQ-Transplant: Efficient VQ-Module Integration for Pre-trained Visual Tokenizers

    Jul 21, 2026Xianghong Fang, Yuan Yuan, Dehan Kong +1Visual TokenizationImage Reconstruction

  8. Subtoken Vision Transformer for Fine-grained Recognition

    Jul 10, 2026Jie Zhu, Ivy Zhang, Minchul Kim +1Vision TransformerVisual Tokenization

  9. TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization

    Jun 16, 2026Weiliang Chen, Yuanhui Huang, Xuebo Wang +1Visual TokenizationVideo Token Compression

  10. RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

    Jun 11, 2026Junke Wang, Qihang Zhang, Shuai Yang +5Latent Action LearningWorld Models for Robotics

  11. HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

    Jun 11, 2026Guozhen Zhang, Xuerui Qiu, Yutao Cui +11Unified Multimodal ModelsVision Transformer

  12. ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

    Jun 9, 2026Junke Wang, Xiao Wang, Jiacheng Pan +16Text-Guided Image EditingUnified Multimodal Models

  13. AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

    Jun 5, 2026Xiaocheng Lu, Yuxi Chen, Jie Zhang +5Image TokenizationVisual Tokenization

  14. Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting

    Jun 4, 2026Kevin Dave, Sai Aditya Patkuri, Chhaya Kumar Das +3Visual TokenizationVideo Token Compression

  15. Balancing Image Compression and Generation with Bootstrapped Tokenization

    Jun 4, 2026Haozhe Chi, Jinghan Li, Hao Jiang +4Learned Image CompressionImage Tokenization

  16. ChannelTok: Efficient Flexible-Length Vision Tokenization

    Jun 3, 2026Sukriti Paul, Arpit Bansal, Tom GoldsteinImage TokenizationVisual Tokenization

  17. AdaCodec: A Predictive Visual Code for Video MLLMs

    Jun 1, 2026Haowen Hou, Zhen Huang, Zheming Liang +8Predictive CodingEfficient VLM Inference

  18. Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering

    Jun 1, 2026Dongxing Mao, Jinpeng Wang, Jiahao Tang +6Image TokenizationVisual Tokenization

  19. MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

    May 29, 2026Luyuan Zhang, Siyuan Li, Zedong Wang +7Variational AutoencodersToken Merging

  20. PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding

    May 28, 2026Selim Kuzucu, Alessio Tonioni, Vasile Lup +3Image TokenizationEfficient VLM Inference

  21. Structure over Pixels: Learning Variable-Length Visual Programs

    May 26, 2026Piotr Wyrwiński, Kacper Dobek, Krzysztof KrawiecVisual Representation LearningImage Tokenization

  22. Channel-wise Vector Quantization

    May 25, 2026Wei Song, Tianhang Wang, Yitong Chen +5Image TokenizationVisual Tokenization

  23. LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

    May 25, 2026Xiang An, Yin Xie, Feilong Tang +27VLM EvaluationTemporal Video Grounding

  24. Vision Foundation Models as Generalist Tokenizers for Image Generation

    May 18, 2026Anlin Zheng, Qi Han, Xin Wen +5Vision Foundation ModelsImage Tokenization

  25. WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens

    May 18, 2026Yiwei Guo, Shaobin Zhuang, Zhipeng Huang +4Image TokenizationUnified Multimodal Models

  26. A More Word-like Image Tokenization for MLLMs

    May 18, 2026Hyun Lee, Hyemin Jeong, Yejin Kim +4Image TokenizationEfficient VLM Inference

  27. Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization

    May 11, 2026Xuanyu Zhu, Yan Bai, Yang Shi +4AutoencodersVisual Tokenization

  28. Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs

    May 10, 2026Yigui Feng, Qinglin Wang, Yang Liu +1Efficient VLM InferenceVisual Tokenization

  29. Learning Discrete Autoregressive Priors with Wasserstein Gradient Flow

    May 7, 2026Bowen Zheng, Yihong Luo, Tianyang HuImage TokenizationVisual Tokenization

  30. MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality

    May 7, 2026Panqi Yang, Haodong Jing, Jiahao Chao +5Visual Representation LearningImage Tokenization

  31. Visual Text Compression as Measure Transport

    May 6, 2026Lv Tang, Tianyi Zheng, Yang Liu +2Efficient VLM InferenceVisual Tokenization

  32. ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters

    May 6, 2026Philippe Hansen-Estruch, Jiahui Chen, Vivek Ramanujan +9Image TokenizationAutoencoders

  33. End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

    May 1, 2026Wenda Chu, Bingliang Zhang, Jiaqi Han +4Image TokenizationVisual Tokenization

  34. VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

    Apr 27, 2026Maitreya Patel, Jingtao Li, Weiming Zhuang +2Image TokenizationVisual Tokenization

  35. COMiT: Learning Structured Visual Tokens through Sequential Communication

    Feb 24, 2026Aram Davtyan, Yusuf Sahin, Yasaman Haghighi +4Image TokenizationVisual Tokenization

  36. Spiking Patches: Asynchronous, Sparse, and Efficient Tokens for Event Cameras

    Oct 30, 2025Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros NalpantidisEvent-Based VisionVisual Tokenization

  37. Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

    Date pendingGuiqiu Liao, Matjaz Jogan, Daniel A. HashimotoImage TokenizationHealthcare