Visual Tokenizers

Momentum

3 papers in the last four weeks, down 40% on the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 62

All topics
CardsList
  1. SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

    Sep 30, 2026Mikhail Dereviannykh, Vikram Voleti, Simon Donne +3Visual TokenizersAutoregressive Video Generation

  2. NesTok: Nested Self-Aligned 1D Tokenizer for Autoregressive Image Generation

    Sep 29, 2026Jiawei Zhang, Shuhao Liu, Rong Huang +4Autoregressive Image GenerationVisual Tokenizers

  3. What Makes a Good Medical Image Tokenizer? Rethinking Reconstruction and Generation in Medical Image Tokenization

    Sep 21, 2026Niklas Bubeck, Yundi Zhang, Vasiliki Sideri-Lampretsa +4Medical Image GenerationVisual Tokenizers

  4. VideoTok4D: A 4D-Aware Video Tokenizer for Compact World Representation

    Sep 14, 2026Xinyi Chen, Hanxin Zhu, Xijun Wang +4Visual TokenizersVideo Diffusion Models

  5. LoopVAE: Recurrent Depth Across Scales for Visual Tokenization

    Sep 11, 2026Zhiying LuVisual TokenizersImagenet

  6. V-RAE: Rethinking Video Latent Spaces for Generation

    Aug 13, 2026Minghui Guo, Shengqiong Wu, Hao FeiAutoregressive Video GenerationStar-Vae

  7. Tokenizer-Generator Coupling in Medical Image Generation

    Aug 7, 2026Liam ChalcroftMedical Image GenerationVisual Tokenizers

  8. KVAE: Family of Tokenizers for Multimodal Generative Models

    Aug 6, 2026Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov +11Visual TokenizersStar-Vae

  9. Token Radius Attention for Efficient Video Generation

    Aug 3, 2026Jiayu Chen, Zhikun Jiang, Maoliang Li +6Spatio-Temporal AttentionVisual Tokenizers

  10. VQ-Transplant: Efficient VQ-Module Integration for Pre-trained Visual Tokenizers

    Jul 21, 2026Xianghong Fang, Yuan Yuan, Dehan Kong +1Residual Vector QuantizationVisual Tokenizers

  11. Pixel-Space Diffusion Transformers

    Jul 20, 2026Renye Yan, Jikang Cheng, You Wu +8Diffusion TransformersVisual Tokenizers

  12. Test-Time Registers as Global Priors for Tokenized Image Generation

    Jul 18, 2026Cheng-Yao Hong, Yifan Wang, Yuewei Lin +1Visual TokenizersSingle-Cell Foundation Models

  13. SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

    Jul 10, 2026Hyein Park, Namho Kim, Junhwa KimFacial Expression RecognitionAttitude

  14. Subtoken Vision Transformer for Fine-grained Recognition

    Jul 10, 2026Jie Zhu, Ivy Zhang, Minchul Kim +1Self-Supervised Vision TransformersVisual Tokenizers

  15. SpiralFovea: Input-Adaptive Foveated Tokenization as a Third Lever of Resource-Adaptive Inference

    Jul 1, 2026Kyan Mahajan, Mohammad SaqlainParameter-Efficient Fine-Tuning MethodsWireless Foundation Models

  16. Steal the Patch Size: Adversarially Manipulate Vision-Language Models

    Jun 30, 2026Kai Hu, Akash Bharadwaj, Weichen Yu +1Visual TokenizersPreprocessing

  17. TaskTok: Delving into Task Tokens for Task-driven Image Restoration

    Jun 25, 2026Hongjae Lee, Sojung Kang, Jaeseong Yu +1Image RestorationVisual Tokenizers

  18. Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space

    Jun 19, 2026Yue Cao, Jianyang Gu, Vyacheslav Kungurtsev +4Diffusion-Based Dataset DistillationDataset Distillation

  19. Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers

    Jun 18, 2026Dong Hoon Lee, Seunghoon HongDiffusion TransformersVisual Tokenizers

  20. Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

    Jun 16, 2026Wujian Peng, Lingchen Meng, Yuxuan Cai +7Visual TokenizersAutoregressive Language Models

  21. TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization

    Jun 16, 2026Weiliang Chen, Yuanhui Huang, Xuebo Wang +1Visual TokenizersVideo Compression

  22. RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

    Jun 11, 2026Junke Wang, Qihang Zhang, Shuai Yang +5Efficient World-Action ModelDiscrete Action Tokenizers

  23. HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

    Jun 11, 2026Guozhen Zhang, Xuerui Qiu, Yutao Cui +11Visual TokenizersFine-Grained Video Understanding

  24. AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

    Jun 5, 2026Xiaocheng Lu, Yuxi Chen, Jie Zhang +5Visual TokenizersLong Visual-Token Sequences

  25. Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting

    Jun 4, 2026Kevin Dave, Sai Aditya Patkuri, Chhaya Kumar Das +3Visual TokenizersSpatio-Temporal Attention

  26. Balancing Image Compression and Generation with Bootstrapped Tokenization

    Jun 4, 2026Haozhe Chi, Jinghan Li, Hao Jiang +4Visual TokenizersAutoregressive Image Generation

  27. ChannelTok: Efficient Flexible-Length Vision Tokenization

    Jun 3, 2026Sukriti Paul, Arpit Bansal, Tom GoldsteinVisual TokenizersCnn-Transformer Tradeoff

  28. Diffusing in the Right Space: A Systematic Study of Latent Diffusability

    Jun 2, 2026Tianxiong Zhong, Xingye Tian, Xuebo Wang +2Visual TokenizersDiffusion Dynamics

  29. FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation

    Jun 1, 2026Xueji Fang, Liyuan Ma, Jianhao Zeng +3Diffusion TransformersVisual Tokenizers

  30. Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering

    Jun 1, 2026Dongxing Mao, Jinpeng Wang, Jiahao Tang +6Autoregressive Image GenerationVisual Tokenizers

  31. MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

    May 29, 2026Luyuan Zhang, Siyuan Li, Zedong Wang +7Visual TokenizersVisual Generation

  32. Structure over Pixels: Learning Variable-Length Visual Programs

    May 26, 2026Piotr Wyrwiński, Kacper Dobek, Krzysztof KrawiecVisual TokenizersSemantic Scene Understanding

  33. Channel-wise Vector Quantization

    May 25, 2026Wei Song, Tianhang Wang, Yitong Chen +5Autoregressive Image GenerationVisual Tokenizers

  34. RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution

    May 20, 2026Siyong Jian, Siyuan Li, Luyuan Zhang +5Text-To-ImageVisual Tokenizers

  35. Vision Foundation Models as Generalist Tokenizers for Image Generation

    May 18, 2026Anlin Zheng, Qi Han, Xin Wen +5Visual TokenizersVision Foundation Models

  36. WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens

    May 18, 2026Yiwei Guo, Shaobin Zhuang, Zhipeng Huang +4Visual Tokenizers

  37. A More Word-like Image Tokenization for MLLMs

    May 18, 2026Hyun Lee, Hyemin Jeong, Yejin Kim +4Long Visual-Token SequencesVisual Tokenizers

  38. Hierarchical Image Tokenization for Multi-Scale Image Super Resolution

    May 14, 2026Isma Hadji, Enrique Sanchez, Adrian Bulat +2Generative Super-ResolutionVisual Tokenizers

  39. Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization

    May 11, 2026Xuanyu Zhu, Yan Bai, Yang Shi +4Visual TokenizersVision Encoders

  40. Mutual Enhancement Between Global Tokens and Patch Tokens: From Theory to Practice

    May 11, 2026Xiusheng Huang, Xin Jiang, Jun Zhao +2Visual TokenizersTokan

  41. GEM: Generating LiDAR World Model via Deformable Mamba

    May 8, 2026Yang Wu, Zhaojiang Liu, Qiang Meng +5LidarLatent World Models

  42. Taming the Entropy Cliff: Variable Codebook Size Quantization for Autoregressive Visual Generation

    May 7, 2026Bowen Zheng, Weijian Luo, Guang Yang +2CodebooksAutoregressive Image Generation

  43. Learning Discrete Autoregressive Priors with Wasserstein Gradient Flow

    May 7, 2026Bowen Zheng, Yihong Luo, Tianyang HuVisual TokenizersAutoregressive Image Generation

  44. MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality

    May 7, 2026Panqi Yang, Haodong Jing, Jiahao Chao +5Visual TokenizersSelf-Supervised Vision Transformers

  45. ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters

    May 6, 2026Philippe Hansen-Estruch, Jiahui Chen, Vivek Ramanujan +9Visual TokenizersVision Transformer

  46. Taming Outlier Tokens in Diffusion Transformers

    May 6, 2026Xiaoyu Wu, Yifei Wang, Tsu-Jui Fu +3Diffusion TransformersVisual Tokenizers

  47. End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

    May 1, 2026Wenda Chu, Bingliang Zhang, Jiaqi Han +4Autoregressive Image GenerationVisual Tokenizers

  48. YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

    Apr 30, 2026Chenyang Wu, Lina Lei, Fan Li +6Video Object RemovalVideo Object Segmentation

  49. VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

    Apr 27, 2026Maitreya Patel, Jingtao Li, Weiming Zhuang +2Autoregressive Image GenerationVisual Tokenizers

  50. E2E-WAVE: End-to-End Learned Waveform Generation for Underwater Video Multicasting

    Apr 18, 2026Khizar Anjum, Tingcong Jiang, Dario PompiliWaveformsVideo Coding

  51. (1D) Ordered Tokens Enable Efficient Test-Time Search

    Apr 16, 2026Zhitong Gao, Parham Rezaei, Ali Cy +7Autoregressive Image GenerationAutoregressive Generation

  52. COMiT: Learning Structured Visual Tokens through Sequential Communication

    Feb 24, 2026Aram Davtyan, Yusuf Sahin, Yasaman Haghighi +4Visual TokenizersSelf-Supervised Vision Transformers

  53. LGQ: Learnable Geometric Quantization for Image Tokenization

    Feb 17, 2026Idil Bilge Altun, Mert Onur Cakiroglu, Elham Buxton +2CodebooksVisual Tokenizers