Diffusion Transformers

Latest papers 281

All topics
CardsList
  1. Learning to Read the Contextual Tokens in Diffusion Transformers

    Oct 5, 2026Omer Dahary, Etai Sella, Hadar Averbuch-Elor +2Diffusion Transformers

  2. MC-Sparse: Deconstructing and Closing the Dense-Sparse Attention Gap in Diffusion Transformers

    Oct 5, 2026Jiarui Chen, Zeqiang Lai, Jiangshan Wang +5Diffusion Transformers

  3. CentriQ: Calibration-Free Quantization of Diffusion Transformers via Exact Mean Centering

    Oct 5, 2026Nataša Jovanović, Mathieu Salzmann, Saqib JavedDiffusion Transformers

  4. Level-of-Token Diffusion

    Oct 5, 2026Kiyohiro Nakayama, Brian Chao, Jan Ackermann +5Diffusion TransformersVisual Tokenizers

  5. LiFT: Loop Flow Transformers

    Oct 4, 2026Mohammad Mahdi Derakhshani, Pedro M. P. Curvo, Gertjan J. Burghouts +2Diffusion Transformers

  6. Diffusion Transformers are Provably Optimal In-context Generators

    Oct 4, 2026Guoji Fu, Tomoya Wakayama, Ryotaro Kawata +3Diffusion TransformersIn-Context Learning

  7. Embedding Prediction Helps Image Generation

    Oct 1, 2026Sihan Xu, Ji Xie, Zilin Wang +2Diffusion TransformersImage Generation

  8. Joint Branch-Space Transform Coding for Diffusion Activation Quantization with Classifier-Free Guidance

    Oct 1, 2026Mingrun Jiang, Yuejia Liu, Zishan Shao +11Diffusion TransformersClassifier-Free Guidance

  9. Geometric Similarity in VLM Low-Level Vision Representations

    Oct 1, 2026Shao-Jun Xia, Huixin Zhang, Zhen Lei +3Recent Vision-Language ModelsDiffusion Transformers

  10. PixelDense: Dense Prediction as Representation Alignment for Pixel Diffusion

    Sep 30, 2026Lehan Yang, Daiqing Qi, Wenhao Zhang +9Dense PredictionDiffusion Transformers

  11. Looped Diffusion Transformer

    Sep 30, 2026Yong Xien Chng, Tianyi Chen, Wenwen Tong +7Diffusion Transformers

  12. D-Scope: Decomposing and Steering Diffusion Transformers with Sparse Autoencoders

    Sep 30, 2026Xinyue Xu, Jiahao Zhang, Lijie Hu +2Diffusion TransformersDiffusion Models

  13. ECHO-G: Embodied Co-speech Humanoid mOtion Generation

    Sep 30, 2026Yizhao Li, Pusen Gao, Ming Wang +3Co-Speech Gesture GenerationHuman Motion Generation

  14. Discrete Forcing: Infusing Discrete Guidance into Continuous Denoising for Few-Step Action Experts

    Sep 30, 2026Jingbo Wang, Wenxuan Song, Wenhao Yu +6Diffusion TransformersAction Expert

  15. ResARC: Residual-Aware AutoRegressive Coding for Ultra-Low Bitrate Image Compression

    Sep 30, 2026Qin Yan, Ruixiao Dong, Yutao Xie +5Ultra-Low BitratesAutoregressive Image Generation

  16. Co-PiLOT: Constrained Physics-Informed Latent Optimization for Target-Driven Inverse Design

    Sep 29, 2026Mahish K. Guru, Mayank Nagar, Ayush vyas +3Generative Inverse DesignInverse Design

  17. NowcastDiT: Diffusion Transformers are Effective Precipitation Nowcasters

    Sep 29, 2026Haoran Xu, Xingzhuo Guo, Yuchen Zhang +3Precipitation NowcastingDiffusion Transformers

  18. FastVR: Efficient Streaming Video Restoration with One-Step Diffusion

    Sep 29, 2026Xiaoxu Chen, Qin Yang, Haoran Bai +2Video RestorationDiffusion Transformers

  19. FlowTool: Controlling Tool Parameter in Image Retouching via Flow Matching

    Sep 28, 2026Thanh-Long V. Le, Steven Walton, Seunghyun Yoon +4Image EditingMulti-Reference Image Generation

  20. Scaffold Then Internalize: Representation Injection for Diffusion Transformers

    Sep 28, 2026Han Fu, Jiacheng Chen, Baoquan Zhao +4Diffusion TransformersTransformer Architectures

  21. What Visual Generators Need from Teachers: Rethinking Representation Alignment

    Sep 28, 2026Yongcong Wang, Hingchin Chen, Mingyu Fan +6Diffusion AlignmentDiffusion Transformers

  22. TSGate: Timestep-Aware Gated Attention for Diffusion Transformers

    Sep 28, 2026Boyu Zhang, Yifan Liu, Shuxia Lin +3Diffusion TransformersVideo Generation

  23. KiT: A Foundation Model for Financial Time-Series Forecasting using DiffusionTransformers

    Sep 28, 2026Boyu Zhang, Haorui LiTime Series Foundation ModelsTime Series Forecasting

  24. TLC-DiT: Task-Aligned Local Visual Conditioning for Robust Multitask Robot Manipulation

    Sep 28, 2026Xianbo Cai, Hideyuki Ichiwara, Zihang Wang +2Robotic ManipulationDiffusion Transformers

  25. Residual-Stream Burden Shapes Representation Learning in Diffusion Transformers

    Sep 27, 2026Tongtong Liang, Siqi Kou, Ziqiao Xi +6Diffusion TransformersTransformer Residual Streams

  26. GeoShrink: Accelerating Diffusion Transformers with Two Lines of Code

    Sep 27, 2026Haosen Li, Wenshuo Chen, Shaofeng Liang +3Diffusion TransformersGeogs-Slam

  27. Fill2SR: Repurposing Inpainting Diffusion Transformers for Real-World Super-Resolution

    Sep 27, 2026Xingfu Yi, Xiaoxue YuReal-World Image Super-ResolutionInpainting

  28. In-Token Learning for High-Fidelity Image Restoration via Diffusion Transformers

    Sep 27, 2026Xingfu Yi, Xiaoxue YuImage RestorationDiffusion Transformers

  29. Chameleon: Dynamic Format Adapter for Efficient Diffusion

    Sep 27, 2026Arnab Sanyal, Sandeep ChinchaliDiffusion Transformers

  30. KwaiMind Technical Report

    Sep 22, 2026Boheng Zhang, Fan Yang, Jia Sun +14Image EditingTechnical Report

  31. ForeDrive: Foresight-Guided End-to-End Autonomous Driving with a Planning-Relevant Latent World Model

    Sep 22, 2026Sinuo Wang, Zichong Gu, Yuhan Huang +10Causality-Aware End-To-End Autonomous DrivingAutonomous Driving

  32. MM-Future: Multi-Mode Joint World-Action Modeling for Autonomous Driving

    Sep 17, 2026Shuai Liu, Hechangle Gong, Hao Jiang +5Autonomous DrivingEfficient World-Action Model

  33. SlotDiT: Object-Centric Representations for Diffusion Transformers

    Sep 15, 2026Gjergj Plepi, Sven BehnkeDiffusion TransformersVideo Generation

  34. Temporal-Attention Head Specialization During Video Diffusion Training

    Sep 14, 2026Taewoo Ha, Shafayat Mowla Anik, Dae Yeol Lee +2Temporal AttentionDiffusion Transformers

  35. Exploring Diffusion Transformers for Cross-Modal Augmentation in Multimodal Brain State Decoding

    Sep 12, 2026Ziwei Wang, Xingyi He, Hongbin Wang +3Cross-Modal AttentionMultimodal Learning

  36. Multimodal Taxonomic Conditioning for Generative Plankton Imagery

    Sep 10, 2026Daniela Ivanova, Ozgu Goksu, Nicolas PugeaultPlankton ClassifierTaxonomy

  37. Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation

    Sep 8, 2026Igor Pavlovic, Thiemo Wandel, Anton Obukhov +6Monocular Depth EstimationDiffusion Transformers

  38. SPARK: Input-Conditioned Sparse Activation Modulation for Frozen DiT-based Super-Resolution

    Sep 3, 2026Federico Putamorsi, Leonardo Zini, Marcella Cornia +1Diffusion TransformersFrozen Backbone

  39. LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes

    Sep 3, 2026Chuyan Chen, Haoxing Chen, Kun Chen +27Multi-Reference Image GenerationVisual Generation

  40. RegionCache: Semantic-Aware Region Reuse for Efficient Multi-Turn Image Generation

    Aug 30, 2026Peizheng Li, Xin Ai, Hanyuan Liu +2Diffusion-Based Image EditingImage Editing

  41. Beyond Attention Masks: Instruction Anchoring for Efficient In-Context Diffusion Generation

    Aug 21, 2026Yangshuai Liu, Zheming Li, Jiaao Li +4Diffusion TransformersMultimodal Generation

  42. Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers

    Aug 13, 2026Qiao Li, Xiaomeng Fu, Yuanshu Zhao +3Diffusion TransformersConcept Erasure

  43. NullEdit: Stealthy Image Protection via VLM Condition Redirection

    Aug 11, 2026Weiyao Huang, Liqin Wang, Ziqi Sheng +1Image EditingText-To-Image Diffusion Models

  44. Bridging Event Streams and DiT: Event-Guided Video Frame Interpolation

    Aug 11, 2026Guixu Lin, Yuyang Yu, Xiang Ji +6Large Inter-Frame DisplacementsDiffusion Transformers

  45. Unveiling the Secret of AdaLN-Zero in Diffusion Transformer

    Aug 10, 2026Jie Zhu, Mingyu Ding, Boqiang Duan +2Diffusion Transformers

  46. BAG: Budget-Aware Gating for Diffusion Caching

    Aug 10, 2026Tong Zhao, Mingkun Lei, Yucheng Han +1Diffusion TransformersCache

  47. VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics

    Aug 8, 2026Baotong Tian, Cynthia Lu, Vincent K. M. Cheung +3SynthesizerInstrument

  48. HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models

    Aug 7, 2026Yu Xue, Haoxuan Qu, Zhuoling Li +5Diffusion TransformersText-To-Image

  49. ControlRef: Efficient Layout-Guided Multi-Instance Generation via Anchored 4D-RoPE

    Aug 7, 2026Yunkai Yang, Yudong Zhang, Xinying Chen +7Diffusion TransformersVisual Fidelity