Diffusion Transformer

Also known as DiT

Momentum

35 papers in the last four weeks, up 169% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 297

All topics
CardsList
  1. ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference

    May 11, 2026Han Meng, Danny Willow Liu, Dong LiDiffusion TransformerGPU Acceleration

  2. Attention Sinks in Diffusion Transformers: A Causal Analysis

    May 10, 2026Fangzheng Wu, Brian SummaTransformer InterpretabilityDiffusion Transformer

  3. BRIDGE: Background Routing and Isolated Discrete Gating for Coarse-Mask Local Editing

    May 8, 2026Peilin Xiong, Honghui Yuan, Junwen Chen +1Diffusion TransformerPositional Encoding

  4. TextLDM: Language Modeling with Continuous Latent Diffusion

    May 8, 2026Jiaxiu Jiang, Jingjing Ren, Wenbo Li +10Diffusion TransformerLatent Diffusion Models

  5. EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing

    May 8, 2026Lan Chen, Qi Mao, Yiren Song +2Diffusion TransformerDiffusion Model Fine-Tuning

  6. Continuous Latent Diffusion Language Model

    May 7, 2026Hongcan Guo, Qinyu Zhao, Yian Zhao +8Non-Autoregressive Text GenerationDiffusion Transformer

  7. Why Do DiT Editors Drift? Plug-and-Play Low Frequency Alignment in VAE Latent Space

    May 7, 2026Xiaoce Wang, Sifan Zhou, Kaifei Wang +4Diffusion TransformerDiffusion-Based Image Editing

  8. Taming Outlier Tokens in Diffusion Transformers

    May 6, 2026Xiaoyu Wu, Yifei Wang, Tsu-Jui Fu +3Diffusion TransformerActivation Outliers

  9. Concurrence of Symmetry Breaking and Nonlocality Phase Transitions in Diffusion Models

    May 6, 2026Yifan F. Zhang, Fangjun Hu, Guangkuo Liu +2Diffusion TransformerSymmetry Breaking

  10. AHPA: Adaptive Hierarchical Prior Alignment for Diffusion Transformers

    May 5, 2026Ruibin Min, Yexin Liu, Aimin Pan +5Diffusion Model AlignmentDiffusion Transformer

  11. Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE

    May 4, 2026Yangming Shi, Shixiang Zhu, Tao Shen +14Diffusion TransformerUnified Multimodal Models

  12. Soft Graph Diffusion Transformer for MIMO Detection

    May 1, 2026Nan Jiang, Jiadong Hong, Lei Liu +3Diffusion TransformerWireless Communications

  13. YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

    Apr 30, 2026Chenyang Wu, Lina Lei, Fan Li +6Diffusion TransformerVideo Editing

  14. Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models

    Apr 29, 2026Zhirong Shen, Rui Huang, Jiacheng Liu +6Diffusion TransformerDiffusion Model Caching

  15. The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

    Apr 28, 2026Yuwei Sun, Yuxuan Yao, Hui Li +1Diffusion TransformerConditional Image Generation

  16. Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing

    Apr 26, 2026Honghao Cai, Xiangyuan Wang, Yunhao Bai +8Diffusion TransformerText-Guided Image Editing

  17. Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

    Apr 26, 2026Zhen Ye, Xu Tan, Aoxiong Yin +8Cross-Modal LearningAudio-Video Generation

  18. OccDirector: Language-Guided Behavior and Interaction Generation in 4D Occupancy Space

    Apr 24, 2026Zhuding Liang, Tianyi Yan, Dubing Chen +6Diffusion TransformerMulti-Agent Systems

  19. UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

    Apr 24, 2026Chunyu Qiang, Xiaopeng Wang, Kang Yin +11Text-to-Music GenerationText-to-Audio Generation

  20. Sculpt4D: Generating 4D Shapes via Sparse-Attention Diffusion Transformers

    Apr 23, 2026Minghao Yin, Wenbo Hu, Jiale Xu +2Diffusion Transformer3D Shape Generation

  21. GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers

    Apr 22, 2026Yuxuan Xue, Ruofan Liang, Egor Zakharov +6Image-to-Image TranslationDiffusion Transformer

  22. AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation

    Apr 20, 2026Haoyue Tan, Shengnan Wang, Yulin Qiao +5Video Diffusion ModelsDiffusion Transformer

  23. LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization

    Apr 20, 2026Yann Bouquet, Alireza Khodamoradi, Sophie Yáng Shen +2Mixed-Precision QuantizationDiffusion Transformer