Diffusion Transformer

Also known as DiT

Momentum

35 papers in the last four weeks, up 169% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 297

All topics
CardsList
  1. PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation

    Jul 2, 2026Haofei Xu, Rundi Wu, Philipp Henzler +7Diffusion TransformerMonocular 3D Reconstruction

  2. From SRA to Self-Flow: Data Augmentation or Self-Supervision?

    Jul 2, 2026Dengyang Jiang, Mengmeng Wang, Harry Yang +1Diffusion Model AlignmentData Augmentation

  3. OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers

    Jul 2, 2026Donghyun Lee, Jitesh Chavan, Duy Nguyen +5Video Diffusion ModelsDiffusion Transformer

  4. QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers

    Jul 2, 2026Kyobin Choo, Youngmin Kim, Hyunkyung Han +4Diffusion Model GuidanceDiffusion Transformer

  5. Post-Training Pruning for Diffusion Transformers

    Jul 1, 2026Chengzhi Hu, Xuewen Liu, Jing Zhang +3Diffusion TransformerDiffusion-Based Image Generation

  6. Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

    Jul 1, 2026Jaeah Lee, Hyunjin Kim, Jaewoong Cho +1Model CompressionDiffusion Transformer

  7. SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE

    Jun 30, 2026Or Hirschorn, Aaron Olender, Eli Alshan +3Video-Reference Video GenerationRotary Positional Embeddings

  8. Quality-Aware Modulation for Diffusion Transformers

    Jun 29, 2026Luke Budny, Yuhong Guo, Kevin CheungDiffusion TransformerT2I Diffusion Models

  9. SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation

    Jun 29, 2026Juncheng Ma, Yuxuan Du, Yanan Sun +8Diffusion TransformerAudio-Driven Facial Animation

  10. UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception

    Jun 29, 2026Qin Guo, Hao Luo, Dongxu Yue +4Diffusion TransformerDense Prediction

  11. SAFE-DiT: Semantics-Aware Fast-path Execution for High-Resolution Diffusion Transformers

    Jun 28, 2026Xuanhua Yin, Yuxuan Jia, Chuanzhi Xu +1Diffusion TransformerDiffusion Model Inference Acceleration

  12. DTI: Dynamic Trajectory Initialization for Generative Face Video Super-Resolution

    Jun 28, 2026Yingwei Tang, Chen Yan, Wendi Liu +2Diffusion TransformerVideo Super-Resolution

  13. Scalable Behavior Cloning with Open Data, Training, and Evaluation

    Jun 25, 2026Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh +15Robot Policy LearningDiffusion Transformer

  14. RayPE: Ray-Space Positional Encoding for 3D-Aware Video Generation

    Jun 25, 2026Minghao Yin, Jiahao Lu, Wenbo Hu +3Camera-Controlled Video GenerationDiffusion Transformer

  15. RoPEMover: Depth-Aware Object Relocation via Positional Embeddings

    Jun 25, 2026Ipek Oztas, Duygu Ceylan, Aybars Bugra Aksoy +1Rotary Positional EmbeddingsDiffusion Transformer

  16. LearniBridge: Learnable Calibration of Feature Caching for Diffusion Models Acceleration

    Jun 25, 2026Xuyue Huang, Zhe Chen, Wang Shen +1Video Diffusion ModelsDiffusion Transformer

  17. DiffusionBench: On Holistic Evaluation of Diffusion Transformers

    Jun 23, 2026Xingjian Leng, Jaskirat Singh, Zhanhao Liang +5Diffusion TransformerImage Generation Evaluation

  18. DiT-Reward: Generative Representations for Text-to-Image Reward Modeling

    Jun 22, 2026Yuanming Yang, Guoqing Ma, Bo Wang +5Representation LearningDiffusion Transformer

  19. Vera: A Layered Diffusion Model for Content-Preserving Video Editing

    Jun 22, 2026Hongkai Zheng, Ta-Ying Cheng, Benjamin Klein +2Video Diffusion ModelsDiffusion Transformer

  20. MeshFlow: Mesh Generation with Equivariant Flow Matching

    Jun 22, 2026Qi Sun, Kiyohiro Nakayama, Jing Nathan Yan +6Flow Matching3D Mesh Generation

  21. ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

    Jun 22, 2026Ruiliang Zhou, Xuecheng Wu, Kang He +6Video Diffusion ModelsDiffusion Transformer

  22. Controllable Texture Tiling with Transformed RoPE-Enhanced Diffusion Models

    Jun 22, 2026Junrong Huang, Zhiyuan Zhang, Rui Tang +2Rotary Positional EmbeddingsDiffusion Transformer

  23. Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation

    Jun 22, 2026Seong Jong Yoo, Siyuan Peng, Felix Gu +2Diffusion TransformerText-to-Motion Generation

  24. Pixel-Level Residual Diffusion Transformer: Scalable 3D CT Volume Generation

    Jun 18, 2026Zhenkai Zhang, Markus Hiller, Krista A. Ehinger +1Diffusion Transformer3D Medical Imaging

  25. RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers

    Jun 18, 2026Liting Gao, Yonggang Zhu, Yaru Chen +5Diffusion TransformerAudio Editing

  26. DiffMath: Symbol- and Graph-Aware Latent Diffusion Transformer for Handwritten Mathematical Expression Generation

    Jun 18, 2026Wei Pan, Xuhan Zheng, Yilin Shi +5Diffusion TransformerLatent Diffusion Models