Multimodal Diffusion Models

Latest papers 110

All topics
CardsList
  1. Learning to Read the Contextual Tokens in Diffusion Transformers

    Oct 5, 2026Omer Dahary, Etai Sella, Hadar Averbuch-Elor +2Diffusion Model AlignmentDiffusion Transformer

  2. CleanMDM: Clean Motion Diffusion Model for Multimodal Motion Cleanup

    Oct 4, 2026Zhe Li, Shicheng Wang, Bowen Cai +1Masked Diffusion ModelsMotion Diffusion Models

  3. Gestalt: Large Multimodal Interplay Model

    Sep 30, 2026Zequn Yang, Yu Miao, Haotian Ni +8Unified Multimodal ModelsCross-Modal Alignment

  4. UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement

    Sep 30, 2026Fang Wu, Da Xing, Yanjie Huang +16Unified Multimodal ModelsOn-Policy Self-Distillation

  5. World2Motion: Turning Video World Models into 3D Human Motion Generators

    Sep 29, 2026Fangyuan Tu, Xiangyue Zhang, Yiyi Cai +8Human Motion GenerationDiffusion Models for Motion Generation

  6. Trajectory-Level Mode Guidance for Controllable Diffusion-Based Multi-Robot Motion Planning

    Sep 29, 2026Tianyou Yu, Shengze Cai, Chao XuMulti-Robot Motion PlanningTrajectory Generation

  7. BiMoGen: Bidirectional Motion-Text Generation via Unified Masked Discrete Diffusion

    Sep 28, 2026Wanjiang Weng, Yongliang Wu, Xiaofeng Tan +3Masked Diffusion ModelsText-to-Motion Generation

  8. Diff-RF: Mutually Reinforced Image Registration and Fusion via Degradation-Aware Learning

    Sep 23, 2026Xunpeng Yi, Zaixi Du, Qinglong Yan +3Multi-Source Image FusionCross-Modal Image Registration

  9. MM-Future: Multi-Mode Joint World-Action Modeling for Autonomous Driving

    Sep 17, 2026Shuai Liu, Hechangle Gong, Hao Jiang +5World Models for Autonomous DrivingAutonomous Driving Planning

  10. Uni-LaDiR: Latent Diffusion Unifies Multimodal Reasoning

    Sep 17, 2026Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang +3Unified Multimodal ModelsMultimodal Reasoning

  11. Learning Interaction between Image and Layout Priors for Joint Image-Layout Generation in Design Templates

    Sep 12, 2026Shirong Yang, Bo Yang, Ying CaoMultimodal Diffusion Models

  12. Multi-Modal Controlled Coherent Motion Generation

    Sep 11, 2026Yifei Liu, Qiong Cao, Hongwei Yi +2Human Motion Generation3D Avatar Generation

  13. The Attention Triangle in Audio-Video Models

    Sep 3, 2026Sagi Polaczek, Noa Kraicer, Gal Metzer +4Audio-Video GenerationAttention Control in Diffusion Models

  14. Differentially Private Paired Table-Image Multimodal Synthesis

    Sep 1, 2026Kai Chen, Josephine Lamp, Somesh Jha +1Synthetic Data GenerationCross-Modal Alignment

  15. DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

    Aug 31, 2026Jiashu Zhu, Yanhao Zheng, Ruitian Tian +7Audio-Video GenerationVideo Diffusion Models

  16. Toward a Foundation Plug-and-Play Prior for Computed Tomography Reconstruction via a Multimodal Diffusion Model

    Aug 24, 2026Haley Duba-Sullivan, Patxi Fernandez-Zelaia, Obaidullah Rahman +1Computed TomographyDiffusion Models

  17. Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers

    Aug 13, 2026Qiao Li, Xiaomeng Fu, Yuanshu Zhao +3Diffusion Model UnlearningActivation Steering

  18. TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

    Aug 11, 2026Pengyu Zhang, Yangqin Jiang, Klim Zaporojets +2Recommender SystemsMultimodal Recommendation

  19. Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

    Aug 7, 2026Rulin Zhou, Wanhao Liu, Guoheng Ma +8Controllable Video GenerationTemporal Consistency in Video Generation

  20. CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

    Aug 5, 2026Zhe Shan, Ziming Yang, Lei Zhou +3Image GenerationConditional Generative Modeling

  21. Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition

    Aug 5, 2026Zehao Bao, Shujun Guo, Bruce X. B. YuSkeleton-Based Action RecognitionDiffusion Transformer

  22. Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution

    Aug 5, 2026Axi Niu, Knag Zhang, Qingsen Yan +3Image Super-ResolutionDiffusion Models

  23. DiffImaginE: Imagine to Verify Entity Types with Diffusion

    Aug 4, 2026Feng Zhang, Feiyu Han, Rongxin Yang +11Named Entity RecognitionConditional Diffusion Models

  24. EchoChange: A Diffusion Language Model with Dual Pass Remasking for Factual Remote Sensing Disaster Change Captioning

    Aug 3, 2026Dongwei Sun, Bowen Yao, Yujie Zhang +3Remote Sensing Image UnderstandingMasked Diffusion Models