Multimodal Diffusion Models

Latest papers 110

All topics
CardsList
  1. Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off

    Mar 23, 2026Davide Lobba, Fulvio Sanguigni, Bin Ren +3Virtual Try-OnText-Guided Image Editing

  2. InterEdit: Navigating Text-Guided 3D Dyadic Human Motion Editing

    Mar 13, 2026Yebin Yang, Di Wen, Lei Qi +10Human Motion GenerationMultimodal Diffusion Models

  3. Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

    Mar 6, 2026Lijiang Li, Zuwei Long, Yunhang Shen +6Masked Diffusion ModelsUnified Multimodal Models

  4. LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

    Feb 15, 2026Shufan Li, Yuchen Zhu, Jiuxiang Gu +6Unified Multimodal ModelsMultimodal Reasoning

  5. DiTS: Multimodal Diffusion Transformers Are Time Series Forecasters

    Feb 6, 2026Haoran Zhang, Haixuan Liu, Yong Liu +4Time Series ForecastingProbabilistic Time Series Forecasting

  6. DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter

    Feb 5, 2026Xukun Li, Yu Sun, Lei Zhang +10Bimanual Robotic ManipulationContact-Rich Robotic Manipulation

  7. TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

    Jan 5, 2026Binglei Li, Mengping Yang, Zhiyu Tan +2Diffusion TransformerCompositional T2I Generation

  8. HAGI++: Head-Assisted Gaze Imputation and Generation

    Nov 4, 2025Chuhan Jiao, Zhiming Hu, Andreas BullingGaze EstimationTime Series Imputation

  9. UniVideo: Unified Understanding, Generation, and Editing for Videos

    Oct 9, 2025Cong Wei, Quande Liu, Zixuan Ye +5Image-to-Video GenerationUnified Multimodal Models

  10. ADMC: Attention-based Diffusion Model for Missing Modalities Feature Completion

    Jul 8, 2025Yuhan Li, Wei Zhang, Juan Chen +3Cross-Modal LearningMissing-Modality Learning

  11. Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion

    Jun 27, 2025Ying Zhang, Yu Zhao, Xuhui Sui +5Multimodal Federated LearningMissing-Modality Learning

  12. HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation

    Jun 10, 2025Ziyao Huang, Zixiang Zhou, Juan Cao +9HOI GenerationPhysical Consistency in Video Generation

  13. LaViDa: A Large Diffusion Language Model for Multimodal Understanding

    May 22, 2025Shufan Li, Konstantinos Kallidromitis, Hritik Bansal +7Vision-Language ModelsEfficient VLM Inference

  14. Zero-Shot Paragraph-level Handwriting Imitation with Latent Diffusion Models

    Sep 1, 2024Martin Mayr, Marcel Dreier, Florian Kordon +5Latent Diffusion ModelsImage Generation

  15. UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation

    Date pendingZeyang Liu, Le Wang, Sanping Zhou +4Diffusion TransformerConditional Generative Modeling