Multimodal Diffusion Models

Latest papers 110

All topics
CardsList
  1. MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation

    Jul 22, 2026Zhiyuan Xia, Haojie Li, Jingyu Lin +2Image-to-Image TranslationLatent Diffusion Models

  2. Appearance Pointers -- Multimodal Region Control of Diffusion Transformers

    Jul 21, 2026Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch +2Diffusion TransformerConditional Image Generation

  3. ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

    Jul 20, 2026Keuntae Kim, Beomseok Lee, Hyunwoo Kim +1VLM ReasoningDiffusion Language Model Decoding

  4. Rarity-Aware Discrete Diffusion with Spatially Consistent Decoding for Photo-Realistic Image Super-Resolution

    Jul 20, 2026Ao Li, Yapeng Du, Yi Xin +5Image Super-ResolutionDiffusion Models

  5. Pixel-Space Diffusion Transformers

    Jul 20, 2026Renye Yan, Jikang Cheng, You Wu +8Diffusion TransformerPixel-Space Diffusion Models

  6. Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

    Jul 19, 2026Zihao He, Hongjie Fang, Shirun Tang +2Diffusion GuidanceDiffusion Policy

  7. HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

    Jul 19, 2026Lingwei Dang, Juntong Li, Zonghan Li +5Multi-View ConsistencyMulti-View Video Generation

  8. MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion

    Jul 17, 2026Xu Hou, Meiyu Liang, Wei Huang +6Multimodal KGsKG Completion

  9. Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition

    Jul 16, 2026Qifan Zhou, Yuan Wang, Yanbin Hao +4Diffusion Model UnlearningInference-Time Intervention

  10. Reinforcing the Generation Order of Multimodal Masked Diffusion Models

    Jul 9, 2026Yidong Ouyang, Zhe Wang, Sourav Bhabesh +1Text-Image AlignmentRL for Diffusion Models

  11. DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation

    Jul 2, 2026Zijun Li, Yimin Zhou, Jia Sun +12Diffusion Model DistillationConditional Image Generation

  12. MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment

    Jul 1, 2026Zhenhang Li, Xin Zhou, Hao Deng +1EEG DecodingCross-Modal Alignment

  13. Editing Everything Everywhere All at Once

    Jun 30, 2026Fabio Quattrini, Carmine Zaccagnino, Enis Simsar +4Text-Guided Image EditingAttention Control in Diffusion Models

  14. SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

    Jun 22, 2026Hongxiang Li, Hongxu Chen, Chenyang Zhu +5Diffusion Model AlignmentUnified Multimodal Models

  15. Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion

    Jun 19, 2026Dongseok Shim, Julian Tanke, Kengo Uchida +5Unified Multimodal ModelsText-to-Motion Generation

  16. Modality Forcing for Scalable Spatial Generation

    Jun 11, 2026Bardienus Pieter Duisterhof, Deva Ramanan, Jeffrey Ichnowski +2Diffusion TransformerMonocular Depth Estimation

  17. OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data

    Jun 11, 2026Jiwen Liu, Shujuan Li, Zhixue Fang +8Camera-Controlled Video GenerationVideo Diffusion Models

  18. Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

    Jun 11, 2026Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai +2Multimodal ReasoningRL for Diffusion Models

  19. AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

    Jun 10, 2026Zeyue Tian, Lei Ke, Zhaoyang Liu +8Text-to-Audio GenerationDiffusion Model Distillation

  20. OMG: Omni-Modal Motion Generation for Generalist Humanoid Control

    Jun 9, 2026Siqiao Huang, Kun-Ying Lee, Dongming Qiao +5Robot Foundation ModelsHumanoid Robot Control

  21. TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation

    Jun 5, 2026Dian Gu, Zhengyi YangDiffusion TransformerT2I Generation

  22. EgoPressDiff: Multimodal Video Diffusion for Egocentric UV-Domain Hand-Pressure Estimation

    Jun 5, 2026Yuan Zeng, Zilue Gao, Yujia Shi +3Video Diffusion ModelsTactile Sensing

  23. UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation

    Jun 2, 2026Zeyuan Yang, Hao-Wei Chen, Xueyang Yu +5Unified Multimodal ModelsMultimodal Generation

  24. MedSyn2: Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts

    May 31, 2026Weicheng Dai, Chenyu Wang, Binxu Li +4Diffusion TransformerConditional Image Generation

  25. Wavelet-Fusion Diffusion Model for Multimodal Brain MRI Synthesis with Modality and Metadata Conditioning

    May 30, 2026Muhammad Nabi Yasinzai, Remika Mito, Mangor PedersenVariational AutoencodersLatent Diffusion Models