Multimodal Diffusion Models

Latest papers 110

All topics
CardsList
  1. ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment

    May 29, 2026Jun-Hak Yun, Seung-Bin Kim, Seong-Whan LeeCross-Modal Representation LearningTTS Synthesis

  2. Dex2HOI: Dexterous Bimanual Two-Object Interaction Generation

    May 28, 2026Chrysa Pratikaki, Pablo Ruiz-Ponce, Jiankang Deng +2HOI GenerationHuman Motion Generation

  3. Native Audio-Visual Alignment for Generation

    May 28, 2026Longbin Ji, Guan Wang, Xuan Wei +6Audio-Video GenerationAudio-Visual Synchronization

  4. Masked Diffusion Vision-Language Models for Temporal Action Localization

    May 28, 2026Fengshun Wang, Zhengbo Zhang, Zhigang TuHuman Activity RecognitionVideo-Language Models

  5. Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion

    May 28, 2026Yizhuo Lu, Changde Du, Qingyu Shi +5Brain-Computer InterfacesUnified Multimodal Models

  6. AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation

    May 26, 2026Jian Zhang, Zhijun ZhangMultimodal GroundingMultimodal Diffusion Models

  7. Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

    May 24, 2026Shuyuan Tu, Qi Tian, Zihan Yang +9Cross-Modal LearningAudio-Video Generation

  8. Vision-Language Binding in In-Context Image Generation

    May 23, 2026Chris Ge, Rohit Gandikota, Antonio Torralba +1Image GenerationMechanistic Interpretability

  9. Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes

    May 22, 2026Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-ElorImage GenerationCompositional Image Generation

  10. Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving

    May 21, 2026Jiahao Wang, Bo Sun, Yijing Bai +12Autonomous Driving DatasetsAutonomous Driving

  11. MIRAGE: Robust multi-modal architectures translate fMRI-to-image models from vision to mental imagery

    May 16, 2026Reese Kneeland, Cesar Kadir Torrico Villanueva, Jordyn Ojeda +4Neural DecodingImage Reconstruction

  12. Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers

    May 14, 2026Kanghyun Baek, Jaihyun Lew, Chaehun Shin +2Diffusion TransformerT2I Generation

  13. OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

    May 12, 2026Guohui Zhang, XiaoXiao Ma, Jie Huang +9Audio-Video GenerationAudio-Visual Synchronization

  14. UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation

    May 12, 2026Yiyan Xu, Qiulin Wang, Wenjie Wang +5Subject-Driven Image GenerationImage Generation

  15. Qwen-Image-2.0 Technical Report

    May 11, 2026Bing Zhao, Chenfei Wu, Deqing Li +72T2I GenerationCompositional T2I Generation

  16. Marrying Generative Model of Healthcare Events with Digital Twin of Social Determinants of Health for Disease Reasoning

    May 10, 2026Ziquan Wei, Tingting Dan, Guorong WuHealthcareDigital Twins

  17. Cross-Modal Semantic-Enhanced Diffusion Framework for Diabetic Retinopathy Grading

    May 10, 2026Yiqun WangDiabetic Retinopathy GradingMedical VLMs

  18. Multimodal synthesis of MRI and tabular data with diffusion in a joint latent space via cross-attention

    May 5, 2026Daniel Mensing, Jan Kapar, Jochen G. Hirsch +3Synthetic Tabular Data GenerationMultimodal Generation

  19. Semantic-Structural Alignment for Generative Pictorial Charts

    May 5, 2026Zhida Sun, Yulin Zhang, Zheng Gu +4Data VisualizationControllable Image Generation

  20. A-CODE: Fully Atomic Protein Co-Design with Unified Multimodal Diffusion

    May 5, 2026Chaoran Cheng, Jiaqi Guan, Milong Ren +5Generative ModelingMolecular Generation

  21. Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

    May 3, 2026Junyuan Xiao, Dingkang Liang, Xin Zhou +9World ModelsCross-Modal Alignment

  22. UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

    May 1, 2026Houyuan Chen, Hong Li, Xianghao Kong +8Video Diffusion ModelsUnified Multimodal Models

  23. IdentiFace: Multi-Modal Iterative Diffusion Framework for Identifiable Suspect Face Generation in Crime Investigations

    May 1, 2026Weichen Liu, Yixin Yang, Changsheng Chen +1Diffusion SamplingImage Generation

  24. The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

    Apr 28, 2026Yuwei Sun, Yuxuan Yao, Hui Li +1Diffusion TransformerConditional Image Generation

  25. Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

    Apr 26, 2026Zhen Ye, Xu Tan, Aoxiong Yin +8Cross-Modal LearningAudio-Video Generation

  26. Multimodal Diffusion to Mutually Enhance Polarized Light and Low Resolution EBSD Data

    Apr 24, 2026Harry Dong, Timofey Efimov, Megna Shah +4Diffusion Models for Image RestorationMaterials Science

  27. GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers

    Apr 22, 2026Yuxuan Xue, Ruofan Liang, Egor Zakharov +6Image-to-Image TranslationDiffusion Transformer