Multimodal Generation

Latest papers 135

All topics
CardsList
  1. Wasserstein Gradient Flows and Forward-Only Diffusion Are Not Enough for Multimodal Sampling

    Oct 1, 2026Daniel McBride, Pratik Khandagale, Cristina Garcia-Cardona +1Wasserstein Gradient FlowsLatent Transport

  2. Form and Void: Entangled Composition through an Autonomous AI Agent

    Oct 1, 2026Shiwen Wang, Jian Yang, Xu Wang +2Visual GenerationMultimodal Generation

  3. Personalized Image Generation with Reasoning and Reflection

    Sep 30, 2026Bo Ni, Ngoc N. Tran, Qinwen Ge +10Image GenerationPersonalization

  4. ScaffoldM3C: A Multimodal Sequential Monte Carlo Framework for Generative Stable Construction Planning

    Sep 30, 2026Gadiel Sznaier Camps, Chengyang He, Guillaume Sartoretti +2ScaffoldsAssembly

  5. EvoGen-Harness: Learning Where and How to Evolve Image-Generation Harnesses

    Sep 30, 2026Jiabin Luo, Yinan Liu, Chunlei Meng +1Multi-Reference Image GenerationMultimodal Generation

  6. What Comes Next? Omni-StoryBench for Evaluating Story-Grounded Omnimodal Generation

    Sep 29, 2026Sieun Hyeon, Yejoon Lee, Mintaek Lim +3Omni-ModalMultimodal Generation

  7. Salt++: Context-Aligned Post-Training for Few-Step Streaming Multimodal Generation

    Sep 29, 2026Xingtong Ge, Yutong Wang, Lunjie Zhu +7Audio-Video GenerationFew-Step Generation

  8. Trajectory-Level Mode Guidance for Controllable Diffusion-Based Multi-Robot Motion Planning

    Sep 29, 2026Tianyou Yu, Shengze Cai, Chao XuDiffusion PlanningMulti-Robot Motion Planning

  9. ORAV: Benchmarking Audio-Video Generation from Multimodal Contexts

    Sep 28, 2026Jiacheng Hua, Xiaokun Feng, Jiaqi Hua +3Audio-Video GenerationMultimodal Generation

  10. Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy

    Sep 28, 2026Abhinav Sharma, Sai Karthik Navuluru, Wang Wei +21Audio-Video GenerationAudio-Visual Consistency

  11. SciGen-Verifier: A Multimodal Reasoner for Explainable Verification in Scientific Image Generation

    Sep 27, 2026Jiali Chen, Zhengteng Lin, Zuqi Wang +6Scientific FigureReference-Guided Multimodal In-Context Verification

  12. Beyond Emotion Prompts: Fine-Grained Text-to-Image Generation Driven by Valence-Arousal-Dominance

    Sep 21, 2026Minglang Li, Yueyue Fang, Xieping GaoLarge-Scale Image DatasetsEmotion Recognition

  13. One Model, Two Physical Stories: Auditing Misalignment in Multi-Modal World Modeling

    Sep 13, 2026Geigh Zollicoffer, Minh Vu, Rajiv Ranasinghe +1Cross-Modal ConflictsMultimodal Model

  14. Multi-Modal Controlled Coherent Motion Generation

    Sep 11, 2026Yifei Liu, Qiong Cao, Hongwei Yi +2Human Motion GenerationMultimodal Generation

  15. UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation

    Sep 11, 2026Danning Zhang, Yijing Lin, Shuhan Zhuang +4Multimodal GenerationMulti-Reference Image Generation

  16. Dreaming in Flow: Generative Grounding Feedback for Self-Evolving Unified Multimodal Models

    Sep 8, 2026Ke Hao, Yuanzhi Liang, Tingxi Chen +5Multimodal GenerationMultimodal Model

  17. The Price of Consistency: Exploiting Visual Anchors for Multimodal Jailbreaking in Video Generation

    Sep 7, 2026Peng Li, Qianqian Xu, Yangbangyan Jiang +2Generative Video ModelsVideo Generation

  18. Who Drives the Probability Game of VLMs? A Temporal Causal Drive Evaluation Framework

    Sep 2, 2026Shuyao Xiao, Shengling Wang, Haoyu Niu +4Multimodal GenerationAutoregressive Decoding

  19. DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

    Aug 31, 2026Jiashu Zhu, Yanhao Zheng, Ruitian Tian +7Audio-Video GenerationMultimodal Generation

  20. GarmentWeaver: Schema-Aware Structured Synthesis for Multimodal Sewing Patterns

    Aug 31, 2026Yinwen Lu, Weihao Luo, Yueqi ZhongSewingGarments

  21. Beyond Attention Masks: Instruction Anchoring for Efficient In-Context Diffusion Generation

    Aug 21, 2026Yangshuai Liu, Zheming Li, Jiaao Li +4Diffusion TransformersMultimodal Generation

  22. From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

    Aug 12, 2026Houston H. Zhang, Tao Zhang, Li Gu +5Image-To-Code GenerationGenerative User Interface

  23. MRIComp4Flow: Compression of 3D Brain MRI for Training Multi-Modal Generative Models

    Aug 10, 2026Lisa K. Fischer, Mykhailo Riabets, Daniel Rueckert +3Magnetic Resonance Imaging DatasetMedical Image Generation

  24. Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

    Aug 10, 2026Dongxu Ge, Shansong Liu, Cheng Gong +3Audio-Video GenerationMultimodal Generation

  25. Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation

    Aug 9, 2026Kaichen Zhang, Wei Huang, Keming Wu +2Multimodal GenerationStreaming

  26. Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

    Aug 7, 2026Rulin Zhou, Wanhao Liu, Guoheng Ma +8Surgical VideosVideo World Models

  27. ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

    Aug 5, 2026Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun +5Image GenerationMultimodal Generation

  28. UniWorld-Design: From Pixel Generation to Layer-Native Design

    Aug 4, 2026Zongjian Li, Zhiyuan Yan, Chenxu Bai +9Image GenerationMultimodal Generation

  29. PosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready Outputs

    Aug 3, 2026Haojie Hu, Chenhao Dang, Yaojia Liu +3Multimodal Generation

  30. MoRoute: Dynamic Routing for In-Context Multimodal Video Generation

    Jul 31, 2026Chong Gao, Jie Ma, Zhan Peng +5Interactive Video GenerationMultimodal Generation

  31. M3^3-Gen: Interpretable Multimodal Generation of Gene Expression Profiles Using Clinical and Imaging Data

    Jul 23, 2026Francesca Pia Panaccione, Carlo Sgaravatti, Marco VenereMultimodal Clinical DataTranscriptomics

  32. ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

    Jul 21, 2026Yuan Wang, Yongchao Du, Mengting Chen +4Multimodal Reasoning BenchmarksVisual Generation

  33. StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling

    Jul 17, 2026Jianing Peng, Mengyu Wang, Henghui Ding +6Multi-Reference Image GenerationMultimodal Generation

  34. VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios

    Jul 16, 2026Kailin Lyu, Long Xiao, Jianing Zeng +3TactileContact-Rich Dexterous Manipulation

  35. MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

    Jul 15, 2026Xiaohan Zhang, Yuqing Wen, Junlin Chen +9Audio-Video GenerationAudio-Visual Consistency

  36. Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

    Jul 14, 2026Minh-Quan Le, Armand Comas, Alexandros Lattas +7Multimodal GenerationMulti-Reference Image Generation

  37. SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning

    Jul 13, 2026Jinxiu Liu, Jianru Li, Tanqing Kuang +4Visual GenerationMultimodal Generation

  38. Latent graph encoding of multimodal neuroimaging features with generative AI architectures

    Jul 8, 2026Ishaan Batta, Meenu Ajith, Vince CalhounMultimodal NeuroimagingFunctional Magnetic Resonance Imaging

  39. Vision as Unified Multimodal Generation

    Jul 7, 2026Xiaoyang Han, Jianhua Li, Kewang Deng +14Multimodal GenerationComputer Vision

  40. CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

    Jul 6, 2026Hairui Zhu, Yiying Yang, Tengjin Weng +5Multimodal AgentsMultimodal Generation

  41. Attending to Multimodal Generation One Token at a Time

    Jul 4, 2026Varun Gupta, Vineet Gandhi, Makarand TapaswiMultimodal Large Language ModelsMultimodal Generation

  42. Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation

    Jun 29, 2026Chonghuinan Wang, Zhikai Chen, Chunwei Wang +9Multimodal Generation

  43. SICAGE: Speaker-Independent Culture-Aware Gesture Generation using TED4C-L Dataset

    Jun 29, 2026Ariel Gjaci, Antonio Sgorbissa, Vittorio MurinoCo-Speech Gesture GenerationMultimodal Generation

  44. Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

    Jun 25, 2026Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar +5Multimodal GenerationLarge Multimodal Models

  45. LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

    Jun 24, 2026Zihao Wang, Yijia Xu, Haoze Zheng +3Multi-Reference Image GenerationText-To-Image

  46. IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

    Jun 23, 2026Zixuan Li, Haokun Lin, Yicheng Xiao +10Multi-Reference Image GenerationText-To-Image