Multimodal Generation

Latest papers 135

All topics
CardsList
  1. UniRect-CoT: Enhancing Generation in Unified Multimodal Models via Reflective Rectification with Inherent Understanding

    Apr 15, 2026Yibo Jiang, Tao Wu, Rui Jiang +4Multimodal GenerationRectification

  2. MAGE: Modality-Agnostic Music Generation and Target-Source Extraction

    Apr 10, 2026Muhammad Usama Saleem, Tejasvi Ravi, Tianyu Xu +4Modern Generative Audio ModelsMultimodal Generation

  3. Correlation-Weighted Multi-Reward Optimization for Compositional Generation

    Mar 19, 2026Jungmyung Wi, Hyunsoo Kim, Donghyun KimMultimodal GenerationProgress Reward Modeling

  4. UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

    Feb 9, 2026Cheng Yang, Chufan Shi, Bo Shui +7Multimodal GenerationMultimodal Model

  5. Text-Conditioned Background Generation for Editable Multi-Layer Documents

    Dec 19, 2025Taewon Kang, Joseph K J, Chris Tensmeyer +4Precise EditingHigh-Fidelity Conditional Generation

  6. SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

    Dec 17, 2025Hongbo Wang, AprilPyone MaungMaung, Isao EchizenToxicityLarge Language Model Safety

  7. Learning to Generate Human-Human-Object Interactions from Textual Descriptions

    Nov 25, 2025Jeonghyeon Na, Sangwon Baik, Inhee Lee +2Articulated ObjectsHuman Motion Generation

  8. CanvasComposer: Personalized Group Photo Generation via a Multi-Reference Canvas

    Oct 23, 2025Gordon Guocheng Qian, Ruihang Zhang, Tsai-Shien Chen +11Multi-Reference Image GenerationCanvas

  9. SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

    Oct 14, 2025Weiyang Jin, Yuwei Niu, Jiaqi Liao +4Multimodal GenerationPost-Training

  10. UniVideo: Unified Understanding, Generation, and Editing for Videos

    Oct 9, 2025Cong Wei, Quande Liu, Zixuan Ye +5Video EditingMultimodal Generation

  11. MMMG: a Comprehensive and Reliable Benchmark for Multitask Multimodal Generation

    May 23, 2025Jihan Yao, Yushi Hu, Wenyuan Wang +10Multimodal GenerationMultimodal Benchmarks

  12. Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook

    Nov 29, 2024Florinel-Alin Croitoru, Andrei-Iulian Hiji, Vlad Hondru +7Deepfake DetectionUnsupervised Detection

  13. MedGEN-Bench: A Contextually Entangled Benchmark for Open-ended Multimodal Medical Generation

    Date pendingJunjie Yang, Yuhao Yan, Gang Wu +12Medical Visual Question AnsweringMedical Vision-Language Models

  14. Unified Text-Image Generation with Weakness-Targeted Post-Training

    Date pendingJiahui Chen, Philippe Hansen-Estruch, Xiaochuang Han +7Multimodal GenerationText-To-Image