cs.CVOct 3, 2025

What Drives Compositional Generalization in Visual Generative Models? The Importance of Continuous Training Objectives

Authors: Karim Farid, Rajat Sahay, Yumna Ali Alnaggar, Simon Schrodi, Volker Fischer, Cordelia Schmid, Thomas Brox

Organizations: University of Freiburg · Bosch Center for Artificial Intelligence · Inria, École Normale Supérieure, CNRS, PSL Research University

Abstract

Compositional generalization, the ability to generate novel combinations of known concepts, is a key ingredient for visual generative models. Yet, not all mechanisms that enable or inhibit it are fully understood. In this work, we conduct a systematic study of which design choices critically determine compositional generalization in image and video generation. By isolating independent design axes, we identify two key factors strongly associated with compositional success: (i) whether the training objective operates on a discrete or continuous distribution, and (ii) the completeness of conditioning information about constituent factors during training. We also show that relaxing the discrete loss with an auxiliary continuous latent objective can partially recover compositional performance in discrete models like MaskGIT. Our findings, corroborated by diverse compositional tasks and preliminary evidence in world models and LLMs, motivate a shift toward continuous objectives for compositional generalization.

Figures & tables

Appendix figures & tables32 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Catastrophic Compositional Generation: Why Vanilla Diffusion Models Fail to Extrapolate

    Jun 22, 2026Duncan Soiffer, Chandler Squires, Yuan Guan +2Diffusion ModelsGenerative Models

  2. Compositional Video Generation via Inference-Time Guidance

    May 14, 2026Ariel Shaulov, Eitan Shaar, Amit Edenzon +2Video GenerationGuidance

  3. OOD Generalization as a Bifurcation Problem

    Sep 27, 2026Nguyen-Thanh-Luong Doan, Quang-Vu Nguyen, Tang-Phu-Quy Le +1Generative ModelsOut-Of-Distribution