cs.CVFeb 3, 2026

REPA-G: Test-Time Conditioning with Representation-Aligned Visual Features

Authors: Nicolas Sereyjol-Garros, Ellington Kirby, Victor Letzelter, Victor Besnier, Nermin Samet

Organizations: Valeo.ai, Paris, France · LTCI, Télécom Paris, Institut Polytechnique de Paris, France

Abstract

While representation alignment with self-supervised models has been shown to improve diffusion model training, its potential for enhancing inference-time conditioning remains largely unexplored. We introduce Representation-Aligned Guidance (REPA-G), a framework that leverages these aligned representations, with rich semantic properties, to enable test-time conditioning from features, in generation. By optimizing a similarity objective (the potential) at inference, we steer the denoising process toward a conditioned representation extracted from a pre-trained feature extractor. Our method provides versatile control at multiple levels of granularity, ranging from patch level matching via single patches to broad semantic guidance using global image feature tokens. We further extend this to multi-concept composition, allowing for the faithful combination of distinct concepts. REPA-G operates entirely at inference time with no additional training required, offering a flexible and precise alternative to often ambiguous text prompts or coarse class labels. Our approach achieves high-quality, diverse generations on ImageNet and COCO. Code is available at https://github.com/valeoai/REPA-G

Figures & tables

Appendix figures & tables21 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Embedding Prediction Helps Image Generation

    Oct 1, 2026Sihan Xu, Ji Xie, Zilin Wang +2Diffusion TransformersImage Generation

  2. Rectify Then Diffuse: Disentangling Concepts Before Denoising Trajectory Unfolds

    Aug 4, 2026Ning Zhu, An Chen, Mengfei Zhao +4Text-To-Image Diffusion ModelsDenoising Trajectory

  3. Injecting Image Guidance into Text-Conditioned Diffusion Models at Inference

    May 24, 2026Agata Żywot, Iason Skylitsis, Thijmen Nijdam +4Text-To-Image Diffusion ModelsText-Conditioned Diffusion Model