cs.SDSep 30, 2026

PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation

Authors: Tiernon Riesenmy, You Zhang, Gautam Bhattacharya, Andrea Fanelli

Organizations: The Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology, Atlanta, GA, USA · Advanced Technology Group, Dolby Laboratories, San Francisco, CA, USA

Abstract

We present PLACE, a method that extends the pretrained any-to-audio model AudioX for binaural generation from arbitrary combinations of text, video, and optional audio prompts. PLACE augments video conditioning with Perception Encoder Core features, aligns text and video representations to derive spatial cues, and applies a conditioning-dependent low-rank transformation to the generated latent. The adapter is supervised via decoded-audio interaural level and time difference objectives. Trained on MRSAudio, PLACE improves most metrics over ViSAGe on FAIR-Play and achieves an improved SpatialCLAP score over SpatialSonic on the BEWO-1M Single Static test split. Listener evaluations favor PLACE for video-to-audio and out-of-distribution text-to-audio generation, demonstrating flexible multimodal control and improved spatial consistency.

Figures & tables

Explore similar work

CardsList
  1. Soundwich: Video Generation with Layered and Controllable Audio

    Sep 30, 2026Zhuo Ning, AmirHossein Naghi Razlighi, Sagi Polaczek +2Audio-Video GenerationVideo Generation

  2. Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance

    Jun 26, 2025Akio Hayakawa, Masato Ishii, Takashi Shibuya +1Audio-Video GenerationAudio Understanding

  3. Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

    May 27, 2026Jiahao Mei, Heinrich Dinkel, Yadong Niu +7Modern Generative Audio ModelsAcoustic Latent Space