Spatial Audio

Momentum

11 papers in the last four weeks, up 267% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 33

All topics
CardsList
  1. RMS-AQA: A Two-Stage Spatial Audio Question Answering Benchmark for Real-World Domestic Environments

    Oct 1, 2026Peihao Chen, Qing Wang, Lichun Fan +12Spatial AudioAudio Understanding

  2. Audible World Models: Spatially Aware Sound Generation for 3D Worlds

    Sep 29, 2026Duowen Chen, Jinjin He, Gouthaman KV +2Spatial AudioModern Generative Audio Models

  3. HelixWorld: A Real-time Interactive Audio-Visual World Model

    Sep 29, 2026Lei Ke, Jiahao Pan, Zeyue Tian +13Video World ModelsSpatial Audio

  4. Enabling Immersive Audio-Visual Experience from Any Video

    Sep 28, 2026Zitong Lan, Mutian Tong, Jiatao Gu +1Spatial AudioImmersion

  5. SAIL: Spatial Audio Intelligence with Large Language Models via Disentangled Acoustic-Spatial Encoding and Dual-Stream Q-Former

    Sep 28, 2026Zhengding Luo, Jinyang Wu, Haozhe Ma +3Spatial AudioSound Event Detection

  6. An Efficient Parametric Codec for Low-Bitrate First-Order Ambisonics

    Sep 27, 2026Wei-Ting Lai, Amy Bastine, Lachlan Birnie +2AffectcodecUltra-Low Bitrates

  7. Passing: An Endless Journey through Reconstructed Spacetime with AI-Generated Sound

    Sep 23, 2026Akira Takahashi, Chihiro Nagashima, Zhi Zhong +2Spatial AudioEmbodied

  8. MoSAT: Human Motion Generation from Spatial Audio and Textual Description

    Sep 20, 2026Shuyang Xu, Zhiyang Dou, Yiduo Hao +8Human Motion GenerationHuman Motion

  9. OmniEcho: Audio-Visual Spatial Understanding for Omni-Modal Embodied Agents

    Sep 20, 2026Ruixun Liu, Yuxuan Wang, Jiacheng Xie +10Spatial AudioAudio-Visual Reasoning

  10. One-Stage Multi-Task Instruction-Guided 3D Spatial Audio Editing

    Sep 4, 2026Ke Lei, Chenyuhao Wen, Yu Zhang +9Spatial AudioAudio Editing

  11. Human-robot conversation with multiple participants in noisy public spaces

    Sep 1, 2026Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes +10Spatial AudioDynamic Environments

  12. Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

    Aug 10, 2026Zhi Zeng, Cheng Zhang, Zesheng Yang +9Audio-Visual ReasoningSpatial Audio

  13. Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

    Aug 1, 2026Masaki Yoshida, Ren Togo, Takahiro Ogawa +1Spatial Audio3D Gaussian

  14. ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

    Jul 30, 2026Yukang Cao, Haozhe Xie, Beichen Wen +13Training-Set Long-Tail MotionsEmbodied Artificial Intelligence

  15. S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information

    Jul 28, 2026Kaneyoshi Hiratsuka, Benjamin Yen, Ryosuke KojimaRobotic ManipulationReal-World Manipulation Tasks

  16. Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

    Jul 9, 2026Shuo-Chun Lin, Hen-Hsen HuangSpatial AudioLarge Audio Language Models

  17. EscFOA: Enhancing Spatial Learning for Visually Impaired Learners via Generative Spatial Audio in 360-Degree Educational Environments

    Jul 8, 2026Ziyu Luo, Xiaowei Dai, Siying Zhu +1Spatial AudioAcoustic

  18. Evaluation of Headrest-Integrated Loudspeakers for Enhanced Spatial Audio Immersion in Automotive Cabins

    Jun 23, 2026Martin Wolters, Jacobo Giralt, Harald Mundt +1Spatial Audio

  19. Generalised Transcoding Framework for Arbitrary Spatial Audio Capture and Playback Formats

    Jun 16, 2026Archontis Politis, Janani Fernandez, Leo McCormackSpatial AudioMicrophone Array

  20. Spectro-Temporal Interference Confounds Phase Encoding in Spatial Audio Foundation Models

    Jun 12, 2026Yuxuan Chen, Haoyuan Yu, Peize HeSound Source LocalizationSpatial Audio

  21. Sensitivity Analysis of Generative Spatial Audio Metrics: A Study on Responsiveness, Smoothness, and Symmetry

    Jun 10, 2026Purnima Kamath, Adrian S. Roman, Koichi Saito +2Spatial AudioSymmetry

  22. Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding

    Jun 9, 2026Zhiyuan Zhu, Yixuan Chen, Yiwen Shao +13Spatial AudioOmni-Modal

  23. Probing Spatial Structure in Pretrained Audio Representations

    Jun 4, 2026Chuyang Chen, Sivan Ding, Adrian S. Roman +1Spatial AudioNeural Audio

  24. SHB-AE: Spherical harmonic beamforming based Ambisonics encoding and upscaling method for smartphone microphone array

    Jun 3, 2026Yuhuan You, Yufan Qian, Tianshu Qu +2Microphone ArraySpatial Audio

  25. Flow-HOA: Generative Joint Optimization for Ambisonics Encoding via Flow Matching

    Jun 3, 2026Yuhuan You, Yufan Qian, Tianshu Qu +2Spatial AudioMicrophone Array

  26. EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction

    May 27, 2026Chong Jing, Zitong Lan, Junan Zhang +1Impulse ResponseSpatial Audio

  27. Geo2Sound: A Scalable Geo-Aligned Framework for Soundscape Generation from Satellite Imagery

    Apr 16, 2026Kunlin Wu, Yanning Wang, Haofeng Tan +6Spatial AudioSatellite Imagery

  28. DiffAU: Diffusion-Based Ambisonics Upscaling

    Sep 30, 2025Amit Milstein, Nir Shlezinger, Boaz RafaelySpatial AudioPerceptually