Spatial Audio

Momentum

15 papers in the last four weeks, up 275% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 54

All topics
CardsList
  1. WorldSonus: Bringing Sound to Worlds

    Oct 6, 2026Pengjun Fang, Jingyi Fa, Kam Man Wu +9Audio-Video GenerationAudio Diffusion Models

  2. SEA-LM: Egocentric Spatial Audio Understanding for Wearable Microphone Arrays

    Oct 4, 2026Sonal Kumar, Sinan Hersek, Artem Dementyev +6Direction-of-Arrival EstimationAudio-Language Models

  3. RMS-AQA: A Two-Stage Spatial Audio Question Answering Benchmark for Real-World Domestic Environments

    Oct 1, 2026Peihao Chen, Qing Wang, Lichun Fan +12Audio-Language Model EvaluationAudio QA

  4. PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation

    Sep 30, 2026Tiernon Riesenmy, You Zhang, Gautam Bhattacharya +1Text-to-Audio GenerationAudio-Video Generation

  5. Hear the World in Stereo: Learning Dynamic Spatial Correspondence for Immersive Joint Video-Audio Generation

    Sep 30, 2026Hanmo Chen, Chengcheng Liu, Tianxiao Chen +7Audio-Video GenerationAudio-Visual Alignment

  6. Audible World Models: Spatially Aware Sound Generation for 3D Worlds

    Sep 29, 2026Duowen Chen, Jinjin He, Gouthaman KV +2Sound Effects Generation3D Scene Generation

  7. HelixWorld: A Real-time Interactive Audio-Visual World Model

    Sep 29, 2026Lei Ke, Jiahao Pan, Zeyue Tian +13World Model LearningReal-Time Interactive Video Generation

  8. Enabling Immersive Audio-Visual Experience from Any Video

    Sep 28, 2026Zitong Lan, Mutian Tong, Jiatao Gu +1Audio-Video GenerationAudio-Visual Alignment

  9. SAIL: Spatial Audio Intelligence with Large Language Models via Disentangled Acoustic-Spatial Encoding and Dual-Stream Q-Former

    Sep 28, 2026Zhengding Luo, Jinyang Wu, Haozhe Ma +3Audio ReasoningDirection-of-Arrival Estimation

  10. Transformer-based Neural Beamforming for Real-Time Speech Enhancement on Smart Low-Power Hearable Devices

    Sep 27, 2026Luca Bompani, Marco Fariselli, Giovanni Oltrecolli +1Speech EnhancementSpatial Audio

  11. An Efficient Parametric Codec for Low-Bitrate First-Order Ambisonics

    Sep 27, 2026Wei-Ting Lai, Amy Bastine, Lachlan Birnie +2Residual VQSpatial Audio

  12. LiteCASS: A Lightweight End-to-End Network for Real-Time Stereo Cinematic Audio Source Separation

    Sep 20, 2026Yuanxin Guo, Qiang Ji, Mengmei Liu +3Spatial AudioAudio Source Separation

  13. OmniEcho: Audio-Visual Spatial Understanding for Omni-Modal Embodied Agents

    Sep 20, 2026Ruixun Liu, Yuxuan Wang, Jiacheng Xie +10Audio-Visual UnderstandingSpatial Reasoning Benchmarks

  14. Geometry-Informed Distributed Acoustic Scene Understanding

    Sep 7, 2026Yiyuan Yang, Shitong Xu, Niki Trigoni +1Scene Graph GenerationAudio Understanding

  15. One-Stage Multi-Task Instruction-Guided 3D Spatial Audio Editing

    Sep 4, 2026Ke Lei, Chenyuhao Wen, Yu Zhang +9Audio EditingSpatial Audio

  16. Human-robot conversation with multiple participants in noisy public spaces

    Sep 1, 2026Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes +10Spoken Dialogue SystemsSpeech Enhancement

  17. SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards

    Aug 31, 2026Zixun Guo, Calvin Murdock, Sanjeel Parekh +4Audio-Language ModelsSpatial Audio

  18. Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

    Aug 10, 2026Zhi Zeng, Cheng Zhang, Zesheng Yang +9Unified Multimodal ModelsAudio-Visual QA

  19. Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

    Aug 1, 2026Masaki Yoshida, Ren Togo, Takahiro Ogawa +1Spatial AudioAudio Generation

  20. RIPPLE: Generating Multi-Channel Phase, Not Recovering It

    Jul 30, 2026Jaehyuk Lee, Yeajin Lee, Dayeon Shin +1Spatial Audio

  21. S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information

    Jul 28, 2026Kaneyoshi Hiratsuka, Benjamin Yen, Ryosuke KojimaImitation LearningRobotic Manipulation

  22. Spacing Out: On the Reliability of Binaural Music Source Separation Metrics

    Jul 28, 2026Richa Namballa, Magdalena FuentesMusic Information RetrievalSpatial Audio

  23. Mind the Microphone Gap: Benchmarking Array Upsampling Strategies for Latent Acoustic Mapping

    Jul 27, 2026Philipp Schmidt, Huw Cheston, Juan Azcarreta +3Audio Representation LearningSelf-Supervised Learning

  24. PathRIR: Physics-Guided Acoustic Path Selection and Late-Tail Compensation for Fast Room Impulse Response Simulation

    Jul 25, 2026Shaoheng Xu, Chunyi Sun, Jihui Zhang +3Physics-Informed MLSpatial Audio

  25. Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

    Jul 9, 2026Shuo-Chun Lin, Hen-Hsen HuangAudio-Language ModelsSpatial Audio

  26. EscFOA: Enhancing Spatial Learning for Visually Impaired Learners via Generative Spatial Audio in 360-Degree Educational Environments

    Jul 8, 2026Ziyu Luo, Xiaowei Dai, Siying Zhu +1Audio Diffusion ModelsSpatial Audio

  27. ForestIR: Physics-Informed Forest Sound Simulation for Array-Based Bioacoustic Remote Sensing

    Jul 7, 2026Xin Shen, Jennifer N. Kampe, Changwoo J. Lee +7Direction-of-Arrival EstimationBioacoustics