Audio Understanding

Latest papers 170

All topics
CardsList
  1. CARES: A Controlled Synthetic Benchmark of Speaker Reactions to Sound

    Oct 7, 2026Marcel Gibier, Thomas Thebaud, Olivier Boëffard +1Audio UnderstandingAudio Captioning

  2. ARIA: Audio-Driven Melody-Tone Relation Modeling for Cantonese Lyric Authoring

    Oct 6, 2026Shengyu Li, Jinting Wang, Li LiuAudio UnderstandingText Generation

  3. SkillFormer: Skill-Decomposed Adaptation for Audio Language Models

    Oct 6, 2026Lee Seung-woo, Bowen Qi, Kim Min-jun +1Multi-Task LearningAudio Understanding

  4. Logbook: Extremely Long-form Audio Event Understanding

    Oct 5, 2026Kwanghee Choi, Suwon Shon, Dmitriy Serdyuk +7Audio-Language Model EvaluationAudio Understanding

  5. Revisiting Frame-Wise Saliency for Audio Moment Retrieval

    Oct 5, 2026Tatsuya Komatsu, Hokuto MunakataDetection TransformerAudio Understanding

  6. LAST: Looped Audio Spectrogram Transformer

    Oct 1, 2026Haider Al-Tahan, Sean O'Brien, Anastasia Razdaibiedina +1Audio UnderstandingRecurrent Transformers

  7. Multi-agent Auditory Scene Analysis: Improved Localization Speed and Robustness by Multi-beamformed Speech Quality Feedback

    Sep 30, 2026Caleb RasconMulti-Agent System OptimizationDirection-of-Arrival Estimation

  8. UniAE-MoE: A Unified Audio Encoder via Mixture of Experts

    Sep 30, 2026Shengbo Cai, Zhisheng Zhang, Zichao Nie +3Audio Representation LearningMixture of Experts

  9. Audio Token Attention Is Predictable Before the Language Model Runs

    Sep 30, 2026Kyoungjun Park, Yunzhe Li, Lili QiuAudio Token CompressionAudio Understanding

  10. Probing Large Audio-Language Models for Compositional Understanding of Sounding Actions

    Sep 28, 2026Michel Olvera, Paraskevas Stamatiadis, Changhong Wang +1Audio-Language Model EvaluationAudio Reasoning

  11. When Does the Concept of "Dog" Emerge in an Audio LLM?

    Sep 27, 2026Zhe Wang, Shiqi Liu, Ruiyun Zhong +2Audio UnderstandingAudio-Language Models

  12. EvoAudio: Recursive Self-Improvement for Audio Understanding

    Sep 23, 2026Yuxiang Wang, Shengbo Cai, Yingda Shen +6Synthetic Data GenerationAudio Understanding

  13. MuLA-Bench: A Multilingual Long-Form Audio Understanding Benchmark via Multi-Tier Auditing

    Sep 20, 2026Zeyu Yang, Xinyu Zhang, Zibo Bi +5Audio-Language Model EvaluationAudio Understanding

  14. Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs

    Sep 19, 2026Jing Peng, Zichao Nie, Zhisheng Zhang +2Audio-Language Model EvaluationAudio Representation Learning

  15. Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception

    Sep 14, 2026Yanfeng Shi, Yan Song, Junhui Li +4Audio UnderstandingAudio-Language Models

  16. NVV-Locator: From Transcript Tags to Acoustic Boundaries for Fine-Grained Nonverbal Vocalization Grounding

    Sep 9, 2026Yuang Cao, Bingshen Mu, Zhennan Lin +7Audio UnderstandingSound Event Detection

  17. Source-Adaptive Data Curation for Bilingual NVV-Aware ASR

    Sep 9, 2026Yuang Cao, Qirui Zhan, Jingbin Hu +7Speech ProcessingAudio Understanding

  18. Geometry-Informed Distributed Acoustic Scene Understanding

    Sep 7, 2026Yiyuan Yang, Shitong Xu, Niki Trigoni +1Scene Graph GenerationAudio Understanding

  19. Auditory Illusion Benchmark for Large Audio Language Models

    Sep 2, 2026Hayoon Kim, Eunice Hong, Kyogu LeeAudio Understanding

  20. TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

    Aug 30, 2026Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3Audio UnderstandingAudio-Language Models

  21. LongAudioSpan: Spanning the Duration and Depth of Audio Comprehension

    Aug 26, 2026Wen Huang, Yunfei Chu, Meng Gao +2Audio-Language Model EvaluationAudio Reasoning

  22. Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

    Aug 12, 2026Xulin Fan, Jialu Li, Mohammad Nur Hossain Khan +4Speech Foundation ModelsDomain Generalization

  23. From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music

    Aug 6, 2026Sangheon Park, Claire ArthurText-to-Music GenerationAudio Understanding

  24. TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models

    Jul 30, 2026Aryan Vijay Bhosale, Harshit Rajgarhia, Abhishek Mukherji +1Audio-Language Model EvaluationAudio Editing