Audio Understanding

Latest papers 169

All topics
CardsList
  1. When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning

    Feb 28, 2026Ruixiang Mao, Xiangnan Ma, Dan Chen +12Audio ReasoningAudio Understanding

  2. AuditoryHuM: Auditory Scene Label Generation and Clustering using Human-MLLM Collaboration

    Feb 23, 2026Henry Zhong, Jörg M. Buchholz, Julian Maclaren +2ClusteringLLM-Assisted Annotation

  3. Re-purposing Multimodal Large Language Models for Audio-Text Retrieval

    Feb 20, 2026Jilan Xu, Carl Thomé, Danijela Horak +2Multimodal Large Language ModelsAudio Understanding

  4. Event-Grounded Question Answering over Long Audio via Structured Retrieval

    Feb 16, 2026Kartik Hegde, Arvind Krishna Sridhar, Naveen Vakada +2Multimodal RAGAudio QA

  5. Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

    Feb 5, 2026Jinchuan Tian, Haoran Wang, Bo-Hao Su +14Audio UnderstandingAudio-Language Models

  6. RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity

    Feb 4, 2026Gaia A. Bertolino, Yuwei Zhang, Tong Xia +2Audio-Language Model EvaluationAudio QA

  7. SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

    Jan 29, 2026Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum +2Audio-Language Model EvaluationMultimodal Grounding

  8. AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking

    Jan 25, 2026Xilin Jiang, Qiaolin Wang, Junkai Wu +30Audio-Visual UnderstandingMultimodal Large Language Models

  9. Multi-Task Instruction Tuning via Data Scheduling for Low-Resource Arabic SpeechLLMs

    Jan 18, 2026Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar ChowdhurySpoken Language UnderstandingSpeech Processing

  10. TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding

    Jan 11, 2026Mingyue Huo, Yiwen Shao, Yuheng ZhangAudio UnderstandingAutomatic Speech Recognition

  11. ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

    Nov 28, 2025Šimon Sedláček, Sara Barahona, Bolaji Yusuf +9Audio-Language Model EvaluationLLM Evaluation

  12. Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

    Nov 20, 2025Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo +3Audio-Language Model EvaluationAudio Representation Learning

  13. Silence is Golden: Mitigating Hallucinations in Large Audio-Language Models via Layer-Weighted Vector Steering

    Oct 14, 2025Tsung-En Lin, Kuan-Yi Lee, Hung-Yi LeeAudio QAHallucination in Language Models

  14. Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

    Sep 22, 2025Geewook Kim, Minjoon SeoVLM EvaluationAudio-Visual Understanding

  15. BabyHuBERT: Multilingual Self-Supervised Learning for Segmenting Speakers in Child-Centered Long-Form Recordings

    Sep 18, 2025Théo Charlot, Tarek Kunze, Maxime Poli +3Speech Foundation ModelsSpeech Processing

  16. OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder

    Jul 18, 2025Shikhar Bharadwaj, Samuele Cornell, Kwanghee Choi +4Audio Representation LearningAudio QA

  17. Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

    Jan 25, 2025Yi Su, Jisheng Bai, Qisheng Xu +2Audio Representation LearningAudio Understanding