Audio Understanding

Latest papers 169

All topics
CardsList
  1. CARES: A Controlled Synthetic Benchmark of Speaker Reactions to Sound

    Oct 7, 2026Marcel Gibier, Thomas Thebaud, Olivier Boëffard +1Audio UnderstandingAudio Captioning

  2. ARIA: Audio-Driven Melody-Tone Relation Modeling for Cantonese Lyric Authoring

    Oct 6, 2026Shengyu Li, Jinting Wang, Li LiuAudio UnderstandingText Generation

  3. SkillFormer: Skill-Decomposed Adaptation for Audio Language Models

    Oct 6, 2026Lee Seung-woo, Bowen Qi, Kim Min-jun +1Multi-Task LearningAudio Understanding

  4. Logbook: Extremely Long-form Audio Event Understanding

    Oct 5, 2026Kwanghee Choi, Suwon Shon, Dmitriy Serdyuk +7Audio-Language Model EvaluationAudio Understanding

  5. Revisiting Frame-Wise Saliency for Audio Moment Retrieval

    Oct 5, 2026Tatsuya Komatsu, Hokuto MunakataDetection TransformerAudio Understanding

  6. LAST: Looped Audio Spectrogram Transformer

    Oct 1, 2026Haider Al-Tahan, Sean O'Brien, Anastasia Razdaibiedina +1Audio UnderstandingRecurrent Transformers

  7. Multi-agent Auditory Scene Analysis: Improved Localization Speed and Robustness by Multi-beamformed Speech Quality Feedback

    Sep 30, 2026Caleb RasconMulti-Agent System OptimizationDirection-of-Arrival Estimation

  8. UniAE-MoE: A Unified Audio Encoder via Mixture of Experts

    Sep 30, 2026Shengbo Cai, Zhisheng Zhang, Zichao Nie +3Audio Representation LearningMixture of Experts

  9. Audio Token Attention Is Predictable Before the Language Model Runs

    Sep 30, 2026Kyoungjun Park, Yunzhe Li, Lili QiuAudio Token CompressionAudio Understanding

  10. Probing Large Audio-Language Models for Compositional Understanding of Sounding Actions

    Sep 28, 2026Michel Olvera, Paraskevas Stamatiadis, Changhong Wang +1Audio-Language Model EvaluationAudio Reasoning

  11. When Does the Concept of "Dog" Emerge in an Audio LLM?

    Sep 27, 2026Zhe Wang, Shiqi Liu, Ruiyun Zhong +2Audio UnderstandingAudio-Language Models

  12. EvoAudio: Recursive Self-Improvement for Audio Understanding

    Sep 23, 2026Yuxiang Wang, Shengbo Cai, Yingda Shen +6Synthetic Data GenerationAudio Understanding

  13. MuLA-Bench: A Multilingual Long-Form Audio Understanding Benchmark via Multi-Tier Auditing

    Sep 20, 2026Zeyu Yang, Xinyu Zhang, Zibo Bi +5Audio-Language Model EvaluationAudio Understanding

  14. Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs

    Sep 19, 2026Jing Peng, Zichao Nie, Zhisheng Zhang +2Audio-Language Model EvaluationAudio Representation Learning

  15. Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception

    Sep 14, 2026Yanfeng Shi, Yan Song, Junhui Li +4Audio UnderstandingAudio-Language Models

  16. NVV-Locator: From Transcript Tags to Acoustic Boundaries for Fine-Grained Nonverbal Vocalization Grounding

    Sep 9, 2026Yuang Cao, Bingshen Mu, Zhennan Lin +7Audio UnderstandingSound Event Detection

  17. Source-Adaptive Data Curation for Bilingual NVV-Aware ASR

    Sep 9, 2026Yuang Cao, Qirui Zhan, Jingbin Hu +7Speech ProcessingAudio Understanding

  18. Geometry-Informed Distributed Acoustic Scene Understanding

    Sep 7, 2026Yiyuan Yang, Shitong Xu, Niki Trigoni +1Scene Graph GenerationAudio Understanding

  19. Auditory Illusion Benchmark for Large Audio Language Models

    Sep 2, 2026Hayoon Kim, Eunice Hong, Kyogu LeeAudio Understanding

  20. TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

    Aug 30, 2026Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3Audio UnderstandingAudio-Language Models

  21. LongAudioSpan: Spanning the Duration and Depth of Audio Comprehension

    Aug 26, 2026Wen Huang, Yunfei Chu, Meng Gao +2Audio-Language Model EvaluationAudio Reasoning

  22. Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

    Aug 12, 2026Xulin Fan, Jialu Li, Mohammad Nur Hossain Khan +4Speech Foundation ModelsDomain Generalization

  23. From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music

    Aug 6, 2026Sangheon Park, Claire ArthurText-to-Music GenerationAudio Understanding

  24. TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models

    Jul 30, 2026Aryan Vijay Bhosale, Harshit Rajgarhia, Abhishek Mukherji +1Audio-Language Model EvaluationAudio Editing

  25. Enhancing Law-Enforcement Audio Transcription: A LoRA-Based Adaptation of Whisper for BWC Footage

    Jul 27, 2026Vivek Senthil, Ernest FokouéSpeech Foundation ModelsAudio Understanding

  26. An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

    Jul 23, 2026Liang-Yuan Wu, Sripathi Sridhar, Mark Cartwright +1Audio UnderstandingAutomated Evaluation

  27. Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models

    Jul 13, 2026Yu-Han Huang, Chih-Kai Yang, Ke-Han Lu +2Audio UnderstandingAudio-Language Models

  28. GigaChat Audio: Time-aware Large Audio Language Model

    Jul 11, 2026Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov +4Audio QAAudio Understanding

  29. TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios

    Jul 7, 2026Hong Lyu, Mingru Yang, Qianhua He +3Training Data CurationAudio Understanding

  30. Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding

    Jul 5, 2026Zihan Zhang, Xize Cheng, Wenhao Yan +5Audio UnderstandingAudio-Language Models

  31. Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

    Jul 4, 2026Héctor Martel, Joe Hennessy-Priest, Taemin ChoRepresentation GeometryAudio Representation Learning

  32. Grammar-Guided Hierarchical Parsing for Long-form Audio Activity Recognition

    Jun 26, 2026Peng Zhang, Qingyu Luo, Philip J. B. Jackson +1Temporal Action SegmentationHuman Activity Recognition

  33. From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

    Jun 24, 2026Pengfei Zhang, Hoang H Nguyen, Kazi Shaharair Sharif +6Audio-Language Model EvaluationAudio Understanding

  34. Beyond Classification: A Cough Regression Benchmark for Respiratory Acoustic Foundation Models

    Jun 13, 2026Mayur Sanap, Prasanna Desikan, Edgar LobatonAudio UnderstandingClinical Prediction

  35. Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources

    Jun 12, 2026Oh Hyun-Bin, Kazuki Shimada, Yuhta Takida +6Audio-Language Model EvaluationAudio Representation Learning

  36. Decoding Insect Song: A Multitask Semisupervised Orthoptera Bioacoustic Classifier

    Jun 11, 2026Olga Isupova, Danil Kuzin, Ella Browning +2Audio Representation LearningAudio Understanding

  37. From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation

    Jun 11, 2026Fengrui Liu, Ruiyang Huang, Qijian Zheng +2Synthetic Data PretrainingAudio Representation Learning

  38. Dolph2Vec: Self-Supervised Representations of Dolphin Vocalizations

    Jun 10, 2026Chiara Semenzin, Faadil Mustun, Roberto Dessi +5Audio Representation LearningAudio Understanding

  39. Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

    Jun 10, 2026Zhen Ye, Xu Tan, Yiming Li +10Spoken Language UnderstandingAudio Representation Learning

  40. Lung-SRAD: Spectral-Aware Regularized Audio DASS with Dual-Axis Patch-Mix Contrastive Learning for Respiratory Sound Classification

    Jun 10, 2026Hemansh Shridhar, Miika Toikkanen, June-Woo KimContrastive LearningSpectral Regularization

  41. Context-Aware Multimodal Claim Verification in Spoken Dialogues

    Jun 9, 2026Chaewan Chun, Delvin Ce Zhang, Dongwon LeeClaim VerificationAudio Understanding

  42. Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models

    Jun 9, 2026Tsung-En Lin, Hung-Yi LeeLanguage Model SteeringAudio Understanding

  43. AuRA: Internalizing Audio Understanding into LLMs as LoRA

    Jun 9, 2026Bo Cheng, Lei Shi, Zhanyu Ma +5Spoken Language UnderstandingAudio Understanding

  44. ViP-VL: Vietnamese Self-supervised Speech Pretraining Model with Vector-Quantization Learning

    Jun 9, 2026Khanh Le, Kiet Anh Hoang, Bao Nguyen +5Audio Representation LearningSpeech Processing

  45. RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark

    Jun 9, 2026Hongyu Jin, Siyi Wang, Yang Xiao +10Audio-Language Model EvaluationAudio Understanding

  46. Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

    Jun 8, 2026Ming-Hao Hsu, Yuxuan Hu, Shujie Liu +3Audio Representation LearningAudio Understanding

  47. AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning

    Jun 7, 2026Xiangyu Zhao, Junyu Yan, Yaling Shen +7Audio-Language Model EvaluationReasoning Evaluation

  48. Titans-as-a-Layer: Test-Time Memory for Conversational Speech Emotion Recognition

    Jun 7, 2026Daniel Chen, Qicong Hu, Yang Xiao +2Memory-Augmented Language ModelsAudio Understanding

  49. TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints

    Jun 7, 2026Vinh-Thuan LyAudio ReasoningAudio Understanding

  50. AeroSpectra Sentinel: An Auditable LLM Prompt-Chaining Decision-Support Workflow for Acute Asthma Risk Assessment from Respiratory Sounds and Clinical Signals

    Jun 6, 2026Aueaphum AueawatthanaphisutLLM AuditingClinical Decision Support