Audio Understanding

Latest papers 169

All topics
CardsList
  1. An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

    Jul 23, 2026Liang-Yuan Wu, Sripathi Sridhar, Mark Cartwright +1Audio UnderstandingAutomated Evaluation

  2. Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models

    Jul 13, 2026Yu-Han Huang, Chih-Kai Yang, Ke-Han Lu +2Audio UnderstandingAudio-Language Models

  3. GigaChat Audio: Time-aware Large Audio Language Model

    Jul 11, 2026Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov +4Audio QAAudio Understanding

  4. TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios

    Jul 7, 2026Hong Lyu, Mingru Yang, Qianhua He +3Training Data CurationAudio Understanding

  5. Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding

    Jul 5, 2026Zihan Zhang, Xize Cheng, Wenhao Yan +5Audio UnderstandingAudio-Language Models

  6. Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

    Jul 4, 2026Héctor Martel, Joe Hennessy-Priest, Taemin ChoRepresentation GeometryAudio Representation Learning

  7. Grammar-Guided Hierarchical Parsing for Long-form Audio Activity Recognition

    Jun 26, 2026Peng Zhang, Qingyu Luo, Philip J. B. Jackson +1Temporal Action SegmentationHuman Activity Recognition

  8. From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

    Jun 24, 2026Pengfei Zhang, Hoang H Nguyen, Kazi Shaharair Sharif +6Audio-Language Model EvaluationAudio Understanding

  9. Beyond Classification: A Cough Regression Benchmark for Respiratory Acoustic Foundation Models

    Jun 13, 2026Mayur Sanap, Prasanna Desikan, Edgar LobatonAudio UnderstandingClinical Prediction

  10. Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources

    Jun 12, 2026Oh Hyun-Bin, Kazuki Shimada, Yuhta Takida +6Audio-Language Model EvaluationAudio Representation Learning

  11. Decoding Insect Song: A Multitask Semisupervised Orthoptera Bioacoustic Classifier

    Jun 11, 2026Olga Isupova, Danil Kuzin, Ella Browning +2Audio Representation LearningAudio Understanding

  12. From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation

    Jun 11, 2026Fengrui Liu, Ruiyang Huang, Qijian Zheng +2Synthetic Data PretrainingAudio Representation Learning

  13. Dolph2Vec: Self-Supervised Representations of Dolphin Vocalizations

    Jun 10, 2026Chiara Semenzin, Faadil Mustun, Roberto Dessi +5Audio Representation LearningAudio Understanding

  14. Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

    Jun 10, 2026Zhen Ye, Xu Tan, Yiming Li +10Spoken Language UnderstandingAudio Representation Learning

  15. Lung-SRAD: Spectral-Aware Regularized Audio DASS with Dual-Axis Patch-Mix Contrastive Learning for Respiratory Sound Classification

    Jun 10, 2026Hemansh Shridhar, Miika Toikkanen, June-Woo KimContrastive LearningSpectral Regularization

  16. Context-Aware Multimodal Claim Verification in Spoken Dialogues

    Jun 9, 2026Chaewan Chun, Delvin Ce Zhang, Dongwon LeeClaim VerificationAudio Understanding

  17. Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models

    Jun 9, 2026Tsung-En Lin, Hung-Yi LeeLanguage Model SteeringAudio Understanding

  18. AuRA: Internalizing Audio Understanding into LLMs as LoRA

    Jun 9, 2026Bo Cheng, Lei Shi, Zhanyu Ma +5Spoken Language UnderstandingAudio Understanding

  19. ViP-VL: Vietnamese Self-supervised Speech Pretraining Model with Vector-Quantization Learning

    Jun 9, 2026Khanh Le, Kiet Anh Hoang, Bao Nguyen +5Audio Representation LearningSpeech Processing

  20. RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark

    Jun 9, 2026Hongyu Jin, Siyi Wang, Yang Xiao +10Audio-Language Model EvaluationAudio Understanding

  21. Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

    Jun 8, 2026Ming-Hao Hsu, Yuxuan Hu, Shujie Liu +3Audio Representation LearningAudio Understanding

  22. AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning

    Jun 7, 2026Xiangyu Zhao, Junyu Yan, Yaling Shen +7Audio-Language Model EvaluationReasoning Evaluation

  23. Titans-as-a-Layer: Test-Time Memory for Conversational Speech Emotion Recognition

    Jun 7, 2026Daniel Chen, Qicong Hu, Yang Xiao +2Memory-Augmented Language ModelsAudio Understanding

  24. TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints

    Jun 7, 2026Vinh-Thuan LyAudio ReasoningAudio Understanding

  25. AeroSpectra Sentinel: An Auditable LLM Prompt-Chaining Decision-Support Workflow for Acute Asthma Risk Assessment from Respiratory Sounds and Clinical Signals

    Jun 6, 2026Aueaphum AueawatthanaphisutLLM AuditingClinical Decision Support