Audio Understanding

Latest papers 169

All topics
CardsList
  1. Mixed-Precision Information Bottlenecks for On-Device Trait-State Disentanglement in Bipolar Agitation Detection

    May 4, 2026Joydeep ChandraMixed-Precision QuantizationInformation Bottleneck

  2. MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

    May 1, 2026Harshit Rajgarhia, Shuubham Ojha, Asif Shaik +4Audio QAHealthcare

  3. From Birdsong to Rumbles: Classifying Elephant Calls with Out-of-Species Embeddings

    Apr 30, 2026Christiaan M. Geldenhuys, Thomas R. NieslerAudio Representation LearningAudio Understanding

  4. Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

    Apr 28, 2026Chun-Yi Kuan, Wei-Ping Huang, Hung-yi LeeSemantic EntropyAudio Understanding

  5. All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

    Apr 27, 2026Leonardo Haw-Yang Foo, Chih-Kai Yang, Chen-An Li +2Audio-Language Model EvaluationAudio QA

  6. Exploring Audio Hallucination in Egocentric Video Understanding

    Apr 26, 2026Ashish Seth, Xinhao Mei, Changsheng Zhao +9Audio-Visual UnderstandingHallucination in Language Models

  7. HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

    Apr 26, 2026Peize He, Yaodi Luo, Xiaoqian Liu +7Audio Token CompressionSelf-Attention

  8. Au-M-ol: A Unified Model for Medical Audio and Language Understanding

    Apr 25, 2026Meizhu Liu, Nistha Mitra, Paul Li +3Speech ProcessingAudio Understanding

  9. AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA

    Apr 23, 2026Tasnim Kabir, Dmytro Kurdydyk, Aadi Palnitkar +3Audio QAAudio Reasoning

  10. HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models

    Apr 21, 2026Feiyu Zhao, Yiming Chen, Wenhuan Lu +3Audio-Language Model EvaluationAudio-Language Model Hallucination Detection

  11. Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

    Apr 20, 2026Xiang He, Chenxing Li, Jinting Wang +5RL for Language Model ReasoningAudio Reasoning

  12. Still Between Us? Evaluating and Improving Voice Assistant Robustness to Third-Party Interruptions

    Apr 19, 2026Dongwook Lee, Eunwoo Song, Che Hyun Lee +2Spoken Dialogue SystemsAudio Understanding

  13. Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

    Apr 17, 2026Habibeh Naderi, Behrouz Haji Soleimani, Stan MatwinCross-Modal LearningModality Imbalance

  14. TinyMU: A Compact Audio-Language Model for Music Understanding

    Apr 17, 2026Xiquan Li, Aurian Quelennec, Slim EssidSmall Language ModelsAudio Understanding

  15. Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

    Apr 16, 2026Jieyi Wang, Yazhe Niu, Dexuan Xu +1Audio QAAudio Reasoning

  16. Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models

    Apr 16, 2026Yanda Li, Yuhan Liu, Zirui Song +3Audio UnderstandingAudio-Language Models

  17. VoxSafeBench: Not Just What Is Said, but Who, How, and Where

    Apr 16, 2026Yuxiang Wang, Hongyu Liu, Yijiang Xu +9Language Model Safety EvaluationPrivacy Leakage in Language Models

  18. KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness

    Mar 30, 2026Jinyoung Kim, Hyeongsoo Lim, Eunseo Seo +4Audio-Language Model EvaluationSpeech Processing

  19. PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark

    Mar 15, 2026Mohammad Javad Ranjbar Kalahroodi, Mohammad Amini, Parmis Bathayan +2Audio-Language Model EvaluationAudio Reasoning

  20. Causal Tracing of Audio-Text Fusion in Large Audio Language Models

    Mar 14, 2026Wei-Chih Chen, Chien-yu Huang, Hung-yi LeeLLM InterpretabilityAudio Understanding

  21. MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models

    Mar 10, 2026Chih-Kai Yang, Yun-Shao Tsai, Yu-Kai Guo +7Audio-Language Model EvaluationAudio Understanding

  22. Focus Then Listen: An Empirical Study of Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models

    Mar 5, 2026Han Yin, Yang Xiao, Younghoo Kwon +2Audio UnderstandingAudio-Language Models