Audio-Language Models

Latest papers 184

All topics
CardsList
  1. PitchBench: Measuring Pitch Hearing in Audio-Language Models

    May 25, 2026Milan Liessens Dujardin, Song-Ze Yu, Craver Corbyn Thomas-Smith +2Audio-Language Model EvaluationAudio Understanding

  2. Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models

    May 24, 2026Muhammad Ashad Kabir, Sirajam MuniraAudio-Language Model EvaluationZero-Shot Learning

  3. Codec-Robust Attacks on Audio LLMs

    May 19, 2026Jaechul Roh, Jean-Philippe Monteuuis, Jonathan Petit +1Adversarial RobustnessAudio-Language Models

  4. Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

    May 18, 2026Yanru Wu, Jianning Wang, Chongxin Gan +1Audio QAEfficient Language Model Training

  5. A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

    May 18, 2026Kaiwen Luo, Zhenhong Zhou, Leo Wang +31Privacy Leakage in Language ModelsAudio-Language Models

  6. Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

    May 18, 2026Yanyun Wang, Yu Huang, Zi Liang +2LLM AlignmentAudio-Language Models

  7. CBT-Audio: Evaluating Audio Language Models for Patient-Side Distress Intensity Estimation in CBT Session Recordings

    May 17, 2026Qixuan Hu, Shuchang Ye, Xumou Zhang +8Audio-Language Model EvaluationMental Health Counseling

  8. SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

    May 14, 2026KiHyun Nam, Jungwoo Heo, Siu Bae +2Audio Representation LearningSpeaker Verification

  9. Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

    May 13, 2026Trung Nguyen Quang, Cheng Yi Lewis Won, Minh Duc Pham +3Code-Switching Speech RecognitionAudio-Language Models

  10. NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

    May 13, 2026Zhongju Yuan, Geraint Wiggins, Dick BotteldoorenAudio UnderstandingAudio-Language Models

  11. Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction

    May 13, 2026Guangzeng Han, James G. Murphy, Benjamin O. Ladd +2Audio-Language ModelsMultimodal Reasoning

  12. Communicating Sound Through Natural Language

    May 9, 2026Emanuele Rossi, Emanuele RodolàAudio-Language ModelsAudio Generation

  13. Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

    May 6, 2026Zheng Fang, Xiaosen Wang, Shenyi Zhang +2Deep Learning OptimizationAudio-Language Models

  14. Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)

    May 6, 2026Cyril Allauzen, Tom Bagby, Georg Heigold +2Audio-Language Model EvaluationLLM Evaluation

  15. JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions

    May 6, 2026Leying Zhang, Bowen Shi, Haibin Wu +2Audio-Language Model EvaluationZero-Shot Learning

  16. ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

    May 5, 2026Honglei Zhang, Yuting Chen, Chenpeng Hu +2Audio ReasoningAudio Understanding

  17. When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

    May 4, 2026Pehuén Moure, Niclas Pokel, Bilal Bounajma +4Audio-Language Model EvaluationASR Evaluation

  18. Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

    Apr 28, 2026Chun-Yi Kuan, Wei-Ping Huang, Hung-yi LeeSemantic EntropyAudio Understanding

  19. All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

    Apr 27, 2026Leonardo Haw-Yang Foo, Chih-Kai Yang, Chen-An Li +2Audio-Language Model EvaluationAudio QA

  20. HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

    Apr 26, 2026Peize He, Yaodi Luo, Xiaoqian Liu +7Audio Token CompressionSelf-Attention

  21. Au-M-ol: A Unified Model for Medical Audio and Language Understanding

    Apr 25, 2026Meizhu Liu, Nistha Mitra, Paul Li +3Speech ProcessingAudio Understanding

  22. HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models

    Apr 21, 2026Feiyu Zhao, Yiming Chen, Wenhuan Lu +3Audio-Language Model EvaluationAudio-Language Model Hallucination Detection