Audio-Language Model Evaluation

Latest papers 126

All topics
CardsList
  1. MusTBench: Benchmarking and Advancing Temporal Grounding in Music LLMs

    May 28, 2026Daeyong Kwon, Qiyu Wu, Shinobu Kuriya +6Audio-Language Model EvaluationAudio Understanding

  2. ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood

    May 28, 2026Tiantian Feng, Anfeng Xu, Xuan Shi +10Audio-Language Model EvaluationSpeech Quality Assessment

  3. KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

    May 27, 2026Haechan Kim, Seungjun Chung, Inkyu Park +2Audio-Language Model EvaluationQuestion Answering

  4. Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

    May 26, 2026Jiacheng Pang, Ashutosh Chaubey, Mohammad SoleymaniAudio-Language Model EvaluationSpeech Processing

  5. Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory

    May 26, 2026Yang Xiao, Siyi Wang, Han Yin +4Audio-Language Model EvaluationMemorization in Language Models

  6. PitchBench: Measuring Pitch Hearing in Audio-Language Models

    May 25, 2026Milan Liessens Dujardin, Song-Ze Yu, Craver Corbyn Thomas-Smith +2Audio-Language Model EvaluationAudio Understanding

  7. Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models

    May 24, 2026Muhammad Ashad Kabir, Sirajam MuniraAudio-Language Model EvaluationZero-Shot Learning

  8. Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades

    May 17, 2026Donghyuk Jung, Youngwon ChoiAudio-Language Model EvaluationQuestion Answering

  9. CBT-Audio: Evaluating Audio Language Models for Patient-Side Distress Intensity Estimation in CBT Session Recordings

    May 17, 2026Qixuan Hu, Shuchang Ye, Xumou Zhang +8Audio-Language Model EvaluationMental Health Counseling

  10. When Vision Speaks for Sound

    May 13, 2026Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6Audio-Language Model EvaluationAudio-Visual Understanding

  11. Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)

    May 6, 2026Cyril Allauzen, Tom Bagby, Georg Heigold +2Audio-Language Model EvaluationLLM Evaluation

  12. JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions

    May 6, 2026Leying Zhang, Bowen Shi, Haibin Wu +2Audio-Language Model EvaluationZero-Shot Learning

  13. When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

    May 4, 2026Pehuén Moure, Niclas Pokel, Bilal Bounajma +4Audio-Language Model EvaluationASR Evaluation

  14. All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

    Apr 27, 2026Leonardo Haw-Yang Foo, Chih-Kai Yang, Chen-An Li +2Audio-Language Model EvaluationAudio QA

  15. HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models

    Apr 21, 2026Feiyu Zhao, Yiming Chen, Wenhuan Lu +3Audio-Language Model EvaluationAudio-Language Model Hallucination Detection

  16. Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment

    Apr 20, 2026Woody Haosheng Gan, William Held, Diyi YangAudio-Language Model EvaluationHuman Preference Modeling

  17. VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech

    Apr 19, 2026Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang +1Audio-Language Model EvaluationGender Bias in Language Models

  18. Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use

    Apr 17, 2026Ramit Pahwa, Apoorva Beedu, Parivesh Priye +4Audio-Language Model EvaluationVoice Agent Evaluation

  19. KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness

    Mar 30, 2026Jinyoung Kim, Hyeongsoo Lim, Eunseo Seo +4Audio-Language Model EvaluationSpeech Processing

  20. PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark

    Mar 15, 2026Mohammad Javad Ranjbar Kalahroodi, Mohammad Amini, Parmis Bathayan +2Audio-Language Model EvaluationAudio Reasoning

  21. MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models

    Mar 10, 2026Chih-Kai Yang, Yun-Shao Tsai, Yu-Kai Guo +7Audio-Language Model EvaluationAudio Understanding

  22. RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity

    Feb 4, 2026Gaia A. Bertolino, Yuwei Zhang, Tong Xia +2Audio-Language Model EvaluationAudio QA