Audio-Language Model Evaluation

Latest papers 125

All topics
CardsList
  1. CARES: A Controlled Synthetic Benchmark of Speaker Reactions to Sound

    Oct 7, 2026Marcel Gibier, Thomas Thebaud, Olivier Boëffard +1Audio UnderstandingAudio Captioning

  2. Logbook: Extremely Long-form Audio Event Understanding

    Oct 5, 2026Kwanghee Choi, Suwon Shon, Dmitriy Serdyuk +7Audio-Language Model EvaluationAudio Understanding

  3. RMS-AQA: A Two-Stage Spatial Audio Question Answering Benchmark for Real-World Domestic Environments

    Oct 1, 2026Peihao Chen, Qing Wang, Lichun Fan +12Audio-Language Model EvaluationAudio QA

  4. SEAR: Spoofing Evidence-Grounded Audio Reasoning Benchmark for Audio Language Models

    Sep 30, 2026Rong Wan, Suliu Qin, Jiaxi Li +5Audio-Language Model EvaluationAudio Deepfake Detection

  5. Role-guided Speaker Deletion Verification in Clinical Psychiatry Speech Recordings with Audio Language Models

    Sep 29, 2026Joseph T Colonel, Daniel Katzman, Kelsey Kirker +6Audio-Language Model EvaluationSpeaker Verification

  6. When Capabilities Fail to Compose: Diagnosing the Compositionality Gap in Large Audio-Language Models

    Sep 29, 2026Chien-Feng Liu, Chih-Kai Yang, Bo-Han Feng +3Audio-Language Model EvaluationAudio QA

  7. Probing Large Audio-Language Models for Compositional Understanding of Sounding Actions

    Sep 28, 2026Michel Olvera, Paraskevas Stamatiadis, Changhong Wang +1Audio-Language Model EvaluationAudio Reasoning

  8. SpeechCritic: Learning a Diagnostic Speech Judge from Limited Human Preferences

    Sep 28, 2026Mingyue Huo, Shivam Mehta, Bhavin Jawade +2Audio-Language Model EvaluationHuman Preference Modeling

  9. MISHAP-Bench: A Hallucination Benchmark for Large Audio-Language Models

    Sep 27, 2026Zhi Wen Soi, Giulio Segalini, Jian-Jia Chen +1Audio-Language Model EvaluationAudio-Language Model Hallucination Detection

  10. Audio LLMs Know When They Can't Hear You

    Sep 24, 2026Amirhosein Javadi, Richa Dixit, Mehrdad Farajtabar +3Audio-Language Model EvaluationLanguage Model Self-Assessment

  11. To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech

    Sep 24, 2026Debajyoti Mazumder, Mamta, Abhirama Subramanyam PenamakuriAudio-Language Model EvaluationRetrieval-Augmented Generation

  12. Broadening Uncertainty Estimation for Audio Question Answering Across Methods, Formats, and Inputs

    Sep 24, 2026Aaron Isidore Grace, Weiran WangAudio-Language Model EvaluationAudio QA

  13. Spooftral: Can Voxtral Audio-Language Model Detect Speech Spoofing?

    Sep 23, 2026Avishai Weizman, Yehuda Ben-Shimol, Itshak LapidotAudio-Language Model EvaluationAudio Deepfake Detection

  14. Text Scores Do Not Establish Performance on Lexically Non-Diagnostic Speech Tasks: A Qwen2-Audio Quantization Case Study

    Sep 20, 2026Mengzhe Geng, Jinxi Ji, Junhao XuAudio-Language Model EvaluationMixed-Precision Quantization

  15. MuLA-Bench: A Multilingual Long-Form Audio Understanding Benchmark via Multi-Tier Auditing

    Sep 20, 2026Zeyu Yang, Xinyu Zhang, Zibo Bi +5Audio-Language Model EvaluationAudio Understanding

  16. Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs

    Sep 19, 2026Jing Peng, Zichao Nie, Zhisheng Zhang +2Audio-Language Model EvaluationAudio Representation Learning

  17. Correlation-Guided Encoder Selection for Multi-Encoder Large Audio-Language Models

    Sep 16, 2026Pei-Jun Liao, Hung-Shin Lee, Wenze Ren +3Audio-Language Model EvaluationAudio-Language Models

  18. CLASH: Counterfactual Auditing of Lexical and Prosodic Reliance in Spoken Sarcasm Detection

    Sep 15, 2026Qiyang Sun, Xudong Li, Yupei Li +4Audio-Language Model EvaluationCounterfactual Evaluation

  19. MUUNRiver-Bench: Diagnosing Relation-Dependent Music Retrieval with Multimodal Instructions

    Sep 14, 2026Zhancheng Guo, Congren Dai, Shangda Wu +4Audio-Language Model EvaluationAudio-Text Retrieval

  20. Beyond Word Error Rate: A Switch Aware Evaluation of ASR and Audio Language Models on English Yoruba Code-Switched Speech

    Sep 12, 2026Chibuzor Okocha, Christan Earl GrantAudio-Language Model EvaluationCode-Switching Speech Recognition

  21. Nuha-Speech: Building General-Purpose Arabic Speech-LLMs

    Sep 11, 2026Yingzhi Wang, Reem Alhazzani, Muhammad AlqurishiAudio-Language Model EvaluationAudio QA

  22. Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models

    Sep 9, 2026Yupei Li, Qiyang Sun, Mohamed Mady +4Audio-Language Model EvaluationAudio Reasoning

  23. SEA-SpeechBench: A Large-Scale Multitask Benchmark for Speech Understanding Across Southeast Asia

    Sep 9, 2026Jingyi Liao, Wenyu Zhang, Zhuohan Liu +6Audio-Language Model EvaluationASR Evaluation

  24. Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

    Sep 1, 2026Bhuvan Koduru, Dareen Safar B Alharthi, Rita Singh +1Audio-Language Model EvaluationAudio-Language Models

  25. When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection

    Aug 31, 2026Yongjian Chen, Pengfei Wei, Yiqun Sun +2Audio-Language Model EvaluationPragmatic Reasoning in Language Models

  26. VocalAffectBench: Evaluating Vocal Emotion Recognition in AI Audio Models

    Aug 28, 2026Luc Debaupte, Tyler Baumgartner, Brandon Tai +3Audio-Language Model EvaluationSpeech Emotion Recognition

  27. LongAudioSpan: Spanning the Duration and Depth of Audio Comprehension

    Aug 26, 2026Wen Huang, Yunfei Chu, Meng Gao +2Audio-Language Model EvaluationAudio Reasoning

  28. Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

    Aug 25, 2026Meruyert Aristombayeva, Jason S. Lucas, Chaewan Chun +1Audio-Language Model EvaluationHallucination Detection

  29. MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

    Aug 23, 2026Yize Li, Ningyuan Yang, Sile Yin +6Audio-Language Model EvaluationAudio Reasoning

  30. From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

    Aug 10, 2026Yuanhe Zhang, Weiliu Wang, Jie Ren +7Audio-Language Model EvaluationAudio-Language Models

  31. Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

    Aug 5, 2026Yuezhang Peng, Yuxin Liu, Changfeng Gao +4Audio-Language Model EvaluationSpoken Language Understanding

  32. Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models

    Aug 3, 2026Linkai Peng, Baorian NuchgedAudio-Language Model EvaluationSpeech Emotion Recognition

  33. TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models

    Jul 30, 2026Aryan Vijay Bhosale, Harshit Rajgarhia, Abhishek Mukherji +1Audio-Language Model EvaluationAudio Editing

  34. MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning

    Jul 29, 2026Weijie Wu, Junbo Li, Lin Li +2Audio-Language Model EvaluationAudio Captioning

  35. Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

    Jul 29, 2026Jiachen Qian, Junyu LiAudio-Language Model EvaluationLLM Safety Benchmarks

  36. ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

    Jul 20, 2026Fernando López, Ana Ayala, Guillermo Segovia +4Audio-Language Model EvaluationSpoken Language Understanding

  37. Large Audio Language Models for Spoofing-Aware Speaker Verification

    Jul 16, 2026Sofya Savelyeva, Mariia Perunova, Evgeny Kushnir +3Audio-Language Model EvaluationAudio Deepfake Detection

  38. Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

    Jul 15, 2026Joonyong Park, David M. Chan, Yuki Saito +1Audio-Language Model EvaluationLLM Auditing

  39. The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

    Jul 14, 2026Chun-Yi Kuan, Hung-yi LeeAudio-Language Model EvaluationAudio-Language Models

  40. Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models

    Jul 11, 2026Yun-Shao Tsai, Chun-Wei Chen, Chee-En Yu +2Audio-Language Model EvaluationSpeech Language Models

  41. A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

    Jul 8, 2026A. Sayyad, J. Emmons, S. Jones +2Audio-Language Model EvaluationVoice Agent Evaluation

  42. SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

    Jul 6, 2026Thomas Thebaud, Yuzhe Wang, Hao Zhang +5Audio-Language Model EvaluationLanguage Model Generation Evaluation

  43. Adaptive Perturbation Selection for Contrastive Audio Decoding

    Jun 30, 2026Aaron Isidore Grace, Zhouyuan Huo, Weiran WangAudio-Language Model EvaluationAudio-Language Model Hallucination Detection

  44. RedVox: Safety and Fairness Gaps in Speech Models Across Languages

    Jun 25, 2026Beatrice Savoldi, Sara Papi, Wafa Aissa +2Audio-Language Model EvaluationAI Safety Evaluation

  45. FBK's Long-form SpeechLLMs for IWSLT 2026 Instruction Following

    Jun 25, 2026Zhihang Xie, Marco Gaido, Sara Papi +2Audio-Language Model EvaluationSpeech Processing

  46. Real-Time Voice AI Hears but Does Not Listen

    Jun 24, 2026Martijn Bartelds, Federico Bianchi, James ZouAudio-Language Model EvaluationVoice Agent Evaluation