Audio-Language Model Evaluation

Latest papers 126

All topics
CardsList
  1. VocalAffectBench: Evaluating Vocal Emotion Recognition in AI Audio Models

    Aug 28, 2026Luc Debaupte, Tyler Baumgartner, Brandon Tai +3Audio-Language Model EvaluationSpeech Emotion Recognition

  2. LongAudioSpan: Spanning the Duration and Depth of Audio Comprehension

    Aug 26, 2026Wen Huang, Yunfei Chu, Meng Gao +2Audio-Language Model EvaluationAudio Reasoning

  3. Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

    Aug 25, 2026Meruyert Aristombayeva, Jason S. Lucas, Chaewan Chun +1Audio-Language Model EvaluationHallucination Detection

  4. MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

    Aug 23, 2026Yize Li, Ningyuan Yang, Sile Yin +6Audio-Language Model EvaluationAudio Reasoning

  5. From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

    Aug 10, 2026Yuanhe Zhang, Weiliu Wang, Jie Ren +7Audio-Language Model EvaluationAudio-Language Models

  6. Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

    Aug 5, 2026Yuezhang Peng, Yuxin Liu, Changfeng Gao +4Audio-Language Model EvaluationSpoken Language Understanding

  7. Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models

    Aug 3, 2026Linkai Peng, Baorian NuchgedAudio-Language Model EvaluationSpeech Emotion Recognition

  8. TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models

    Jul 30, 2026Aryan Vijay Bhosale, Harshit Rajgarhia, Abhishek Mukherji +1Audio-Language Model EvaluationAudio Editing

  9. MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning

    Jul 29, 2026Weijie Wu, Junbo Li, Lin Li +2Audio-Language Model EvaluationAudio Captioning

  10. Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

    Jul 29, 2026Jiachen Qian, Junyu LiAudio-Language Model EvaluationLLM Safety Benchmarks

  11. ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

    Jul 20, 2026Fernando López, Ana Ayala, Guillermo Segovia +4Audio-Language Model EvaluationSpoken Language Understanding

  12. Large Audio Language Models for Spoofing-Aware Speaker Verification

    Jul 16, 2026Sofya Savelyeva, Mariia Perunova, Evgeny Kushnir +3Audio-Language Model EvaluationAudio Deepfake Detection

  13. Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

    Jul 15, 2026Joonyong Park, David M. Chan, Yuki Saito +1Audio-Language Model EvaluationLLM Auditing

  14. The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

    Jul 14, 2026Chun-Yi Kuan, Hung-yi LeeAudio-Language Model EvaluationAudio-Language Models

  15. Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models

    Jul 11, 2026Yun-Shao Tsai, Chun-Wei Chen, Chee-En Yu +2Audio-Language Model EvaluationSpeech Language Models

  16. A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

    Jul 8, 2026A. Sayyad, J. Emmons, S. Jones +2Audio-Language Model EvaluationVoice Agent Evaluation

  17. SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

    Jul 6, 2026Thomas Thebaud, Yuzhe Wang, Hao Zhang +5Audio-Language Model EvaluationLanguage Model Generation Evaluation

  18. Adaptive Perturbation Selection for Contrastive Audio Decoding

    Jun 30, 2026Aaron Isidore Grace, Zhouyuan Huo, Weiran WangAudio-Language Model EvaluationAudio-Language Model Hallucination Detection

  19. RedVox: Safety and Fairness Gaps in Speech Models Across Languages

    Jun 25, 2026Beatrice Savoldi, Sara Papi, Wafa Aissa +2Audio-Language Model EvaluationAI Safety Evaluation

  20. FBK's Long-form SpeechLLMs for IWSLT 2026 Instruction Following

    Jun 25, 2026Zhihang Xie, Marco Gaido, Sara Papi +2Audio-Language Model EvaluationSpeech Processing

  21. Real-Time Voice AI Hears but Does Not Listen

    Jun 24, 2026Martijn Bartelds, Federico Bianchi, James ZouAudio-Language Model EvaluationVoice Agent Evaluation