Audio-Language Models

Latest papers 184

All topics
CardsList
  1. STEMMA: Song-to-Stem Multi-Audio Reasoning for Large Audio Language Models

    Oct 8, 2026Hoyeol Sohn, Wonil Kim, Keunhyoung Kim +7Audio ReasoningAudio-Language Models

  2. Selective Listening: Mechanism-Guided Control of Audio Influence in Large Audio-Language Models

    Oct 8, 2026Yulin Sun, Kele Xu, Yong DouAudio-Language ModelsMultimodal Reasoning

  3. Listen-to-Reason: Listen with Experts, Retrieve over a Graph, Reason with LLMs

    Oct 7, 2026Pooneh Mousavi, Mirco Ravanelli, Cem SubakanAudio-Language ModelsAudio Reasoning

  4. BEANS-Next and ROOTS: Broadening Audio-Language Capabilities for Bioacoustics

    Oct 7, 2026Christos Plachouras, David Robinson, Marius Miron +17BioacousticsAudio-Language Models

  5. SkillFormer: Skill-Decomposed Adaptation for Audio Language Models

    Oct 6, 2026Lee Seung-woo, Bowen Qi, Kim Min-jun +1Multi-Task LearningAudio Understanding

  6. SEA-LM: Egocentric Spatial Audio Understanding for Wearable Microphone Arrays

    Oct 4, 2026Sonal Kumar, Sinan Hersek, Artem Dementyev +6Direction-of-Arrival EstimationAudio-Language Models

  7. AudioJev: Direct Audio Decisions with Order-Calibrated Probabilities

    Oct 1, 2026Sihan Lv, Zhen Li, Zhiqi Cao +4Audio QAAudio Reasoning

  8. AnchorPrompt: Self-Distilled Soft Prompts for Robust Audio-Language Models

    Sep 30, 2026Pooneh Mousavi, Amir Ivry, Mirco Ravanelli +1Audio-Language ModelsPrompt Tuning

  9. SEAR: Spoofing Evidence-Grounded Audio Reasoning Benchmark for Audio Language Models

    Sep 30, 2026Rong Wan, Suliu Qin, Jiaxi Li +5Audio-Language Model EvaluationAudio Deepfake Detection

  10. SE-ADD: Self-Evolving Audio Deepfake Detection with Mistake-Driven Supervision

    Sep 30, 2026Rong Wan, Wei Xie, Jiaxi Li +4Audio Deepfake DetectionSelf-Training for Language Models

  11. Audio Token Attention Is Predictable Before the Language Model Runs

    Sep 30, 2026Kyoungjun Park, Yunzhe Li, Lili QiuAudio Token CompressionAudio Understanding

  12. AS2^2D: Accelerating On-Demand Audio Understanding on Mobile Devices

    Sep 29, 2026Yunzhe Li, Kyoungjun Park, Hongzi Zhu +1On-Device Language Model InferenceLanguage Model Decoding

  13. When Capabilities Fail to Compose: Diagnosing the Compositionality Gap in Large Audio-Language Models

    Sep 29, 2026Chien-Feng Liu, Chih-Kai Yang, Bo-Han Feng +3Audio-Language Model EvaluationAudio QA

  14. Long-Term Memory-Guided Enhancement for Target Perception in Audio-Language Models

    Sep 29, 2026Zhenhong Zhou, Xuanyue Zhao, Youji Liu +4Audio-Language ModelsSpeech Enhancement

  15. Probing Large Audio-Language Models for Compositional Understanding of Sounding Actions

    Sep 28, 2026Michel Olvera, Paraskevas Stamatiadis, Changhong Wang +1Audio-Language Model EvaluationAudio Reasoning

  16. On Temporal Binding in Large Audio Language Models

    Sep 28, 2026Paul Primus, Gerhard WidmerLLM InterpretabilityAudio Reasoning

  17. SAIL: Spatial Audio Intelligence with Large Language Models via Disentangled Acoustic-Spatial Encoding and Dual-Stream Q-Former

    Sep 28, 2026Zhengding Luo, Jinyang Wu, Haozhe Ma +3Audio ReasoningDirection-of-Arrival Estimation

  18. MISHAP-Bench: A Hallucination Benchmark for Large Audio-Language Models

    Sep 27, 2026Zhi Wen Soi, Giulio Segalini, Jian-Jia Chen +1Audio-Language Model EvaluationAudio-Language Model Hallucination Detection

  19. When Does the Concept of "Dog" Emerge in an Audio LLM?

    Sep 27, 2026Zhe Wang, Shiqi Liu, Ruiyun Zhong +2Audio UnderstandingAudio-Language Models

  20. Audio LLMs Know When They Can't Hear You

    Sep 24, 2026Amirhosein Javadi, Richa Dixit, Mehrdad Farajtabar +3Audio-Language Model EvaluationLanguage Model Self-Assessment

  21. Do Audio Language Models Hear and Read Distinctive Features Alike?

    Sep 24, 2026Yuanhao Chen, Peter ChinAudio-Language ModelsSelf-Supervised Speech Representation Learning

  22. STAM-ASR: Speaker-Temporal Anchoring with Memory for Multi-Speaker ASR

    Sep 24, 2026Victor Tolulope Olufemi, Syeda Faiza Ahmed Sara, Shammur Absar ChowdhuryAudio-Language ModelsAutomatic Speech Recognition

  23. Broadening Uncertainty Estimation for Audio Question Answering Across Methods, Formats, and Inputs

    Sep 24, 2026Aaron Isidore Grace, Weiran WangAudio-Language Model EvaluationAudio QA

  24. Reward-Tilted On-Policy Distillation for Acoustic Grounding in Audio-Language Models

    Sep 23, 2026Kaiyang Li, Shaobo Han, Yue Tian +1Audio-Language ModelsLanguage Model Distillation

  25. Spooftral: Can Voxtral Audio-Language Model Detect Speech Spoofing?

    Sep 23, 2026Avishai Weizman, Yehuda Ben-Shimol, Itshak LapidotAudio-Language Model EvaluationAudio Deepfake Detection

  26. Mizar: A 159M-Parameter Audio-Language Model for Audio Understanding

    Sep 23, 2026Kaiyang Li, Shaobo Han, Yue Tian +1Audio QAAudio-Language Models