Audio-Language Models

Latest papers 184

All topics
CardsList
  1. Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data

    Jun 11, 2026Qixu Chen, Satoshi NakamuraSpeech TranslationAudio-Language Models

  2. Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

    Jun 10, 2026Zhen Ye, Xu Tan, Yiming Li +10Spoken Language UnderstandingAudio Representation Learning

  3. Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models

    Jun 9, 2026Tsung-En Lin, Hung-Yi LeeLanguage Model SteeringAudio Understanding

  4. AuRA: Internalizing Audio Understanding into LLMs as LoRA

    Jun 9, 2026Bo Cheng, Lei Shi, Zhanyu Ma +5Spoken Language UnderstandingAudio Understanding

  5. Enhancing Multilingual LLM-based ASR with Mixture of Experts and Dynamic Downsampling

    Jun 9, 2026Guodong Lin, Ziqi Chen, Yuxiang Fu +2Audio-Language ModelsSpeech Language Models

  6. RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark

    Jun 9, 2026Hongyu Jin, Siyi Wang, Yang Xiao +10Audio-Language Model EvaluationAudio Understanding

  7. RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification

    Jun 8, 2026Shakhrul Iman Siam, Tiantian Feng, Jiankun Zhang +2HealthcareAudio-Language Models

  8. AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning

    Jun 7, 2026Xiangyu Zhao, Junyu Yan, Yaling Shen +7Audio-Language Model EvaluationReasoning Evaluation

  9. TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints

    Jun 7, 2026Vinh-Thuan LyAudio ReasoningAudio Understanding

  10. Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition

    Jun 5, 2026Iosif Tsangko, Andreas Triantafyllopoulos, Björn W. SchullerAudio-Language Model EvaluationAudio Understanding

  11. Continuous Audio Thinking for Large Audio Language Models

    Jun 5, 2026Gyojin Han, Dong-Jae Lee, Changho Choi +2Audio ReasoningAudio Understanding

  12. SpectCount: Spectrotemporal Counting via Synthetic Signals Improves Large Audio Language Models

    Jun 5, 2026Seonuk Kim, Yonghyeon Jun, Ju Yeon Kang +3LLM Fine-TuningAudio Understanding

  13. Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models

    Jun 3, 2026Yichen Gao, Yiqun Zhang, Zijing Wang +7Audio-Language Model EvaluationAudio Understanding

  14. Audio Interaction Model

    Jun 3, 2026Zhifei Xie, Zihang Liu, Ze An +8Audio UnderstandingAudio-Language Models

  15. MOSS-Audio Technical Report

    Jun 1, 2026Chen Yang, Chufan Yu, Hanfu Chen +27Audio UnderstandingAudio-Language Models

  16. COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings

    May 28, 2026Yonggang Zhu, Liting Gao, Aidong Men +1Audio UnderstandingAudio-Language Models

  17. MusTBench: Benchmarking and Advancing Temporal Grounding in Music LLMs

    May 28, 2026Daeyong Kwon, Qiyu Wu, Shinobu Kuriya +6Audio-Language Model EvaluationAudio Understanding

  18. Audio-Mind: An Auditable Agentic Framework for Audio Understanding

    May 27, 2026Yucheng Wang, Jing Peng, Hanqi Li +6Audio QAAudio Reasoning

  19. Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

    May 26, 2026Jiacheng Pang, Ashutosh Chaubey, Mohammad SoleymaniAudio-Language Model EvaluationSpeech Processing

  20. Learning When to Think While Listening in Large Audio-Language Models

    May 26, 2026Zhiyuan Song, Weici Zhao, Yang Xiao +3Audio QARL for Language Model Reasoning

  21. FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations

    May 26, 2026Haolong Zheng, Siyin Wang, Xulin Fan +2RL for Language ModelsFew-Shot Domain Adaptation

  22. Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory

    May 26, 2026Yang Xiao, Siyi Wang, Han Yin +4Audio-Language Model EvaluationMemorization in Language Models

  23. Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization

    May 25, 2026Meshal Alamr, Hassan Alqaeri, Abdullah AldahlawiFine-TuningArabic NLP