Audio-Language Models

Latest papers 184

All topics
CardsList
  1. Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models

    Jul 13, 2026Yu-Han Huang, Chih-Kai Yang, Ke-Han Lu +2Audio UnderstandingAudio-Language Models

  2. GigaChat Audio: Time-aware Large Audio Language Model

    Jul 11, 2026Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov +4Audio QAAudio Understanding

  3. Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

    Jul 9, 2026Shuo-Chun Lin, Hen-Hsen HuangAudio-Language ModelsSpatial Audio

  4. Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models

    Jul 7, 2026Ho-Lam Chung, Ke-Han Lu, Yi-Cheng Lin +3Audio Representation LearningRepresentation Learning

  5. CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

    Jul 6, 2026Ganesh Pavan Kartikeya Bharadwaj Kolluri, Yuchen Zhang, Michael Kampouridis +1Audio Representation LearningAudio-Language Models

  6. Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding

    Jul 5, 2026Zihan Zhang, Xize Cheng, Wenhao Yan +5Audio UnderstandingAudio-Language Models

  7. Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

    Jul 4, 2026Héctor Martel, Joe Hennessy-Priest, Taemin ChoRepresentation GeometryAudio Representation Learning

  8. Reinforcement Learning for Data-Efficient Code-Switched ASR

    Jul 2, 2026Ziwei Ye, Peter VickersCode-Switching Speech RecognitionAudio-Language Models

  9. Adaptive Perturbation Selection for Contrastive Audio Decoding

    Jun 30, 2026Aaron Isidore Grace, Zhouyuan Huo, Weiran WangAudio-Language Model EvaluationAudio-Language Model Hallucination Detection

  10. ZEBRA: Zero-Shot Entropy-Regularized Prompt Learning for Base-to-Novel Generalization in Audio-Language Models

    Jun 30, 2026Asif Hanif, Mohammad YaqubZero-Shot LearningPrompt Learning

  11. ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

    Jun 27, 2026Fengjie Lu, Chenang Jiang, Jiarui Hai +2Audio Representation LearningAudio-Language Models

  12. WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation

    Jun 25, 2026Mingda Lin, Lei Ding, Xinyue Zhou +6Audio Representation LearningGated Attention

  13. From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

    Jun 24, 2026Pengfei Zhang, Hoang H Nguyen, Kazi Shaharair Sharif +6Audio-Language Model EvaluationAudio Understanding

  14. Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions

    Jun 23, 2026Abinay Reddy Naini, Jaeyeon Kim, Chao-Han Huck Yang +2Audio-Language Model EvaluationPairwise Comparison

  15. Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio

    Jun 22, 2026Ran Piao, Tsai-Ning Wang, Martijn den Dekker +4Few-Shot Audio ClassificationMultimodal ICL

  16. MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

    Jun 18, 2026Yu Nakagome, Jaesong Lee, Soo-Whan ChungMultimodal PretrainingAudio-Language Models

  17. Who Wins the Conflict? Mechanistic Interpretability of Text Bias in Audio LLMs

    Jun 17, 2026Hyebin Cho, Suho Yoo, Jaehyuk Jang +2Audio-Language ModelsMechanistic Interpretability

  18. A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models

    Jun 16, 2026Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3Audio-Language Model EvaluationAudio-Language Models

  19. Bridging the SEA Gap: An Initial Benchmark for Neural Audio Codec-Synthesized Speech Deepfakes in South-East Asian Languages

    Jun 14, 2026Orchid Chetia Phukan, Girish, Mohd Mujtaba Akhtar +1Neural Audio CodecsAudio Deepfake Detection

  20. Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models

    Jun 14, 2026Hyebin Cho, Jaehyuk Jang, Changick Kim +1Few-Shot Audio ClassificationAudio Representation Learning

  21. EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning

    Jun 13, 2026Siyuan Zhang, Jian Zong, Junyu Wang +7Audio QATool-Augmented Language Model Agents

  22. When the Same Musical Knowledge Forgets Differently: A Clean Probe of Pathway-Dependent Forgetting

    Jun 13, 2026Yu Liu, Zhiwei Yang, Wenxiao Zhang +8Audio-Language ModelsMultimodal Learning

  23. AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

    Jun 12, 2026Hui Geng, Yi Su, Han Yin +7Audio ReasoningAudio-Language Models

  24. Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources

    Jun 12, 2026Oh Hyun-Bin, Kazuki Shimada, Yuhta Takida +6Audio-Language Model EvaluationAudio Representation Learning