Audio-Language Models

Latest papers 184

All topics
CardsList
  1. Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

    Apr 20, 2026Xiang He, Chenxing Li, Jinting Wang +5RL for Language Model ReasoningAudio Reasoning

  2. Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment

    Apr 20, 2026Woody Haosheng Gan, William Held, Diyi YangAudio-Language Model EvaluationHuman Preference Modeling

  3. VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech

    Apr 19, 2026Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang +1Audio-Language Model EvaluationGender Bias in Language Models

  4. Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

    Apr 17, 2026Jaechul Roh, Virat Shejwalkar, Amir HoumansadrLanguage Model Safety EvaluationLLM Fine-Tuning

  5. NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages

    Apr 17, 2026Marie Maltais, Yejin Jeon, Min Ma +7Speech TranslationAudio-Language Models

  6. Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

    Apr 17, 2026Habibeh Naderi, Behrouz Haji Soleimani, Stan MatwinCross-Modal LearningModality Imbalance

  7. TinyMU: A Compact Audio-Language Model for Music Understanding

    Apr 17, 2026Xiquan Li, Aurian Quelennec, Slim EssidSmall Language ModelsAudio Understanding

  8. Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

    Apr 16, 2026Jieyi Wang, Yazhe Niu, Dexuan Xu +1Audio QAAudio Reasoning

  9. Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection

    Apr 16, 2026Meng Chen, Kun Wang, Li Lu +2Audio-Language ModelsLLM Security

  10. Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models

    Apr 16, 2026Yanda Li, Yuhan Liu, Zirui Song +3Audio UnderstandingAudio-Language Models

  11. KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness

    Mar 30, 2026Jinyoung Kim, Hyeongsoo Lim, Eunseo Seo +4Audio-Language Model EvaluationSpeech Processing

  12. PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark

    Mar 15, 2026Mohammad Javad Ranjbar Kalahroodi, Mohammad Amini, Parmis Bathayan +2Audio-Language Model EvaluationAudio Reasoning

  13. Causal Tracing of Audio-Text Fusion in Large Audio Language Models

    Mar 14, 2026Wei-Chih Chen, Chien-yu Huang, Hung-yi LeeLLM InterpretabilityAudio Understanding

  14. MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models

    Mar 10, 2026Chih-Kai Yang, Yun-Shao Tsai, Yu-Kai Guo +7Audio-Language Model EvaluationAudio Understanding

  15. Focus Then Listen: An Empirical Study of Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models

    Mar 5, 2026Han Yin, Yang Xiao, Younghoo Kwon +2Audio UnderstandingAudio-Language Models

  16. When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning

    Feb 28, 2026Ruixiang Mao, Xiangnan Ma, Dan Chen +12Audio ReasoningAudio Understanding

  17. Re-purposing Multimodal Large Language Models for Audio-Text Retrieval

    Feb 20, 2026Jilan Xu, Carl Thomé, Danijela Horak +2Multimodal Large Language ModelsAudio Understanding

  18. Event-Grounded Question Answering over Long Audio via Structured Retrieval

    Feb 16, 2026Kartik Hegde, Arvind Krishna Sridhar, Naveen Vakada +2Multimodal RAGAudio QA

  19. Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

    Feb 5, 2026Jinchuan Tian, Haoran Wang, Bo-Hao Su +14Audio UnderstandingAudio-Language Models

  20. RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity

    Feb 4, 2026Gaia A. Bertolino, Yuwei Zhang, Tong Xia +2Audio-Language Model EvaluationAudio QA

  21. Multi-Task Instruction Tuning via Data Scheduling for Low-Resource Arabic SpeechLLMs

    Jan 18, 2026Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar ChowdhurySpoken Language UnderstandingSpeech Processing

  22. ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

    Nov 28, 2025Šimon Sedláček, Sara Barahona, Bolaji Yusuf +9Audio-Language Model EvaluationLLM Evaluation

  23. Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

    Nov 20, 2025Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo +3Audio-Language Model EvaluationAudio Representation Learning

  24. Silence is Golden: Mitigating Hallucinations in Large Audio-Language Models via Layer-Weighted Vector Steering

    Oct 14, 2025Tsung-En Lin, Kuan-Yi Lee, Hung-Yi LeeAudio QAHallucination in Language Models

  25. VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents

    Oct 13, 2025Jiliang Hu, Wenfu Wang, Zuchao Li +6Audio-Language Model EvaluationVoice Agent Evaluation

  26. Robustness assessment of large audio language models in multiple-choice evaluation

    Oct 6, 2025Fernando López, Santosh Kesiraju, Jordi LuqueAudio-Language Model EvaluationAudio QA