Large Audio Language Models

Momentum

29 papers in the last four weeks, up 263% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 150

All topics
CardsList
  1. AnchorPrompt: Self-Distilled Soft Prompts for Robust Audio-Language Models

    Sep 30, 2026Pooneh Mousavi, Amir Ivry, Mirco Ravanelli +1Large Audio Language ModelsHallucination Mitigation

  2. UniAE-MoE: A Unified Audio Encoder via Mixture of Experts

    Sep 30, 2026Shengbo Cai, Zhisheng Zhang, Zichao Nie +3Large Audio Language ModelsOpencode

  3. Audio Token Attention Is Predictable Before the Language Model Runs

    Sep 30, 2026Kyoungjun Park, Yunzhe Li, Lili QiuLarge Audio Language ModelsAudio Understanding

  4. When Capabilities Fail to Compose: Diagnosing the Compositionality Gap in Large Audio-Language Models

    Sep 29, 2026Chien-Feng Liu, Chih-Kai Yang, Bo-Han Feng +3Large Audio Language ModelsLarge Language Models Fail

  5. Long-Term Memory-Guided Enhancement for Target Perception in Audio-Language Models

    Sep 29, 2026Zhenhong Zhou, Xuanyue Zhao, Youji Liu +4Large Audio Language ModelsSpeech Enhancement

  6. Probing Large Audio-Language Models for Compositional Understanding of Sounding Actions

    Sep 28, 2026Michel Olvera, Paraskevas Stamatiadis, Changhong Wang +1Large Audio Language ModelsFine-Grained Actions

  7. On Temporal Binding in Large Audio Language Models

    Sep 28, 2026Paul Primus, Gerhard WidmerLarge Audio Language ModelsMechanistic Interpretability

  8. SpeechCritic: Learning a Diagnostic Speech Judge from Limited Human Preferences

    Sep 28, 2026Mingyue Huo, Shivam Mehta, Bhavin Jawade +2Large Audio Language ModelsCritic

  9. Uncovering Ordinal-Matching Bias in Audio-Visual LLMs

    Sep 28, 2026Jihoo Jung, Youngjoon Jang, Hyebin Cho +2Audio-Visual ReasoningLarge Audio Language Models

  10. MISHAP-Bench: A Hallucination Benchmark for Large Audio-Language Models

    Sep 27, 2026Zhi Wen Soi, Giulio Segalini, Jian-Jia Chen +1Large Audio Language ModelsLarge Language Model Hallucination

  11. When Does the Concept of "Dog" Emerge in an Audio LLM?

    Sep 27, 2026Zhe Wang, Shiqi Liu, Ruiyun Zhong +2Large Audio Language ModelsAudio Understanding

  12. Audio LLMs Know When They Can't Hear You

    Sep 24, 2026Amirhosein Javadi, Richa Dixit, Mehrdad Farajtabar +3Large Audio Language ModelsTranscription

  13. To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech

    Sep 24, 2026Debajyoti Mazumder, Mamta, Abhirama Subramanyam PenamakuriFact-CheckingMisinformation

  14. Reward-Tilted On-Policy Distillation for Acoustic Grounding in Audio-Language Models

    Sep 23, 2026Kaiyang Li, Shaobo Han, Yue Tian +1Large Audio Language Models

  15. Spooftral: Can Voxtral Audio-Language Model Detect Speech Spoofing?

    Sep 23, 2026Avishai Weizman, Yehuda Ben-Shimol, Itshak LapidotSpoofingSelf-Supervised Speech Models

  16. Mizar: A 159M-Parameter Audio-Language Model for Audio Understanding

    Sep 23, 2026Kaiyang Li, Shaobo Han, Yue Tian +1Large Audio Language ModelsOpencode

  17. REVE: Efficient Hallucination Correction for Large Audio-Language Models via Reused Encoder States

    Sep 22, 2026Hongjin Song, Jiasheng Kuang, Xinyu Yang +4Sound Event DetectionLarge Audio Language Models

  18. Listen, Critique, and Refine: RL-Based Self-Refinement for Instruction-Following Speech Synthesis

    Sep 21, 2026Chee-En Yu, Yi-Cheng Lin, Sung-Feng Huang +4Speech SynthesisLarge Audio Language Models

  19. Listen Then Reason: Perception-Grounded Test-Time Reinforcement Learning for Large Audio-Language Models

    Sep 20, 2026Jiaheng Dong, Xiaofeng Yu, Jean Honorio +3Large Audio Language ModelsReasoning Skills

  20. Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs

    Sep 19, 2026Jing Peng, Zichao Nie, Zhisheng Zhang +2Large Audio Language ModelsAudio Understanding

  21. Correlation-Guided Encoder Selection for Multi-Encoder Large Audio-Language Models

    Sep 16, 2026Pei-Jun Liao, Hung-Shin Lee, Wenze Ren +3Large Audio Language ModelsEncoders

  22. Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception

    Sep 14, 2026Yanfeng Shi, Yan Song, Junhui Li +4Large Audio Language ModelsPerception

  23. What Did the MLLM Hear? Token-Level Spectro-Temporal Grounding for Audio MLLM Explainability

    Sep 14, 2026Lucia Cascone, Valeria Fraenza, Michele Nappi +2Large Audio Language ModelsMllm-Based

  24. NVV-Locator: From Transcript Tags to Acoustic Boundaries for Fine-Grained Nonverbal Vocalization Grounding

    Sep 9, 2026Yuang Cao, Bingshen Mu, Zhennan Lin +7TranscriptAcoustic

  25. Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models

    Sep 9, 2026Yupei Li, Qiyang Sun, Mohamed Mady +4Audio UnderstandingLarge Audio Language Models

  26. Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

    Sep 1, 2026Bhuvan Koduru, Dareen Safar B Alharthi, Rita Singh +1Paralinguistic CuesLarge Audio Language Models

  27. TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

    Aug 30, 2026Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3Large Audio Language ModelsNeural Audio

  28. LongAudioSpan: Spanning the Duration and Depth of Audio Comprehension

    Aug 26, 2026Wen Huang, Yunfei Chu, Meng Gao +2Audio UnderstandingLarge Audio Language Models

  29. MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

    Aug 23, 2026Yize Li, Ningyuan Yang, Sile Yin +6Large Audio Language ModelsAudio Understanding

  30. From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

    Aug 10, 2026Yuanhe Zhang, Weiliu Wang, Jie Ren +7Large Audio Language ModelsAudio Understanding

  31. Multilingual Emotion Neurons in Large Audio-Language Models

    Aug 9, 2026Xiutian Zhao, Philipp Koehn, Björn Schuller +1Cross-Lingual ConsistencyLarge Audio Language Models

  32. Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

    Aug 5, 2026Yuezhang Peng, Yuxin Liu, Changfeng Gao +4Speech Language ModelsLarge Audio Language Models

  33. HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

    Aug 5, 2026Tian Jin, Ruikang Zhang, Zefeng Zhao +2Large Audio Language ModelsEmotion Recognition

  34. Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping

    Aug 4, 2026Jingwei Zhao, Gus Xia, Ziyu Wang +1Symbolic Music GenerationInstrument

  35. Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

    Aug 3, 2026Yuwen Wang, Tian-Hao Zhang, Minghao Cai +7Audio UnderstandingVoice Agents

  36. MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning

    Jul 29, 2026Weijie Wu, Junbo Li, Lin Li +2Large Audio Language ModelsAudio Understanding

  37. ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

    Jul 29, 2026Yuxiong Xu, Kaiqing Lin, Bin Li +2Large Audio Language ModelsLocalization

  38. Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

    Jul 29, 2026Jiachen Qian, Junyu LiText-To-AudioLarge Audio Language Models

  39. From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding

    Jul 28, 2026Yujian Ma, Jinqiu Sang, Ruizhe Li +2Large Audio Language ModelsAudio Tokenizers

  40. ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

    Jul 20, 2026Fernando López, Ana Ayala, Guillermo Segovia +4Automatic Speech Recognition EvaluationLarge Audio Language Models

  41. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

    Jul 17, 2026Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19Audio-Visual ReasoningLarge Audio Language Models

  42. Large Audio Language Models for Spoofing-Aware Speaker Verification

    Jul 16, 2026Sofya Savelyeva, Mariia Perunova, Evgeny Kushnir +3Automatic Speaker VerificationLarge Audio Language Models

  43. Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

    Jul 15, 2026Joonyong Park, David M. Chan, Yuki Saito +1Large Audio Language ModelsLarge Language Model Judges

  44. Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models

    Jul 15, 2026Chun-Yi Kuan, Siwon Kim, Byeonggeun Kim +7Large Audio Language ModelsInstruction

  45. Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models

    Jul 13, 2026Yu-Han Huang, Chih-Kai Yang, Ke-Han Lu +2Large Audio Language ModelsSpeaker

  46. GigaChat Audio: Time-aware Large Audio Language Model

    Jul 11, 2026Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov +4Large Audio Language ModelsText-To-Audio

  47. Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

    Jul 9, 2026Shuo-Chun Lin, Hen-Hsen HuangSpatial AudioLarge Audio Language Models

  48. Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding

    Jul 5, 2026Zihan Zhang, Xize Cheng, Wenhao Yan +5Sound Event DetectionLarge Audio Language Models

  49. OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

    Jul 3, 2026Shijie Cao, Qingyu Zhang, Boxi Yu +6Token CompressionAudio-Visual Reasoning

  50. Adaptive Perturbation Selection for Contrastive Audio Decoding

    Jun 30, 2026Aaron Isidore Grace, Zhouyuan Huo, Weiran WangContrastive DecodingLarge Audio Language Models