Audio-Language Models

Latest papers 184

All topics
CardsList
  1. EvoAudio: Recursive Self-Improvement for Audio Understanding

    Sep 23, 2026Yuxiang Wang, Shengbo Cai, Yingda Shen +6Synthetic Data GenerationAudio Understanding

  2. Listen, Critique, and Refine: RL-Based Self-Refinement for Instruction-Following Speech Synthesis

    Sep 21, 2026Chee-En Yu, Yi-Cheng Lin, Sung-Feng Huang +4TTS SynthesisAudio Reasoning

  3. Listen Then Reason: Perception-Grounded Test-Time Reinforcement Learning for Large Audio-Language Models

    Sep 20, 2026Jiaheng Dong, Xiaofeng Yu, Jean Honorio +3Audio ReasoningAudio-Language Models

  4. MuLA-Bench: A Multilingual Long-Form Audio Understanding Benchmark via Multi-Tier Auditing

    Sep 20, 2026Zeyu Yang, Xinyu Zhang, Zibo Bi +5Audio-Language Model EvaluationAudio Understanding

  5. Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs

    Sep 19, 2026Jing Peng, Zichao Nie, Zhisheng Zhang +2Audio-Language Model EvaluationAudio Representation Learning

  6. FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection

    Sep 16, 2026Chengxian Hu, Zhiming Ma, Mingjun Pan +9Financial Fraud DetectionAudio-Language Models

  7. Correlation-Guided Encoder Selection for Multi-Encoder Large Audio-Language Models

    Sep 16, 2026Pei-Jun Liao, Hung-Shin Lee, Wenze Ren +3Audio-Language Model EvaluationAudio-Language Models

  8. Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception

    Sep 14, 2026Yanfeng Shi, Yan Song, Junhui Li +4Audio UnderstandingAudio-Language Models

  9. What Did the MLLM Hear? Token-Level Spectro-Temporal Grounding for Audio MLLM Explainability

    Sep 14, 2026Lucia Cascone, Valeria Fraenza, Michele Nappi +2Multimodal GroundingAudio-Language Models

  10. Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models

    Sep 9, 2026Yupei Li, Qiyang Sun, Mohamed Mady +4Audio-Language Model EvaluationAudio Reasoning

  11. SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval

    Sep 2, 2026Zineb Lahrichi, Marc Ferras, Gaël Richard +1Audio CaptioningAudio-Language Models

  12. Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

    Sep 1, 2026Bhuvan Koduru, Dareen Safar B Alharthi, Rita Singh +1Audio-Language Model EvaluationAudio-Language Models

  13. Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

    Aug 31, 2026Fengji Ma, Yan Rong, Xu Li +3Audio-Language ModelsAudio Captioning

  14. Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection

    Aug 31, 2026Yassine El Kheir, Xin Wang, Wanqing Ge +3Audio Deepfake DetectionOOD Generalization

  15. SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards

    Aug 31, 2026Zixun Guo, Calvin Murdock, Sanjeel Parekh +4Audio-Language ModelsSpatial Audio

  16. TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

    Aug 30, 2026Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3Audio UnderstandingAudio-Language Models

  17. From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

    Aug 10, 2026Yuanhe Zhang, Weiliu Wang, Jie Ren +7Audio-Language Model EvaluationAudio-Language Models

  18. Multilingual Emotion Neurons in Large Audio-Language Models

    Aug 9, 2026Xiutian Zhao, Philipp Koehn, Björn Schuller +1Cross-Lingual Representation AlignmentAudio-Language Models

  19. Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

    Aug 5, 2026Yuezhang Peng, Yuxin Liu, Changfeng Gao +4Audio-Language Model EvaluationSpoken Language Understanding

  20. HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

    Aug 5, 2026Tian Jin, Ruikang Zhang, Zefeng Zhao +2Audio-Language ModelsMultimodal Emotion Recognition

  21. ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

    Jul 29, 2026Yuxiong Xu, Kaiqing Lin, Bin Li +2Audio Deepfake DetectionExplainable Deepfake Detection

  22. From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding

    Jul 28, 2026Yujian Ma, Jinqiu Sang, Ruizhe Li +2LLM GroundingLLM Fine-Tuning

  23. Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning

    Jul 22, 2026Siqian Tong, Xuan Li, Chaozhuo Li +5Audio ReasoningAudio-Language Models

  24. Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

    Jul 15, 2026Joonyong Park, David M. Chan, Yuki Saito +1Audio-Language Model EvaluationLLM Auditing

  25. The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

    Jul 14, 2026Chun-Yi Kuan, Hung-yi LeeAudio-Language Model EvaluationAudio-Language Models