Audio Reasoning

Latest papers 41

All topics
CardsList
  1. STEMMA: Song-to-Stem Multi-Audio Reasoning for Large Audio Language Models

    Oct 8, 2026Hoyeol Sohn, Wonil Kim, Keunhyoung Kim +7Audio ReasoningAudio-Language Models

  2. Listen-to-Reason: Listen with Experts, Retrieve over a Graph, Reason with LLMs

    Oct 7, 2026Pooneh Mousavi, Mirco Ravanelli, Cem SubakanAudio-Language ModelsAudio Reasoning

  3. AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech Language Models

    Oct 1, 2026Yuxiang Wang, Kunyu Feng, Yuancheng Wang +12RL for Language Model ReasoningAudio Reasoning

  4. AudioJev: Direct Audio Decisions with Order-Calibrated Probabilities

    Oct 1, 2026Sihan Lv, Zhen Li, Zhiqi Cao +4Audio QAAudio Reasoning

  5. RMS-AQA: A Two-Stage Spatial Audio Question Answering Benchmark for Real-World Domestic Environments

    Oct 1, 2026Peihao Chen, Qing Wang, Lichun Fan +12Audio-Language Model EvaluationAudio QA

  6. Thinking in Depth, Speaking Directly: Recurrent Latent Reasoning for Paralinguistically Grounded Spoken Dialogue

    Sep 29, 2026Shengbo Cai, Yuxiang Wang, Jingran Xie +5Audio ReasoningSpeech Language Models

  7. Probing Large Audio-Language Models for Compositional Understanding of Sounding Actions

    Sep 28, 2026Michel Olvera, Paraskevas Stamatiadis, Changhong Wang +1Audio-Language Model EvaluationAudio Reasoning

  8. On Temporal Binding in Large Audio Language Models

    Sep 28, 2026Paul Primus, Gerhard WidmerLLM InterpretabilityAudio Reasoning

  9. SAIL: Spatial Audio Intelligence with Large Language Models via Disentangled Acoustic-Spatial Encoding and Dual-Stream Q-Former

    Sep 28, 2026Zhengding Luo, Jinyang Wu, Haozhe Ma +3Audio ReasoningDirection-of-Arrival Estimation

  10. Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction

    Sep 21, 2026Lujia Bao, Qian Chen, Luyao Cheng +15Tool-Augmented Language Model AgentsSpeech Foundation Models

  11. Listen, Critique, and Refine: RL-Based Self-Refinement for Instruction-Following Speech Synthesis

    Sep 21, 2026Chee-En Yu, Yi-Cheng Lin, Sung-Feng Huang +4TTS SynthesisAudio Reasoning

  12. Listen Then Reason: Perception-Grounded Test-Time Reinforcement Learning for Large Audio-Language Models

    Sep 20, 2026Jiaheng Dong, Xiaofeng Yu, Jean Honorio +3Audio ReasoningAudio-Language Models

  13. Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models

    Sep 9, 2026Yupei Li, Qiyang Sun, Mohamed Mady +4Audio-Language Model EvaluationAudio Reasoning

  14. ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection

    Sep 3, 2026Taewoo Kim, Young Han Lee, Nam In Park +1Audio Deepfake DetectionExplainable Deepfake Detection

  15. LongAudioSpan: Spanning the Duration and Depth of Audio Comprehension

    Aug 26, 2026Wen Huang, Yunfei Chu, Meng Gao +2Audio-Language Model EvaluationAudio Reasoning

  16. MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

    Aug 23, 2026Yize Li, Ningyuan Yang, Sile Yin +6Audio-Language Model EvaluationAudio Reasoning

  17. Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

    Aug 3, 2026Fangxu Yu, Tao Feng, Dehai Min +6Audio ReasoningRubric-Based RL

  18. Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning

    Jul 22, 2026Siqian Tong, Xuan Li, Chaozhuo Li +5Audio ReasoningAudio-Language Models

  19. Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions

    Jun 23, 2026Abinay Reddy Naini, Jaeyeon Kim, Chao-Han Huck Yang +2Audio-Language Model EvaluationPairwise Comparison

  20. EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning

    Jun 13, 2026Siyuan Zhang, Jian Zong, Junyu Wang +7Audio QATool-Augmented Language Model Agents

  21. AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

    Jun 12, 2026Hui Geng, Yi Su, Han Yin +7Audio ReasoningAudio-Language Models

  22. Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources

    Jun 12, 2026Oh Hyun-Bin, Kazuki Shimada, Yuhta Takida +6Audio-Language Model EvaluationAudio Representation Learning

  23. AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning

    Jun 7, 2026Xiangyu Zhao, Junyu Yan, Yaling Shen +7Audio-Language Model EvaluationReasoning Evaluation

  24. TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints

    Jun 7, 2026Vinh-Thuan LyAudio ReasoningAudio Understanding

  25. Continuous Audio Thinking for Large Audio Language Models

    Jun 5, 2026Gyojin Han, Dong-Jae Lee, Changho Choi +2Audio ReasoningAudio Understanding

  26. Audio-Mind: An Auditable Agentic Framework for Audio Understanding

    May 27, 2026Yucheng Wang, Jing Peng, Hanqi Li +6Audio QAAudio Reasoning