Audio Understanding

Momentum

9 papers in the last four weeks, up 125% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 49

All topics
CardsList
  1. AudioJev: Direct Audio Decisions with Order-Calibrated Probabilities

    Oct 1, 2026Sihan Lv, Zhen Li, Zhiqi Cao +4Audio UnderstandingAudio Understanding

  2. RMS-AQA: A Two-Stage Spatial Audio Question Answering Benchmark for Real-World Domestic Environments

    Oct 1, 2026Peihao Chen, Qing Wang, Lichun Fan +12Spatial AudioAudio Understanding

  3. SEAR: Spoofing Evidence-Grounded Audio Reasoning Benchmark for Audio Language Models

    Sep 30, 2026Rong Wan, Suliu Qin, Jiaxi Li +5Audio Deepfake DetectionSpoofing

  4. AS2^2D: Accelerating On-Demand Audio Understanding on Mobile Devices

    Sep 29, 2026Yunzhe Li, Kyoungjun Park, Hongzi Zhu +1Audio UnderstandingSpeculative Decoding

  5. TEMA: Evidence-Grounded Temporal Question Answering in Multi-Turn Multi-Audio Dialogs

    Sep 24, 2026Kaidi Yang, Hualei Wang, Zhaohui Wang +3Temporal GroundingAudio Understanding

  6. EvoAudio: Recursive Self-Improvement for Audio Understanding

    Sep 23, 2026Yuxiang Wang, Shengbo Cai, Yingda Shen +6Audio UnderstandingAudio Understanding

  7. Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction

    Sep 21, 2026Lujia Bao, Qian Chen, Luyao Cheng +15Voice AgentsAudio Understanding

  8. Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs

    Sep 19, 2026Jing Peng, Zichao Nie, Zhisheng Zhang +2Large Audio Language ModelsAudio Understanding

  9. Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models

    Sep 9, 2026Yupei Li, Qiyang Sun, Mohamed Mady +4Audio UnderstandingLarge Audio Language Models

  10. StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios

    Sep 3, 2026Chenglin Wu, Junjie Wu, Jinhang Chen +5Speech EnhancementAudio Understanding

  11. LongAudioSpan: Spanning the Duration and Depth of Audio Comprehension

    Aug 26, 2026Wen Huang, Yunfei Chu, Meng Gao +2Audio UnderstandingLarge Audio Language Models

  12. Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

    Aug 12, 2026Xulin Fan, Jialu Li, Mohammad Nur Hossain Khan +4Audio UnderstandingSpeech Encoder

  13. From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

    Aug 10, 2026Yuanhe Zhang, Weiliu Wang, Jie Ren +7Large Audio Language ModelsAudio Understanding

  14. Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

    Aug 3, 2026Fangxu Yu, Tao Feng, Dehai Min +6Audio UnderstandingProcess-Level Supervision

  15. Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

    Aug 3, 2026Yuwen Wang, Tian-Hao Zhang, Minghao Cai +7Audio UnderstandingVoice Agents

  16. Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning

    Jul 22, 2026Siqian Tong, Xuan Li, Chaozhuo Li +5Audio UnderstandingAudio Understanding

  17. Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control

    Jul 15, 2026J. M. A. Marcelo, M. Brienza, E. Bugli +4Full-Body Humanoid ControlWhole-Body

  18. Audio-Based Understanding of Audiobook Narration Appeal

    Jul 2, 2026Shahar Elisha, Mariano Beguerisse-Díaz, Emmanouil BenetosAudio UnderstandingNeural Audio

  19. Grammar-Guided Hierarchical Parsing for Long-form Audio Activity Recognition

    Jun 26, 2026Peng Zhang, Qingyu Luo, Philip J. B. Jackson +1Audio UnderstandingDense Temporal Annotation

  20. STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

    Jun 22, 2026Huadai Liu, Wen Wang, Kaicheng Luo +3Star-VaeModern Generative Audio Models

  21. A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models

    Jun 16, 2026Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3Large Audio Language ModelsAudio Understanding

  22. EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning

    Jun 13, 2026Siyuan Zhang, Jian Zong, Junyu Wang +7Audio UnderstandingAudio Understanding

  23. AuRA: Internalizing Audio Understanding into LLMs as LoRA

    Jun 9, 2026Bo Cheng, Lei Shi, Zhanyu Ma +5Speech EncoderAudio Understanding

  24. AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning

    Jun 7, 2026Xiangyu Zhao, Junyu Yan, Yaling Shen +7Audio UnderstandingReasoning Traces

  25. TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints

    Jun 7, 2026Vinh-Thuan LyLarge Audio Language ModelsAudio Understanding

  26. MOSS-Audio Technical Report

    Jun 1, 2026Chen Yang, Chufan Yu, Hanfu Chen +27Audio UnderstandingLarge Audio Language Models

  27. COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings

    May 28, 2026Yonggang Zhu, Liting Gao, Aidong Men +1Modality GapAudio Understanding

  28. Audio-Mind: An Auditable Agentic Framework for Audio Understanding

    May 27, 2026Yucheng Wang, Jing Peng, Hanqi Li +6Audio UnderstandingVoice Agents

  29. KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

    May 27, 2026Haechan Kim, Seungjun Chung, Inkyu Park +2Speech Language ModelsMultilingual Benchmark

  30. LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

    May 27, 2026Zhisheng Zhang, Xiang Li, Yixuan Zhou +3Audio TokenizersAudio Understanding

  31. Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

    May 18, 2026Yanru Wu, Jianning Wang, Chongxin Gan +1Large Audio Language ModelsAudio Understanding

  32. Robust Audio Tagging under Class-wise Supervision Unreliability

    May 17, 2026Yuanbo Hou, Zhaoyi Liu, Tong Ye +4Audio UnderstandingPositive--Unlabeled Learning

  33. Do Joint Audio-Video Generation Models Understand Physics?

    May 8, 2026Zijun Cui, Xiulong Liu, Hao Fang +8Audio-Video GenerationAudio-Visual Consistency

  34. Towards Open World Sound Event Detection

    May 5, 2026P. H. Hai, L. T. Minh, L. H. SonSound Event DetectionAudio Understanding

  35. All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

    Apr 27, 2026Leonardo Haw-Yang Foo, Chih-Kai Yang, Chen-An Li +2Large Audio Language ModelsAudio Understanding

  36. AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA

    Apr 23, 2026Tasnim Kabir, Dmytro Kurdydyk, Aadi Palnitkar +3Audio UnderstandingText-To-Audio

  37. Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

    Apr 20, 2026Xiang He, Chenxing Li, Jinting Wang +5Audio UnderstandingText-To-Audio

  38. Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

    Apr 16, 2026Jieyi Wang, Yazhe Niu, Dexuan Xu +1Audio UnderstandingLarge Audio Language Models

  39. Causal Tracing of Audio-Text Fusion in Large Audio Language Models

    Mar 14, 2026Wei-Chih Chen, Chien-yu Huang, Hung-yi LeeLarge Audio Language ModelsAudio Understanding

  40. When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning

    Feb 28, 2026Ruixiang Mao, Xiangnan Ma, Dan Chen +12Large Audio Language ModelsAudio Understanding

  41. AuditoryHuM: Auditory Scene Label Generation and Clustering using Human-MLLM Collaboration

    Feb 23, 2026Henry Zhong, Jörg M. Buchholz, Julian Maclaren +2Audio Understanding

  42. Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

    Feb 5, 2026Jinchuan Tian, Haoran Wang, Bo-Hao Su +14Audio UnderstandingNeural Audio

  43. SemanticAudio: Audio Generation and Editing in Semantic Space

    Jan 29, 2026Zheqi Dai, Guangyan Zhang, Haolin He +5Modern Generative Audio ModelsText-To-Audio

  44. Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation

    Dec 23, 2025Jingqi Tian, Yiheng Du, Haoji Zhang +6Audio-Visual ConsistencyVideo Object Segmentation

  45. OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder

    Jul 18, 2025Shikhar Bharadwaj, Samuele Cornell, Kwanghee Choi +4Neural AudioAudio Understanding