Audio Understanding

Latest papers 169

All topics
CardsList
  1. Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition

    Jun 5, 2026Iosif Tsangko, Andreas Triantafyllopoulos, Björn W. SchullerAudio-Language Model EvaluationAudio Understanding

  2. Continuous Audio Thinking for Large Audio Language Models

    Jun 5, 2026Gyojin Han, Dong-Jae Lee, Changho Choi +2Audio ReasoningAudio Understanding

  3. SpectCount: Spectrotemporal Counting via Synthetic Signals Improves Large Audio Language Models

    Jun 5, 2026Seonuk Kim, Yonghyeon Jun, Ju Yeon Kang +3LLM Fine-TuningAudio Understanding

  4. FIGMA: Towards FIne-Grained Music retrievAl

    Jun 4, 2026Nishit Anand, Ashish Seth, Sreyan Ghosh +2Audio UnderstandingAudio-Text Retrieval

  5. USAD 2.0: Scaling Representation Distillation for Universal Audio Understanding

    Jun 4, 2026Heng-Jui Chang, Alexander H. Liu, Saurabhchand Bhati +4Audio Representation LearningAudio Understanding

  6. F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

    Jun 4, 2026Dinghao Zhou, Xingchen Song, Di Wu +3Audio Representation LearningAutoencoders

  7. ProSarc: Prosody-Aware Sarcasm Recognition Framework via Temporal Prosodic Incongruity

    Jun 4, 2026Prathamjyot Singh, Ashima Sood, Sahil Sharma +1Audio UnderstandingSpeech Prosody

  8. Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models

    Jun 3, 2026Yichen Gao, Yiqun Zhang, Zijing Wang +7Audio-Language Model EvaluationAudio Understanding

  9. Audio Interaction Model

    Jun 3, 2026Zhifei Xie, Zihang Liu, Ze An +8Audio UnderstandingAudio-Language Models

  10. SpeakerCard-1M: An Evidence-Grounded Corpus for In-the-Wild Speaker Verification

    Jun 2, 2026Junyi Peng, Oldřich Plchot, Xiao Song +9Audio-Language Model EvaluationSpeaker Verification

  11. AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

    Jun 1, 2026Yaoting Wang, Ziyi Zhang, Wenming Tu +10Audio-Visual UnderstandingMultimodal Robustness

  12. MOSS-Audio Technical Report

    Jun 1, 2026Chen Yang, Chufan Yu, Hanfu Chen +27Audio UnderstandingAudio-Language Models

  13. Context-aware child-directed speech detection from long-form recordings

    May 31, 2026Théo Charlot, Tarek Kunze, Kaveri K. Sheth +2Speech ProcessingAudio Understanding

  14. PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects

    May 31, 2026Sicheng Yang, Shulan Ruan, Shiwei Wu +4Audio-Language Model EvaluationAudio Understanding

  15. UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception

    May 29, 2026Yuhan Song, Linhao Zhang, Aiwei Liu +6Audio Representation LearningAudio Understanding

  16. HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

    May 28, 2026Bohan Li, Shi Lian, Hankun Wang +6Audio Representation LearningSpeech Foundation Models

  17. COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings

    May 28, 2026Yonggang Zhu, Liting Gao, Aidong Men +1Audio UnderstandingAudio-Language Models

  18. MusTBench: Benchmarking and Advancing Temporal Grounding in Music LLMs

    May 28, 2026Daeyong Kwon, Qiyu Wu, Shinobu Kuriya +6Audio-Language Model EvaluationAudio Understanding

  19. ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood

    May 28, 2026Tiantian Feng, Anfeng Xu, Xuan Shi +10Audio-Language Model EvaluationSpeech Quality Assessment

  20. Audio-Mind: An Auditable Agentic Framework for Audio Understanding

    May 27, 2026Yucheng Wang, Jing Peng, Hanqi Li +6Audio QAAudio Reasoning

  21. KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

    May 27, 2026Haechan Kim, Seungjun Chung, Inkyu Park +2Audio-Language Model EvaluationQuestion Answering

  22. LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

    May 27, 2026Zhisheng Zhang, Xiang Li, Yixuan Zhou +3Audio Token CompressionAudio Representation Learning

  23. Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

    May 26, 2026Jiacheng Pang, Ashutosh Chaubey, Mohammad SoleymaniAudio-Language Model EvaluationSpeech Processing

  24. MERIT: Learning Disentangled Music Representations for Audio Similarity

    May 26, 2026Abhinaba Roy, Junyi Liang, Dorien HerremansDisentangled Representation LearningAudio Representation Learning