Temporal Audio Grounding

Momentum

7 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 18

All topics
CardsList
  1. TiTok: Audio-Visual LLM for Multi-Segment Temporal Grounding

    Oct 7, 2026Eunji Shin, Dahyun Choi, Seungyeon Jo +2Multimodal GroundingMultimodal Large Language Models

  2. Revisiting Frame-Wise Saliency for Audio Moment Retrieval

    Oct 5, 2026Tatsuya Komatsu, Hokuto MunakataDetection TransformerAudio Understanding

  3. RMS-AQA: A Two-Stage Spatial Audio Question Answering Benchmark for Real-World Domestic Environments

    Oct 1, 2026Peihao Chen, Qing Wang, Lichun Fan +12Audio-Language Model EvaluationAudio QA

  4. On Temporal Binding in Large Audio Language Models

    Sep 28, 2026Paul Primus, Gerhard WidmerLLM InterpretabilityAudio Reasoning

  5. TEMA: Evidence-Grounded Temporal Question Answering in Multi-Turn Multi-Audio Dialogs

    Sep 24, 2026Kaidi Yang, Hualei Wang, Zhaohui Wang +3Audio QATemporal Audio Grounding

  6. MuLA-Bench: A Multilingual Long-Form Audio Understanding Benchmark via Multi-Tier Auditing

    Sep 20, 2026Zeyu Yang, Xinyu Zhang, Zibo Bi +5Audio-Language Model EvaluationAudio Understanding

  7. Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception

    Sep 14, 2026Yanfeng Shi, Yan Song, Junhui Li +4Audio UnderstandingAudio-Language Models

  8. What Did the MLLM Hear? Token-Level Spectro-Temporal Grounding for Audio MLLM Explainability

    Sep 14, 2026Lucia Cascone, Valeria Fraenza, Michele Nappi +2Multimodal GroundingAudio-Language Models

  9. NVV-Locator: From Transcript Tags to Acoustic Boundaries for Fine-Grained Nonverbal Vocalization Grounding

    Sep 9, 2026Yuang Cao, Bingshen Mu, Zhennan Lin +7Audio UnderstandingSound Event Detection

  10. TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

    Aug 30, 2026Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3Audio UnderstandingAudio-Language Models

  11. LongAudioSpan: Spanning the Duration and Depth of Audio Comprehension

    Aug 26, 2026Wen Huang, Yunfei Chu, Meng Gao +2Audio-Language Model EvaluationAudio Reasoning

  12. From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding

    Jul 28, 2026Yujian Ma, Jinqiu Sang, Ruizhe Li +2LLM GroundingLLM Fine-Tuning

  13. GigaChat Audio: Time-aware Large Audio Language Model

    Jul 11, 2026Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov +4Audio QAAudio Understanding

  14. Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding

    Jul 5, 2026Zihan Zhang, Xize Cheng, Wenhao Yan +5Audio UnderstandingAudio-Language Models

  15. MOSS-Audio Technical Report

    Jun 1, 2026Chen Yang, Chufan Yu, Hanfu Chen +27Audio UnderstandingAudio-Language Models

  16. MusTBench: Benchmarking and Advancing Temporal Grounding in Music LLMs

    May 28, 2026Daeyong Kwon, Qiyu Wu, Shinobu Kuriya +6Audio-Language Model EvaluationAudio Understanding

  17. TAC: Timestamped Audio Captioning

    Feb 17, 2026Sonal Kumar, Prem Seetharaman, Ke Chen +8Audio CaptioningTemporal Audio Grounding

  18. Event-Grounded Question Answering over Long Audio via Structured Retrieval

    Feb 16, 2026Kartik Hegde, Arvind Krishna Sridhar, Naveen Vakada +2Multimodal RAGAudio QA