Audio Captioning

Momentum

0 papers in the last four weeks, down 100% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 10

All topics
CardsList
  1. CARES: A Controlled Synthetic Benchmark of Speaker Reactions to Sound

    Oct 7, 2026Marcel Gibier, Thomas Thebaud, Olivier Boëffard +1Audio UnderstandingAudio Captioning

  2. SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval

    Sep 2, 2026Zineb Lahrichi, Marc Ferras, Gaël Richard +1Audio CaptioningAudio-Language Models

  3. Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

    Aug 31, 2026Fengji Ma, Yan Rong, Xu Li +3Audio-Language ModelsAudio Captioning

  4. AudioMap: Cloze-and-Choice Reinforcement Learning for Time-Aware Dense Audio Captioning

    Aug 10, 2026Yan Rong, Fengji Ma, Xu Li +3Audio Captioning

  5. MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning

    Jul 29, 2026Weijie Wu, Junbo Li, Lin Li +2Audio-Language Model EvaluationAudio Captioning

  6. CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

    Jul 6, 2026Ganesh Pavan Kartikeya Bharadwaj Kolluri, Yuchen Zhang, Michael Kampouridis +1Audio Representation LearningAudio-Language Models

  7. MOSS-Audio Technical Report

    Jun 1, 2026Chen Yang, Chufan Yu, Hanfu Chen +27Audio UnderstandingAudio-Language Models

  8. COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings

    May 28, 2026Yonggang Zhu, Liting Gao, Aidong Men +1Audio UnderstandingAudio-Language Models

  9. TAC: Timestamped Audio Captioning

    Feb 17, 2026Sonal Kumar, Prem Seetharaman, Ke Chen +8Audio CaptioningTemporal Audio Grounding

  10. Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

    Feb 5, 2026Jinchuan Tian, Haoran Wang, Bo-Hao Su +14Audio UnderstandingAudio-Language Models

  11. Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

    Nov 20, 2025Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo +3Audio-Language Model EvaluationAudio Representation Learning

  12. Aligning Audio Captions with Human Preferences

    Sep 18, 2025Kartik Hegde, Rehana Mahfuz, Yinyi Guo +1Reward ModelingAudio-Language Models