Transcription

Momentum

9 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 50

All topics
CardsList
  1. Audio LLMs Know When They Can't Hear You

    Sep 24, 2026Amirhosein Javadi, Richa Dixit, Mehrdad Farajtabar +3Large Audio Language ModelsTranscription

  2. A Training Criterion with Token-Level Tolerance to Transcription Ambiguity for Automatic Speech Recognition

    Sep 24, 2026Saurabh Kumar, Diptiman Mohanta, Prasanta Kumar GhoshAutomatic Speech RecognitionTranscription

  3. Transcribe, Translate, and Optimize: Joint Reward Learning for Speech Translation

    Sep 22, 2026Yanghe Dong, Wanting Huang, Weiran WangSpeech TranslationSpeech Language Models

  4. DiaWhisper-DPO: Role-Attributed Transcription of Clinical Interviews via Failure-Mined Preference Optimization

    Sep 15, 2026Weiming Li, Ana Catarina Fidalgo Barata, Miguel Constante +1Speaker DiarizationTranscript

  5. TART: A Modular Tool for Technique-Aware Audio-to-Tablature Guitar Transcription

    Sep 10, 2026Akshaj Gupta, Hwi Joo Park, Andrea Guzman +5Multi-Instrument Music TranscriptionInstrument

  6. Reasoning Beyond Transcription: Audio Language Models on Child Stuttering Speech

    Sep 7, 2026Chibuzor Okocha, Christan Grant, Zoey LiuTranscriptionSummarization

  7. Qwen-Audio-3.0-ASR Technical Report

    Sep 7, 2026Chuanmeng Bian, Daren Chen, Peixin Chen +42Automatic Speech RecognitionTranscription

  8. REFINE: Trajectory Representation Learning via Closed-Loop Transcription -- Extended Version

    Sep 7, 2026Sean Bin Yang, Ying Sun, Jilin Hu +5Long Refinement TrajectoriesContrastive Learning

  9. TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data

    Sep 1, 2026Jianhuai Hu, Yashan Wang, Shangda Wu +7Text-To-MusicTranscription

  10. Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

    Aug 31, 2026Fengji Ma, Yan Rong, Xu Li +3Video CaptioningTranscription

  11. Easper: An Accessible ASR Pipeline for Language Documentation

    Aug 12, 2026Aso Mahmudi, Ting Dang, Ekaterina Vylomova +1TranscriptionAutomatic Speech Recognition

  12. Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

    Aug 6, 2026Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge +2TranscriptionData Augmentation

  13. Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion

    Aug 2, 2026Wei-Han Hsu, Chih-Cheng Chang, Bo-Yu Chen +2Multi-Instrument Music TranscriptionSpeech Separation

  14. Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription

    Jul 29, 2026Ting-Kai Hsu, Wei-Chin Wang, Kai-Xi Hong +1Multi-Instrument Music TranscriptionTranscription

  15. From transcription to semantic corpus analysis: unsupervised learning of sentence representations for ancient languages

    Jul 27, 2026Th{é}otime de la SelleHandwritten Text RecognitionTranscription

  16. Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model

    Jul 14, 2026Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani +1Speech EncoderAutomatic Speech Recognition

  17. Joint Transcription and Decryption of Images of Encrypted Handwritten Documents: A Comparison with the Traditional Pipeline

    Jun 26, 2026Marino Oliveros-Blanco, Lei Kang, Alicia Fornés +1Text2CypherTranscription

  18. BranchShine: Compact Raw-Audio-to-IPA Transcription with a RoPE E-Branchformer Encoder

    Jun 22, 2026Nikhil Navas, Sergio Chevtchenko, Talisson Damiao +1TranscriptionTranscript

  19. Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR

    Jun 20, 2026Enes Yavuz Ugan, Alexander WaibelCode-SwitchingMultilingual Automatic Speech Recognition

  20. Velocity Prediction in Automatic Guitar Transcription

    Jun 19, 2026Jackson Loth, Xavier Riley, Simon Dixon +1Multi-Instrument Music TranscriptionTranscription

  21. A Comparative Study of Pretrained Transformer Models for Quranic ASR: Speech Representations, Label Formats, and Dataset Composition

    Jun 18, 2026Nabil Mosharraf Hossain, Riasat Islam, Unaizah ObaidellahDiscrete Speech RepresentationsGenerative Pretrained Transformers

  22. Scaling Human and G2P Supervision for Robust Phonetic Transcription

    Jun 14, 2026Alexander Metzger, Aruna Srivastava, Ruslan MukhamedvaleevGrapheme-To-PhonemeTranscription

  23. Hearing the Unspoken: Language Model Priors for Acoustic Adversarial Attacks

    Jun 5, 2026Jiani Xie, Andrew C. Cullen, Paul Montague +1Automatic Speech RecognitionCharacter Error Rate

  24. Score-Agnostic Structure Analysis in Large-Scale Performance Datasets

    May 25, 2026Patricia Hu, Silvan Peter, Gerhard WidmerTranscriptionFeature Alignment

  25. Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems

    May 25, 2026Yizhou Peng, Ziyang Ma, Changsong Liu +3ClarificationTranscription

  26. Music Transcription with (Almost) No Supervision

    May 22, 2026Saebyeol Shin, Chao Wan, Zhenzhen Liu +4Multi-Instrument Music TranscriptionTranscription

  27. Precise and Simple Audio-to-Score Alignment

    May 19, 2026Silvan Peter, Patricia Hu, Gerhard WidmerSpeech-To-Text AlignmentTranscription

  28. WARDEN: Endangered Indigenous Language Transcription and Translation with 6 Hours of Training Data

    May 13, 2026Ziheng Zhang, Yunzhong Hou, Naijing Liu +1Low-Resource LanguagesTranscription

  29. Classifier Context Rot: Monitor Performance Degrades with Context Length

    May 12, 2026Sam Martin, Fabien RogerContext LengthAgentic Benchmarks

  30. Beyond Single Ground Truth: Reference Monism as Epistemic Injustice in ASR Evaluation

    May 8, 2026Anna Seo Gyeong Choi, Maria Teleki, James Caverlee +3Automatic Speech Recognition EvaluationAutomatic Speech Recognition

  31. A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition

    May 5, 2026Thibault Bañeras-Roux, Mickael Rouvier, Jane Wottawa +1Character Error RateTranscription

  32. When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

    May 4, 2026Pehuén Moure, Niclas Pokel, Bilal Bounajma +4Dysarthric SpeechAutomatic Speech Recognition

  33. A Systematic Benchmark of Machine Transliteration Models for the Tajik-Farsi Language Pair: A Comparative Study from Rule-Based to Transformer Architectures

    May 4, 2026Mullosharaf K. ArabovMultilingual Language ModelsTranscription

  34. RAS: a Reliability Oriented Metric for Automatic Speech Recognition

    Apr 27, 2026Wenbin Huang, Yuhang Qiu, Bohan Li +5Automatic Speech RecognitionTranscription

  35. Learning to Decipher from Pixels: A Case Study of Copiale

    Apr 26, 2026Lei Kang, Giuseppe De Gregorio, Raphaela Heil +2Text2CypherHistorical Manuscripts

  36. An audio-to-analysis pipeline with certified transcription for information-theoretic profiling of the piano repertoire

    Apr 25, 2026Fred Jalbert-DesforgesInstrumentStylometric

  37. Prompting Whisper for Joint Speech Transcription and Diarization

    Apr 24, 2026Mariia Zamyrova, Henk van den HeuvelSpeaker DiarizationWhisper-Large-V3

  38. TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction

    Apr 24, 2026Chengye Wang, Lin Fu, Zexi Kuang +1Lingdt-Vl-OcrOptical Character Recognition

  39. PRiSM: Benchmarking Phone Realization in Speech Models

    Jan 20, 2026Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim +13Grapheme-To-PhonemeDial

  40. Scalable Music Cover Retrieval Using Lyrics-Aligned Audio Embeddings

    Jan 16, 2026Joanne Affolter, Benjamin Martin, Elena V. Epure +2Symbolic Music GenerationTranscription

  41. Enabling automatic transcription of child-centered audio recordings from real-world environments

    Jun 13, 2025Daniil Kocharov, Azarias Galama, Okko RäsänenTranscriptTranscription

  42. Streaming Translation and Transcription Through Speech-to-Text Causal Alignment

    Date pendingRoman Koshkin, Jeon Haesung, Lianbo Liu +4Speech TranslationTranscription