Audio-Visual Speech Recognition

Also known as AVSR

Latest papers 14

All topics
CardsList
  1. NAVIR: Neuromorphic Audio-Visual Speech Recognition for Robust Human-Robot Interaction on Edge Hardware

    Sep 21, 2026Leonidas Delimpasis, Panagiota Moraiti, Antonis Porichis +2Visual Speaker RecognitionAutomatic Speech Recognition

  2. Candor-LR: A Dyadic Conversational Dataset for Audio-Visual Speech Recognition

    Sep 9, 2026Rishabh Jain, Aristeidis Papadopoulos, Zhaofeng Lin +1Automatic Speech RecognitionAudio-Visual Speech Recognition

  3. AVSRBench: A Multi-Condition AVSR Benchmark

    Sep 9, 2026Rishabh Jain, Naomi HarteASR EvaluationOOD Generalization

  4. From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

    Aug 9, 2026Thai-Binh Nguyen, Zhaolin Li, Jan Niehues +1Target Speaker ExtractionAutomatic Speech Recognition

  5. DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs

    Jul 31, 2026Ziwei Cheng, Zhenhua Tan, Zhuomin ZhuMultimodal RobustnessAudio-Visual Speech Recognition

  6. Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

    Jul 10, 2026Xugang Lu, Peng Shen, Yu Tsao +1Automatic Speech RecognitionAudio-Visual Speech Recognition

  7. VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness

    Jul 9, 2026Iulia-Maria Udrea, Alexandra Diaconu, Bogdan AlexeMultimodal RobustnessVisual Speaker Recognition

  8. VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition

    Jun 28, 2026Piyush Arora, Navlika Singh, Umberto Cappellazzo +2Automatic Speech RecognitionAudio-Visual Speech Recognition

  9. Assessing True Generalisability of Audio-Visual Speech Recognisers

    Jun 5, 2026Zhaofeng Lin, Stavros Petridis, Maja Pantic +1Automatic Speech RecognitionAudio-Visual Speech Recognition

  10. M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

    Jun 4, 2026Fei Su, Cancan Li, Ming Li +1Multimodal RobustnessAudio-Visual Representation Learning

  11. Your Multimodal Speech Model Says I Have a Face for Radio

    May 28, 2026Maya K. Nachesa, Vlad Niculae, Vagrant GautamASR EvaluationDemographic Bias in ASR

  12. Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning

    May 3, 2026Xinmeng Xu, Haoran Xie, S. Joe Qin +3Audio-Visual UnderstandingAudio-Visual Representation Learning

  13. LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition

    Apr 30, 2026Doyeop Kwak, Jeongsoo Choi, Suyeon Lee +1ASR EvaluationAutomatic Speech Recognition

  14. Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios

    Mar 9, 2026Pol Buitrago, Javier HernandoSynthetic Data AugmentationAudio-Visual Representation Learning