Neural Audio

Latest papers 79

All topics
CardsList
  1. Sobolev Norms in Neural Embeddings Measure Audio Morphing Regularity

    Oct 6, 2026Théo Chasle Cauchy, Modan Tailleur, Barbara Pascal +2Neural AudioSpeaker Similarity

  2. LeAVJEPA: A Minimalist Architecture for Audio-Visual Self-Supervised Learning

    Oct 5, 2026Benjamin Robson, Santeri Mentu, Wenshuai Zhao +1Audio-Visual ReasoningNeural Audio

  3. Revisiting Frame-Wise Saliency for Audio Moment Retrieval

    Oct 5, 2026Tatsuya Komatsu, Hokuto MunakataRt-DetrNeural Audio

  4. Task-Aware Joint Pruning and Distillation for Efficient Audio Deepfake Detection

    Oct 4, 2026Miao He, Peng Cheng, Zhongjie Ba +4Neural Audio

  5. LAST: Looped Audio Spectrogram Transformer

    Oct 1, 2026Haider Al-Tahan, Sean O'Brien, Anastasia Razdaibiedina +1Neural AudioTransformer Architectures

  6. Exposing the Cost of Deep Learning Audio Development

    Oct 1, 2026Constance Douwes, Paul Magron, Romain SerizelNeural AudioEnergy Consumption

  7. Boundary and Intra-Segment Learning for Partial Audio Deepfake Localization

    Sep 22, 2026Zhe Ye, Xiangui Kang, Minhua Huang +3Neural AudioAuthenticity

  8. ART-NAD: An Articulatory Inversion-based Neural Acoustic Distance for Pathological Speech Intelligibility Assessment

    Sep 21, 2026Bence Mark Halpern, Thomas Tienkamp, Defne Abur +1ArticulatoryVocal Tract Shape

  9. CoRELoop: Parameter-Efficient Controlled Recurrent Refinement for Audio Deepfake Detection

    Sep 17, 2026Kunyu Feng, Yuxiang Wang, Li Wang +2Audio Deepfake DetectionNeural Audio

  10. Sample-Conditioned Representation Selection for Audio Few-Shot Learning

    Sep 15, 2026Fengrui Liu, Ningxin Shen, Yi Li +3Neural AudioFew-Shot Learning

  11. Graph Attention Design Choices Matter: A Controlled Study of LoRA-Adapted Audio Anti-Spoofing

    Sep 14, 2026Haoyu Wang, Jing Yang, Chenyu Liu +7Neural AudioSpoofing

  12. Rethinking Procedural Audio Pre-training: Source Scaling and Objective Adaptation

    Sep 14, 2026Jiajun Peng, Fengrui Liu, Xinyu Liu +1Neural AudioProcedural

  13. Real-Time Music Source Separation on a Low-Power Audio DSP

    Sep 14, 2026Jianan Li, Li Liu, Ken Malsky +1Speech SeparationNeural Audio

  14. Tracing the Origins: Legacy Codec Identification in Neural Audio Transcoding

    Sep 14, 2026Wonje Heo, Shinee Youn, Yooshin Kim +2Neural Audio CodecsNeural Audio

  15. POLARIS: Training-Free Audio Fingerprinting with Saliency-Based Landmarks and Delaunay Grouping

    Sep 13, 2026Jiheng LiFingerprintNeural Audio

  16. Continuous-Time Acoustic Modelling with Neural Controlled Differential Equations

    Sep 12, 2026Mattias Cross, Minghui Zhao, Anton RagniAutoregressive Text-To-SpeechNeural Audio

  17. Sparse Weight and Edge Circuit Discovery in Transformer-based Acoustic Models

    Sep 11, 2026Jiankun Wei, Ewan Dunbar, Gerald PennTransformer EncoderNeural Audio

  18. Audio Deepfake Detection Using Temporal Coherence Analysis

    Sep 8, 2026Justin D. Norman, Sarah BarringtonAudio Deepfake DetectionDeepfake Detection

  19. MADS: A Multiview Acoustic Descriptor Set Beyond Standard Spectral Summaries

    Sep 1, 2026Utsab Ghosh, Roshni ChakrabortyNeural AudioMusic Structure Analysis

  20. U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement

    Aug 31, 2026Cao Duong Ly, Jörn AnemüllerSpeech EnhancementNeural Audio

  21. TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

    Aug 30, 2026Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3Large Audio Language ModelsNeural Audio

  22. DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning

    Aug 11, 2026Tomasz Radzikowski, Mateusz Modrzejewski, Przemysław RokitaNeural AudioDino

  23. Beyond Dry References: Learning Relative Audio Effects Representations via Contrastive Distance Learning

    Aug 11, 2026Xinlu Liu, Huibin Lin, Weixing Wei +1Neural AudioAudio Understanding

  24. Equivariant Music Transformer

    Aug 4, 2026Zixun Guo, Simon DixonTransformer ArchitecturesNeural Audio

  25. Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction Residuals for Cross-Domain Audio Deepfake Detection

    Jul 29, 2026Haotian Mo, Jie Liu, Siqi Shen +8Neural AudioDiffusion Transformers

  26. Automatic Audio Equalization with Semantic Embeddings

    Jul 26, 2026Eloi Moliner, Vesa Välimäki, Konstantinos Drossos +1Neural AudioSpectral Features

  27. Explainable AI through the Lens of Material Agency: Enabling Musical Interface Design with Neural Audio Models

    Jul 25, 2026Shuoyang Jasper Zheng, Anna Xambó Sedó, Nick Bryan-KinnsExplainable Artificial IntelligenceArtistic Ownership

  28. StemFX: Learning Mixing Style Representations via Autoregressive FX Chain Prediction on Source-Separated Stems

    Jul 17, 2026Yuan-Chiao Cheng, Jui-Te Wu, Brian Chen +3Neural AudioStemming

  29. UD-ASD: A Unified Diffusion Model for Anomalous Sound Detection

    Jul 14, 2026Pengxiang Gao, Yu Qiu, Yanzhi SongSound Event DetectionNeural Audio

  30. Clean2FX: Label-conditioned modeling for clean-to-effect guitar audio transformations

    Jul 9, 2026Oliverio Bombicci Pontelli, Iran R. RomanAudio EditingNeural Audio

  31. MulTTiPop: A Multitrack Transcription Dataset for Pop Music

    Jul 9, 2026Nathan Pruyne, Benjamin Stoler, William Chen +3Multi-Instrument Music TranscriptionTranscript

  32. UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

    Jul 5, 2026Cangjin Qiu, Quan Zhang, Dan Jiang +1Face Forgery DetectionFrequency-Aware Regularization

  33. Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

    Jul 4, 2026Héctor Martel, Joe Hennessy-Priest, Taemin ChoNeural AudioAudio Understanding

  34. Audio-Based Understanding of Audiobook Narration Appeal

    Jul 2, 2026Shahar Elisha, Mariano Beguerisse-Díaz, Emmanouil BenetosAudio UnderstandingNeural Audio

  35. Few-Shot Open-Set Audio Classification Using Attention Information-Fused Prototypes

    Jul 1, 2026Yanxiong Li, Jiaxin Tan, Qianqian Li +3Neural AudioMeta-Learning

  36. Evaluating Pretrained Music Embeddings for Cross-Performance Jazz Standard Recognition

    Jul 1, 2026Çağrı EserMusic Structure AnalysisSheet Music

  37. SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation

    Jun 29, 2026Juncheng Ma, Yuxuan Du, Yanan Sun +8Precise Lip SynchronizationDiffusion Transformers

  38. Probing-Guided Layer Selection from Self-Supervised Speech Models for Generalizable Audio Deepfake Detection

    Jun 29, 2026Marjan Beheshti, Majid Rostami, Bo ChenSelf-Supervised Speech ModelsNeural Audio

  39. BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations

    Jun 29, 2026Ludovic K. Tuncay, Etienne Labbé, Thomas PellegriniNeural AudioAudio Understanding

  40. ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

    Jun 27, 2026Fengjie Lu, Chenang Jiang, Jiarui Hai +2Neural AudioLarge Audio Language Models

  41. Frequency-Aware Self-Supervised Music Representation Learning

    Jun 24, 2026Yicheng Gu, Junan Zhang, Jerry Li +2Spectral FeaturesMusic Structure Analysis

  42. Compiling Differentiable Audio Graphs to Real-Time DSP

    Jun 19, 2026Facundo Franchino, Sebastian J. SchlechtNeural AudioAudio Understanding

  43. FlowFake: Liquid Networks for Audio Deepfake Detection

    Jun 17, 2026Shivaay Dhondiyal, Divyansh Sharma, Dinesh Kumar VishwakarmaNeural AudioSpeaker

  44. Turning music identification into a neural forward pass

    Jun 15, 2026Muhammad Taimoor Haseeb, Ahmad Hammoudeh, Gus XiaMusic Structure AnalysisNeural Audio

  45. Bridging the SEA Gap: An Initial Benchmark for Neural Audio Codec-Synthesized Speech Deepfakes in South-East Asian Languages

    Jun 14, 2026Orchid Chetia Phukan, Girish, Mohd Mujtaba Akhtar +1Neural Audio CodecsNeural Audio

  46. AUDEDIT: Inversion-Free Text-Guided Editing with Pretrained Audio Flow Models

    Jun 13, 2026Zhongyuan FuAudio EditingNeural Audio

  47. Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models

    Jun 12, 2026Ravi Ranjan, Utkarsh Grover, Xiaomin Lin +1End-To-End Automatic Speech Recognition ModelsNeural Audio

  48. MaskedFOP: Polyglot Speaker Identification under Missing Visual Modality via Cascaded Graph Label Propagation

    Jun 12, 2026Ayoub Elkhouzari, Youssef Iraqi, Loubna MekouarSpeakerNeural Audio

  49. FAConformer: Frequency-Aware Convolutional Transformer for Auditory Attention Decoding

    Jun 12, 2026Ziwei Wang, Xingyi He, Tianwang Jia +2Auditory AttentionNeural Audio

  50. From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation

    Jun 11, 2026Fengrui Liu, Ruiyang Huang, Qijian Zheng +2Neural AudioAudio Understanding

  51. On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning

    Jun 10, 2026Zihan Zhang, Jie Hong, Siyuan Fan +2Neural Audio

  52. F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

    Jun 4, 2026Dinghao Zhou, Xingchen Song, Di Wu +3Audio TokenizersNeural Audio

  53. IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems

    Jun 4, 2026Tao Zhong, Jiajun Deng, Nikita Kuzmin +6Full-Duplex Speech ModelsNeural Audio

  54. Probing Spatial Structure in Pretrained Audio Representations

    Jun 4, 2026Chuyang Chen, Sivan Ding, Adrian S. Roman +1Spatial AudioNeural Audio

  55. MelT: A Portable, Single-GEMM Mel Audio Frontend via Non-Uniform DFT with Measured Latency and Energy Gains on GPUs

    May 31, 2026Augusto Camargo, Marcelo FingerNeural AudioMatrix Multiplication

  56. Half-Truth Audio Detection and Localisation: A Lightweight Cross-Attentive Architecture and a Cross-Corpus Diagnostic Study

    May 28, 2026S. Sutharya, Remya K. SasiAudio Deepfake DetectionNeural Audio

  57. StreamSplit: Continuous Audio Representation Learning via Uncertainty-Guided Adaptive Splitting

    May 26, 2026Minh K. Quan, Pubudu N. PathiranaEdge DevicesModern Data-Streaming Systems

  58. CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

    May 18, 2026Gyubin Lee, Junwon Lee, Juhan NamAudio-Video GenerationNeural Audio