Speech Language Models

Latest papers 102

All topics
CardsList
  1. DirectSpeech2LLM: A Simple End-to-End Framework to Mitigate Prompt Overfitting in Speech-LLMs

    Oct 6, 2026Hemant Yadav, Sunayana Sitaram, Roger Zimmermann +1Speech Language Models

  2. HiPLEX: Hierarchical Policy Factorization for Full Duplex Speech Language Models

    Oct 6, 2026Kyudan Jung, Hyunsin Park, Yoonhyung Lee +5Full-Duplex Speech ModelsSpeech Language Models

  3. AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech Language Models

    Oct 1, 2026Yuxiang Wang, Kunyu Feng, Yuancheng Wang +12Speech Language ModelsEfficient Latent Reasoning

  4. Q-SPT: Learnable Query-Based Compression for Low-Frame-Rate Speech Tokenization

    Oct 1, 2026Jeeyoung Yun, Seohwan Yun, Sungwoong KimNeural Speech CodecsAudio Tokenizers

  5. From Speech to Editable Concepts: Probing Emotion Recognition with Concept Bottleneck Models

    Sep 30, 2026Hezhao Zhang, Thomas HainEmotion RecognitionSpeech Language Models

  6. Thinking in Depth, Speaking Directly: Recurrent Latent Reasoning for Paralinguistically Grounded Spoken Dialogue

    Sep 29, 2026Shengbo Cai, Yuxiang Wang, Jingran Xie +5Speech Language ModelsParalinguistic Cues

  7. SignFLIP: A Unified Model for Sign Language Translation and Generation via Stage-wise Alignment at Scale

    Sep 28, 2026Zhaoyi An, Sihan Tan, Youngbae Hwang +2Gloss-Free Sign Language TranslationSign Language Translation

  8. DuraS2ST: Chain-of-Thought and Reinforcement Learning for Duration-Aligned Speech-to-Speech Translation

    Sep 27, 2026Yayue Deng, Dingdong Wang, Yuxuan Hu +7Speech TranslationSpeech Language Models

  9. TS-OPD: Reconciling ASR and QA in Speech Language Models via Task-Specific On-Policy Distillation

    Sep 24, 2026Yujie Guo, Hongjie Chen, Jian Kang +3Speech Language ModelsAutomatic Speech Recognition

  10. agentic-ger: terminology recovery in long-form speech using global context

    Sep 24, 2026Yanqiao Zhu, Wupeng Wang, Zhifu Gao +2Speech Language ModelsAutomatic Speech Recognition

  11. Controlling Backchannels in Streamable Full-duplex Models

    Sep 24, 2026Maike Züfle, Peter Polák, Sefik Emre Eskimez +3Full-Duplex Speech ModelsSpeech Language Models

  12. Speech Block Influence: Component-Specific Layer Scoring for Pruning Speech LLMs

    Sep 24, 2026Siyu Yao, Du Q. Huynh, Lian Xu +1Speech Language ModelsSpeaker

  13. Transcribe, Translate, and Optimize: Joint Reward Learning for Speech Translation

    Sep 22, 2026Yanghe Dong, Wanting Huang, Weiran WangSpeech TranslationSpeech Language Models

  14. Spoken Language Models that Think Aloud

    Sep 22, 2026Junyi Ao, Kainan Peng, Mingbo Ma +10Speech Language ModelsReasoning Skills

  15. Rethinking Length-Based Training: Batch Composition and Loss Normalization in Speech Token Language Models

    Sep 22, 2026Hongjin Song, Runwu Shi, Weiqiao Shan +4Speech Language ModelsBatch Normalization

  16. Reading Emotions in the Token Space: Discriminative Adaptation of SpeechLLMs for Emotion Recognition

    Sep 17, 2026Hasindri Watawana, Sergio Burdisso, Esaú Villatoro-Tello +4Emotion RecognitionSpeech Language Models

  17. Full-Duplex Speech Models Take the Floor When Asked, Not When Needed

    Sep 17, 2026Linkai Peng, Baorian Nuchged, Kaiqi Fu +1Full-Duplex Speech ModelsUtterances

  18. Voice of Reason: Reinforcement Learning for Spoken Math

    Sep 16, 2026Timothée Weisselberger, Edouard Graves, Alexandre DéfossezSpeech Language ModelsMathematical Reasoning Benchmarks

  19. Align, Integrate, and Fire: Efficient Token-Level Alignment for Zero-Shot SpeechLLMs

    Sep 16, 2026Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes +1Speech Language ModelsAcoustic Latent Space

  20. Reducing the Output-Mode Gap in Speech Language Models via Joint-Output On-Policy Distillation

    Sep 14, 2026Daxin Tan, Dehua Tao, Chengxi Deng +2Speech Language ModelsAutoregressive Generation

  21. Quantifying the Generation Modality Gap in Speech-Text Language Models

    Sep 13, 2026Ju-Chieh Chou, Jiawei Zhou, Karen LivescuSpeech Language Models

  22. RetroThinker: Enabling Retrospective Thinking in Speech LLMs

    Sep 12, 2026Yi-Jen Shih, Puyuan Peng, Abdelrahman Mohamed +1LLM Reasoning StrategiesSpeech Language Models

  23. Causal Analysis and Mitigation of Spurious Onsets in Full-Duplex Speech LLMs

    Sep 11, 2026Kento NishiSpeech Language ModelsFull-Duplex Speech Models

  24. S3S^3-Bench: Evaluating Speech Interaction Models as Scientific Voice Assistants

    Sep 9, 2026Heyang Liu, Jiayi Huang, Wenyang Xiao +8Speech Language ModelsFull-Duplex Voice Agents

  25. Leveraging Speech Acts for Low-Data and Cross-Domain Conversation Derailment Forecasting

    Aug 26, 2026Angela Yifei Yuan, Christine De Kock, Christopher LeckieUtterancesSpeech Language Models

  26. EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

    Aug 10, 2026Junyu Wang, Siyuan Zhang, Peiyuan Jiang +11Emotion RecognitionSpeech Language Models

  27. Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

    Aug 5, 2026Yuezhang Peng, Yuxin Liu, Changfeng Gao +4Speech Language ModelsLarge Audio Language Models

  28. Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization

    Aug 4, 2026Xiang Lin, Tian-Hao Zhang, Chunfeng Wang +3Paralinguistic CuesSpeech Language Models

  29. Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models

    Aug 3, 2026Linkai Peng, Baorian NuchgedSpeech Language ModelsReadout

  30. Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO

    Jul 30, 2026Xilin Jiang, Riki Shimizu, Sukru Samet Dindar +3Speech Language ModelsRepair-Based Group-Relative Policy Optimization

  31. Latent-IM: Latent Interaction Management for Speech LLMs

    Jul 29, 2026Adar Avsian, Atahan Dokme, Tony Woo +1DialogueSpeech Language Models

  32. SpeechLLM Meets Federated Learning for End-to-End ASR: English and Italian Case Studies

    Jul 28, 2026Mohamed Nabih Ali, Daniele Falavigna, Alessio BruttiSpeech Language ModelsSpeech Encoder

  33. Speech Signals Complement LLMs for Predicting Interpersonal Attraction in Speed Dating

    Jul 25, 2026Yuriko Kikuchi, Takato Hayashi, Ryusei Kimura +3Speech Language Models

  34. MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond

    Jul 24, 2026Lorenzo Concina, Seraphina Fong, Marco Matassoni +1Multilingual Automatic Speech RecognitionSpeech Translation

  35. Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models

    Jul 22, 2026Pengchao Feng, Chao-Hong Tan, Qian Chen +3Speech Language ModelsLLM Reasoning Strategies

  36. SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision

    Jul 22, 2026Rongshen He, Xinyu Liang, Dekun Chen +3Speech TranslationSpeech Language Models

  37. Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models

    Jul 11, 2026Yun-Shao Tsai, Chun-Wei Chen, Chee-En Yu +2Speech Language ModelsCross-Modal

  38. Efficiently Adapting Spoken Language Models for the Singaporean Context

    Jul 11, 2026Ng Jia Sheng JasonSpeech Language ModelsThai

  39. Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

    Jul 7, 2026Ke-Han Lu, Keqi Deng, Ruchao Fan +2Speech Language ModelsAutoregressive Decoding

  40. Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

    Jul 2, 2026Congrui Du, Yang Zhang, Kaizhi Qian +1Speech Language ModelsInstruction Tuning

  41. A Geometric Perspective on Composable Emotion Steering in Text-to-Speech Models

    Jul 1, 2026Siyi Wang, James Bailey, Ting DangSpeech Language ModelsEmotion Recognition

  42. LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

    Jun 30, 2026Hong-Yun Lin, Fu-An Chao, Bi-Cheng Yan +1Speech Language ModelsSpeech Encoder

  43. FlexiSLM: A Spoken Language Model with Dynamic and Controllable Frame Rates

    Jun 30, 2026Jiaqi Li, Chaoren Wang, Xiaohai Tian +9Speech Language ModelsNeural Speech Codecs

  44. wav2VOT: Automatic estimation of voice onset time, closure duration, and burst realisation with wav2vec2

    Jun 27, 2026James Tanner, Morgan Sonderegger, Jane Stuart-Smith +2Wav2VecGrapheme-To-Phoneme

  45. FBK's Long-form SpeechLLMs for IWSLT 2026 Instruction Following

    Jun 25, 2026Zhihang Xie, Marco Gaido, Sara Papi +2Speech Language ModelsSpeaker

  46. Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

    Jun 24, 2026Tomoya Mizumoto, Yusuke Fujita, Hao Shi +3DialectsSpeech Language Models

  47. Selective Capability Unlearning in End-to-End Spoken Language Understanding

    Jun 23, 2026Akanksha Singh, Vinod Kumar KurmiSpeech Language ModelsSuppression

  48. On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

    Jun 22, 2026Shunsuke Kando, Wataru Nakata, Shinnosuke Takamichi +1Speech Language ModelsDiscrete Speech Representations

  49. Scaling Audio Models Efficiently: Joint Optimization of Scale, Resolution, Adaptation, Precision, and Sparsity

    Jun 22, 2026Vyom Agarwal, Mokshda Gangrade, Siddharth Pal +1End-To-End Automatic Speech Recognition ModelsSpeech Language Models

  50. Interleaved Speech Language Models Latently Work In Text

    Jun 21, 2026Talia Sternberg, Gallil Maimon, Yossi AdiSpeech Language ModelsLarge Language Model Pretraining

  51. XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

    Jun 15, 2026Yupei Li, Qiyang Sun, Xiaoliang Wu +3Speech Language ModelsExplainable Artificial Intelligence

  52. BayLing-Duplex: Native Full-Duplex Speech Dialogue with a Single Autoregressive LLM

    Jun 12, 2026Qingkai Fang, Shoutao Guo, Yang FengFull-Duplex Speech ModelsSpeech Language Models