Utterances

Momentum

15 papers in the last four weeks, up 400% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 44

All topics
CardsList
  1. Contextual trajectory and incremental contextual displacement: Towards using LLMs to understand dynamic, utterance-specific meaning construction

    Sep 30, 2026Grayson Wycliffe Storer, Julia Witte ZimmermanContextual EmbeddingsSingle Trajectory

  2. What Comes Next? Omni-StoryBench for Evaluating Story-Grounded Omnimodal Generation

    Sep 29, 2026Sieun Hyeon, Yejoon Lee, Mintaek Lim +3Omni-ModalMultimodal Generation

  3. Few-Shot Calibration for Sim-to-Real Single-Channel Speaker Distance Estimation

    Sep 24, 2026Michael Neri, Archontis Politis, Tuomas VirtanenAcousticUtterances

  4. From Utterances to Networks: Modelling Slang Adoption and Diffusion Across Subreddits

    Sep 22, 2026Xiaoning Wang, Ted Underwood, Zhewei SunAdoptionUtterances

  5. Beyond Encoder Fusion: Multi-View Discrete Token Augmentation for LLM-Based ASR

    Sep 20, 2026Paul Moïse Gangbadja, Mickael Rouvier, Fabrice LefèvreSpeech EncoderDiscrete Speech Representations

  6. Full-Duplex Speech Models Take the Floor When Asked, Not When Needed

    Sep 17, 2026Linkai Peng, Baorian Nuchged, Kaiqi Fu +1Full-Duplex Speech ModelsUtterances

  7. Voice of Reason: Reinforcement Learning for Spoken Math

    Sep 16, 2026Timothée Weisselberger, Edouard Graves, Alexandre DéfossezSpeech Language ModelsMathematical Reasoning Benchmarks

  8. Negation Beyond the Verbal Channel: Temporal Multimodal Correlates in Dialogue

    Sep 14, 2026Leon Hammerla, Patrick Schrottenbacher, Alexander MehlerNonverbal CuesNegation

  9. Omni-Streaming Thinking

    Sep 14, 2026Enjun Du, Siyi Liu, Ziyu Zheng +4Omni-ModalAudio-Visual Reasoning

  10. Using Semantic Uncertainty to Estimate Transition Relevance in Turn-taking

    Sep 11, 2026Muhammad Umair, Jan P. de RuiterTurn-TakingUtterances

  11. KABURI-TTS: Phoneme-Keyed Activity-conditioned Bi-channel Utterance Rendering for Interaction

    Sep 7, 2026Ryuichiro Higashinaka, Shinnosuke Takamichi, Tetsuji OgawaFull-Duplex Speech ModelsF5-Tts

  12. Not All Fallbacks Are Failures: Understanding and Recovering from Fallbacks in Mobile Voice Assistants

    Aug 31, 2026Phillip Schneider, Alexandre Mercier, Joshua Oehms +2Full-Duplex Voice AgentsUtterances

  13. A Formal Limitation on Learning Human Language From Textual Corpora

    Aug 28, 2026Emily Cheng, Ryan CotterellLinguisticsNatural Language Processing

  14. Leveraging Speech Acts for Low-Data and Cross-Domain Conversation Derailment Forecasting

    Aug 26, 2026Angela Yifei Yuan, Christine De Kock, Christopher LeckieUtterancesSpeech Language Models

  15. CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis

    Aug 8, 2026Zhisheng Zheng, Xiaohang Sun, Zhu Liu +5ProsodyUtterances

  16. Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

    Aug 6, 2026Menglin Han, Yang Ding, Yulei Lu +6Audio-Video GenerationStreaming

  17. Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

    Aug 5, 2026Yuezhang Peng, Yuxin Liu, Changfeng Gao +4Speech Language ModelsLarge Audio Language Models

  18. dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model

    Aug 2, 2026Hankun Wang, Bohan Li, Shi Lian +7UtterancesAutoregressive Model

  19. Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results

    Jul 21, 2026Ilse Huisman, Rares Popa, Yuanyuan Zhang +1Automatic Speech Recognition EvaluationAutomatic Speech Recognition

  20. Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

    Jul 21, 2026Laurin Wagner, Bernhard Thallinger, Miroslav Stankovic +1Audio TokenizersSpeaker

  21. SpeechGuard: Online Defense against Backdoor Attacks on Speech Recognition Models

    Jul 17, 2026Jinwen Xin, Xixiang LvLLM Defense MechanismsUtterances

  22. We Hebben Een Serieus Translatie: Modeling Intercomprehension as Probabilistic Inference

    Jul 13, 2026Thomas Hikaru Clark, Edward Gibson, Roger LevyUtterances

  23. Breaking the 15% Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues

    Jul 13, 2026Yuga Yano, Yuki Okafuji, Ryo Miyoshi +2Nonverbal CuesHuman-Robot Interaction

  24. From ambiguous utterances to governed reuse classes: canonicalization, quotient invariance, and conditional decidability

    Jul 11, 2026Cosimo Spera, Ray GarciaReuseTractability

  25. What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

    Jul 2, 2026Arman Ghaffarizadeh, Danyal Mohaddes, Aliakbar Izadkhah +1DebateLarge Language Model Agents

  26. Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS

    Jun 22, 2026Seymanur Akti, Alexander WaibelVocalizationsUtterances

  27. Stabilizing Short Duration Speaker Verification through Neural Re-scoring with Hybrid Enrollment

    Jun 15, 2026Zhiqi Ai, Han Cheng, Shiyi Mu +3Automatic Speaker VerificationDiscrete Speech Representations

  28. Dual-Branch Gated Fusion for Open-Set Audio Deepfake Source Tracing

    Jun 8, 2026Awais Khan, Kutub Uddin, Khalid MalikSynthesizerUtterances

  29. Think-Before-Speak: From Internal Evaluation to Public Expression in Multi-Agent Social Simulation

    Jun 2, 2026Kaiqi Yang, Tai-Quan Peng, Sanguk Lee +1Multi-Agent SimulationsUtterances

  30. Wait! There's a Way Out: A Decision Mechanism for Forecasting Conversational Derailment

    May 28, 2026Laerdon Kim, Vivian Nguyen, Cristian Danescu-Niculescu-MizilDeliberationUtterances

  31. I Hear, Therefore I Trust: A Socio-Technical Investigation of Humans as Synthetic Speech Detectors

    May 27, 2026Lelia Erscoi, Tomi KinnunenUtterancesAI Trustworthiness

  32. Eroding Trust in Real Speech: A Large-Scale Study of Human Audio Deepfake Perception

    May 21, 2026Nicolas M. Müller, Wei Herng ChoongAudio Deepfake DetectionFake News

  33. Enhancing Target-Guided Proactive Dialogue Systems via Conversational Scenario Modeling and Intent-Keyword Bridging

    May 12, 2026Maodong Li, Yancui Li, Fang KongProactiveUtterances

  34. Surprisal Minimisation over Goal-directed Alternatives Predicts Production Choice in Dialogue

    May 1, 2026Tom Utting, Mario Giulianelli, Arabella SinclairUtterancesSurprisal

  35. Scaling Properties of Continuous Diffusion Spoken Language Models

    Apr 27, 2026Jason Ramapuram, Eeshan Gunesh Dhekane, Amitis Shidani +6Speech Language ModelsDiffusion Language Models

  36. Enhancing Science Classroom Discourse Analysis through Joint Multi-Task Learning for Reasoning-Component Classification

    Apr 22, 2026Jiho Noh, Mukhesh Raghava Katragadda, Raymond Carl +1ClassroomsDiscourse

  37. Comparison of sEMG Encoding Accuracy Across Speech Modes Using Articulatory and Phoneme Features

    Apr 20, 2026Chenqian Le, Ruisi Li, Beatrice Fumagalli +6ArticulatoryGrapheme-To-Phoneme

  38. When Misinformation Speaks and Converses: Rethinking Fact-Checking in Audio Platforms

    Apr 18, 2026Chaewan Chun, Delvin Ce Zhang, Dongwon LeeMisinformationFact-Checking

  39. When Consistency Becomes Bias: Interviewer Effects in Semi-Structured Clinical Interviews

    Mar 25, 2026Hasindri Watawana, Sergio Burdisso, Diego A. Moreno-Galván +4DepressionInterviews

  40. Glance-Say: Multimodal Human-Robot Collaboration and Intent Recognition via Sticky Glance

    Mar 6, 2026Yuzhi Lai, Shenghai Yuan, Peizheng Li +2Human-Robot InteractionGaze Behavior