Talk

Momentum

8 papers in the last four weeks, with none the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 29

All topics
CardsList
  1. Code-Switching Spoken Language Identification as Multi-Label Set Prediction

    Oct 1, 2026Shunsuke Mitsumori, Matthew Wiesner, Shigeo Morishima +1Code-SwitchingMultilingual Automatic Speech Recognition

  2. MegaAvatar: Controllable Talking Avatar Generation

    Sep 30, 2026Junyao Gao, Sibo Liu, Weidong Zhang +2AvatarsHuman Motion Generation

  3. Talk2Agent: Benchmarking Voice Interfaces for Text Agents

    Sep 30, 2026Terumi Chiba, Guangzhi Sun, Zheqi Yuan +1TalkAutomatic Speech Recognition Evaluation

  4. EvolvingAvatar: Interactive 3D Head Generation That Adapts as Conversations Unfold

    Sep 28, 2026Junjie Chen, Fei Wang, Kun Li +5AvatarsAudio-Video Generation

  5. Foreground Voice Activity Detection: Learning Speaker Selectivity from Supervision

    Sep 17, 2026Guangzhao Yang, Muhammad Huzaifah, Yu Pan +2SpeakerTalk

  6. KoUniTalk: A Lightweight Articulation-Centered Korean-English 3D Talking Face Benchmark

    Sep 17, 2026Hyunjung Chung, Unsang ParkFacial Expression RecognitionHumanml3D

  7. SparseTalk - Sparsifying 3D Gaussian Language Fields for Efficient 3D Visual Question Answering

    Sep 14, 2026Davit Soselia, Joseph JaJa, Amitabh Varshney3D RepresentationKnowledge-Based Visual Question Answering

  8. When2Talk: When Should a Proactive In-Car Agent Talk?

    Sep 14, 2026Kaiser Hamid, Peihang Li, Nade LiangProactiveTalk

  9. Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching

    Aug 5, 2026Runwei Guan, Di Tian, Ningwei Ouyang +93D Visual GroundingAutonomous Driving Perception

  10. SubtleTalk: Generating Controllable Weakly-correlated Facial Dynamics for 3D Talking Heads via Residual Flow Matching

    Aug 3, 2026Chenyang Ding, Shuai Tan, Qunfen Lin +3Precise Lip SynchronizationFacial Expression Recognition

  11. LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

    Jul 29, 2026Rongxiang Zhang, Songhua LiuPrecise Lip SynchronizationTalk

  12. CultureTalk-ID: A Multi-Task Dialogue Benchmark for Cultural Commonsense in Indonesian Local Languages

    Jul 23, 2026Muhammad Dehan Al Kautsar, Salsabila Pranida, Bilal Elbouardi +1Cultural AwarenessDialogue Benchmarks

  13. Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging

    Jul 11, 2026Jinglan Gong, Jiefan Lu, Hewei Guo +5Dialogue BenchmarksUser Simulation

  14. Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation

    Jun 30, 2026Baiqin Wang, Sen Chen, Jiankuo Zhao +3Precise Lip SynchronizationHuman Motion Generation

  15. Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks

    Jun 7, 2026Shi Ying Chang, Chiok Yew Ho, Yichen Li +1Instruction-Tuned ModelsTalk

  16. TalkTag: Fine-Grained Morphosyntactic Error Annotation for Transcribed Speech

    Jun 1, 2026Shamira Venturini, Oliver Hennhöfer, Steffen Kinkel +1TranscriptTagging

  17. TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens

    May 29, 2026Qingcheng Zhao, Yifang Pan, Karan SinghFacial Expression RecognitionTalk

  18. DarkForest: Less Talk, Higher Accuracy for Multi-Agent LLMs

    May 24, 2026Yi Li, Songtao Wei, Dongming Jiang +3Multi-Agent Large Language Model SystemsReasoning Benchmark

  19. SDTalk: Structured Facial Priors and Dual-Branch Motion Fields for Generalizable Gaussian Talking Head Synthesis

    May 11, 2026Peng Jia, Zhen Xiao, Jia Li +3Precise Lip SynchronizationTalk

  20. Insight: Enhancing Mobile Accessibility for Blind and Visually Impaired Users with LLMs

    May 10, 2026Joshua Owusu Ansah, Anuj Kapoor, Ayush Khanna +3AccessibilityDevice

  21. When2Speak: A Dataset for Temporal Participation and Turn-Taking in Multi-Party Conversations for Large Language Models

    May 7, 2026Vihaan Nama, Shreya Mendi, Zian Ye +1Turn-TakingTalk

  22. AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation

    May 1, 2026Yuxin Lu, Jiayang Sun, Guibo Zhu +1TalkSpatial Encoding

  23. Talking Slide Avatars: Open-Source Multimodal Communication Approach for Teaching

    Apr 26, 2026Xinxing WuAvatarsTalk

  24. Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

    Apr 26, 2026Zhen Ye, Xu Tan, Aoxiong Yin +8Audio-Video GenerationAutoregressive Diffusion

  25. ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis

    Oct 12, 2025Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh ShakeryText-To-Speech SynthesisSpeech Synthesis

  26. From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications

    Aug 30, 2023Shreyank N Gowda, Dheeraj Pandey, Shashank Narayana GowdaFacial Expression RecognitionPortraits