Voice Agent Evaluation

Momentum

6 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 23

All topics
CardsList
  1. Talk2Agent: Benchmarking Voice Interfaces for Text Agents

    Sep 30, 2026Terumi Chiba, Guangzhi Sun, Zheqi Yuan +1ASR EvaluationVoice Agent Evaluation

  2. Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

    Aug 25, 2026Anupam Purwar, Shashank Singh, Kritika SrivastavaVoice Agent EvaluationLLM-as-a-Judge

  3. DuplexWorld: Can voice agents help you get through the day?

    Aug 11, 2026Aryan Vijay Bhosale, Harshit Rajgarhia, Akhil Pothanapalli +3Voice Agent EvaluationSpoken Dialogue Systems

  4. FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

    Aug 6, 2026Aman Dalmia, Sanskriti Midha, Jigar DoshiVoice Agent EvaluationHealthcare

  5. VAmoS Bench: Voice Agent Simulation Bench

    Jul 29, 2026Joshua Meyer, Sahar Shayegan, Ritiz Tambi +5Voice Agent EvaluationCustomer Support Automation

  6. RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems

    Jul 16, 2026David Ayllon, Alice Baird, Jeffrey Brooks +11ASR EvaluationVoice Agent Evaluation

  7. A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

    Jul 8, 2026A. Sayyad, J. Emmons, S. Jones +2Audio-Language Model EvaluationVoice Agent Evaluation

  8. Reference-Based Prosody and Rhythm Evaluation for Spoken Dialogue Systems

    Jun 30, 2026Ashish Hallur, Thomas Thebaud, Georgi Tinchev +2Voice Agent EvaluationSpeech Generation Evaluation

  9. Real-Time Voice AI Hears but Does Not Listen

    Jun 24, 2026Martijn Bartelds, Federico Bianchi, James ZouAudio-Language Model EvaluationVoice Agent Evaluation

  10. SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

    Jun 24, 2026Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu +2Audio-Language Model EvaluationVoice Agent Evaluation

  11. WASIL: In-the-Wild Arabic Spoken Interactions with LLMs

    May 9, 2026Zien Sheikh Ali, Hamdy Mubarak, Soon-Gyo Jung +3Voice Agent EvaluationArabic NLP

  12. PersonaKit (PK): A Plug-and-Play Platform for User Testing Diverse Roles in Full-Duplex Dialogue

    May 7, 2026Hyunbae Jeon, Jinho D. ChoiVoice Agent EvaluationSpoken Dialogue Systems

  13. Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use

    Apr 17, 2026Ramit Pahwa, Apoorva Beedu, Parivesh Priye +4Audio-Language Model EvaluationVoice Agent Evaluation

  14. Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction

    Feb 27, 2026Xiang Li, Jiabao Gao, Sipei Lin +5Voice Agent EvaluationSpoken Dialogue Systems

  15. VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents

    Oct 13, 2025Jiliang Hu, Wenfu Wang, Zuchao Li +6Audio-Language Model EvaluationVoice Agent Evaluation

  16. EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

    Date pendingTara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz +10Voice Agent EvaluationSpoken Dialogue Systems