Multi-Turn Dialogue Evaluation

Latest papers 104

All topics
CardsList
  1. RELATE: An Evaluation Framework for measuring Relational Orientation of Large Language Models

    Oct 7, 2026Shivam Shukla, Jihye Kim, Shubham Gaur +2LLM EvaluationEmotional Support Conversation

  2. ToolRACER: A Robust Agentic Conversation Emulation Resource for Agent Training and Evaluation

    Oct 6, 2026Arkajyoti Chakraborty, Aryan Tayal, Ishika Agarwal +5Tool-Using AgentsAI Agent Benchmarks

  3. Towards an Extensible Benchmark for Spoken Dialogue with Social Robots

    Oct 6, 2026Casey Kennington, Ross Mead, Saad Elbeleidy +1Spoken Dialogue SystemsMulti-Turn Dialogue Evaluation

  4. Knowing When Not to Answer: Cross-Domain and Multi-Turn Generalization of Latent Underspecification Signals

    Oct 6, 2026Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov +6Multi-Turn Dialogue EvaluationLanguage Model Probing

  5. Conversation Is a Two-Body Problem: Dyadic Evaluation of Full-Duplex Dialogue Models

    Oct 6, 2026Sungnyun Kim, Sungwoo Cho, Jihwan Oh +1Multi-Turn Dialogue EvaluationFull-Duplex Spoken Dialogue Systems

  6. FIGS: Evaluating Multi-Turn Sycophancy Without Penalizing Empathy

    Sep 30, 2026Sidharth Pulipaka, Ruta Binkyte, Ivaxi Sheth +1LLM SycophancyMulti-Turn Dialogue Evaluation

  7. KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy

    Sep 29, 2026Xueting Fang, Zehui Li, Yang Yang +5Clinical Decision-MakingMulti-Turn Dialogue Evaluation

  8. CypherTurn: A Multi-Turn Benchmark for Conversational Text-to-Cypher Evaluation and the Autonomy Divergence

    Sep 29, 2026Yuzhe Zhang, Weijie Zhu, Haolin Yang +5LLM EvaluationText-to-Cypher

  9. Understanding Clinical Cognitive Dialogues Using Large Language Models

    Sep 28, 2026Vishalakshi Arumugam, Dan Schumacher, Veronica Rammouz +3Intent ClassificationMulti-Turn Dialogue Evaluation

  10. From Offline Proxies to Online Decisions: A Layered Engagement Evaluation Framework for Conversational AI

    Sep 21, 2026Xuanyi Li, Vaskar Nath, Hossein Amirkhani +2A/b TestingMulti-Turn Dialogue Evaluation

  11. OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue

    Sep 18, 2026Haolin He, Yunfei Chu, Qi Chen +15Reinforcement LearningSynthetic Data Generation

  12. DyMT-ESB: Dynamic Multi-Turn Evaluation of Social Bias in User-LLM Interactions

    Sep 16, 2026Rem Hida, Masahiro Kaneko, Daisuke Oba +2Social Bias in Language ModelsMulti-Turn Dialogue Evaluation

  13. Same Words, Different Actions: Paired Turn-Taking Evaluation under Rewritten Dialogue Contexts

    Sep 15, 2026Shuofeng Zhao, Hongwei Cai, Wenke Fan +9Spoken Dialogue SystemsMulti-Turn Dialogue Evaluation

  14. GLARE: Generative Learning via Adversarial Reward Estimation For Social Dynamics Forecasting

    Sep 14, 2026Tenghao Huang, Zhaoxuan Tan, Muhao Chen +5RL for Language ModelsAdversarial Imitation Learning

  15. SteerDuplex: Steerable Duplex Speech Dialogue Models

    Sep 14, 2026Utkarsh Tyagi, Ramaneswaran Selvakumar, Advait Gosai +13Language Model SteeringSpoken Dialogue Systems

  16. MedRoundsQA: A Persona and Difficulty Aware Evaluation for Multi-Turn Medical Consultations

    Sep 14, 2026Youssef Mohamed, Ahmed Heakl, Qinrong Cui +13Medical DiagnosisMulti-Turn Dialogue Evaluation

  17. SWRouter: Similarity-Contractive Window Routing for Multi-Turn Large Language Model Conversations

    Sep 12, 2026Yu Wang, Yuchen Li, Rui Kong +11Multi-Turn Dialogue EvaluationLLM Routing