Multi-Turn Dialogue Evaluation

Latest papers 104

All topics
CardsList
  1. Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding

    Jul 31, 2026Eileen Ye, Jiawen Tao, Yaoming Li +7Conversational MemoryLLM Evaluation

  2. Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm

    Jul 30, 2026Ming Wang, Jiaqi Wu Young, Wenfang Wu +2Emotional Support ConversationHuman-AI Interaction

  3. Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation

    Jul 30, 2026Yuhang Zhu, Mingxuan Du, Benfeng Xu +3LLM EvaluationLarge Language Model-Based Role-Play Simulation

  4. Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases

    Jul 28, 2026Rui Yang, Weihao Xuan, Yi Lin +23Medical VLMsMulti-Turn Dialogue Evaluation

  5. RUMBA: Russian User Memory Benchmark

    Jul 23, 2026Elizaveta Shevtsova, Inna Glebkina, Mark Baushenko +2Temporal Reasoning in Language ModelsTemporal Reasoning

  6. One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies

    Jul 23, 2026Minh Ngoc Ta, My Anh Tran Nguyen, Duong D. Nguyen +2LLM EvaluationClarification Question Generation

  7. CultureTalk-ID: A Multi-Task Dialogue Benchmark for Cultural Commonsense in Indonesian Local Languages

    Jul 23, 2026Muhammad Dehan Al Kautsar, Salsabila Pranida, Bilal Elbouardi +1Multilingual Language Model EvaluationMulti-Turn Dialogue Evaluation

  8. LLMs Get Lost in Evolving User Intent

    Jul 22, 2026Jihoon Tack, Philippe Laban, Jennifer NevilleLLM Agent EvaluationAI Agent Benchmarks

  9. MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents

    Jul 21, 2026Guofeng Zhang, Yizeng Quan, Huaiyi Fang +6LLM Agent EvaluationMulti-Turn Dialogue Evaluation

  10. Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment

    Jul 19, 2026Wentao Liu, Siyu Song, Xi Chen +4LLM AlignmentLarge Language Model-Based Role-Play Simulation

  11. StabilityBench: Benchmarking Instability in LLMs

    Jul 17, 2026Emma Kondrup, Zachary Yang, Anne Imouza +1LLM EvaluationLanguage Model Generation Evaluation

  12. Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

    Jul 16, 2026Yijiang Li, Huiqi Zou, Bingyang Wang +1VLM EvaluationVLM Hallucination

  13. Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations

    Jul 14, 2026Monica Munnangi, Saiph SavageMulti-Turn Dialogue EvaluationClinical Language Model Evaluation

  14. Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging

    Jul 11, 2026Jinglan Gong, Jiefan Lu, Hewei Guo +5Language Model Generation EvaluationPersona Consistency

  15. Cognitive World Models for Process-Level Social Influence Evaluation

    Jun 28, 2026Minghui Ma, Bin Guo, Han Wang +4LLM EvaluationCognitive Modeling

  16. 5ting at SemEval-2026 Task 8: Strong End-to-End Multi-Turn RAG via LLM-Based Reranking and Faithfulness Control

    Jun 27, 2026Thien-Qua-T-Nguyen, Chi Hoang, Nguyen Tran +3Retrieval-Augmented GenerationMulti-Turn Dialogue Evaluation

  17. SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

    Jun 24, 2026Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu +2Audio-Language Model EvaluationVoice Agent Evaluation

  18. Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment

    Jun 23, 2026Ali Pourghasemi Fatideh, Wilder Baldwin, Maria Dhakal +2Requirements EngineeringLLM Evaluation

  19. Measuring Semantic Progress in Multi-turn Dialogue via Information Gain

    Jun 10, 2026Paul He, Shiva Kasiviswanathan, Dominik JanzingLLM EvaluationMulti-Turn Dialogue Evaluation

  20. Context-Aware Multimodal Claim Verification in Spoken Dialogues

    Jun 9, 2026Chaewan Chun, Delvin Ce Zhang, Dongwon LeeClaim VerificationAudio Understanding

  21. ττ-Rec: A Verifiable Benchmark for Agentic Recommender Systems

    Jun 8, 2026Bharath Sivaram Narasimhan, Karthik R NarasimhanAI Agent ReliabilityAI Agent Benchmarks

  22. IMUG-Bench: Benchmarking Unified Multimodal Models on Interleaved Understanding and Generation

    Jun 8, 2026Lingyi Meng, Zecong Tang, Haoran Li +12Unified Multimodal ModelsMultimodal Generation