Multi-Turn Dialogue Evaluation

Latest papers 108

All topics
CardsList
  1. Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation

    Aug 4, 2026Saqib Shouqi, Abdullah Nazly, Januki Wanniarachchi +1Adversarial Attacks on LLMsLLM Agent Evaluation

  2. MonitrLLM: A Community-Centered Evaluation Infrastructure for Large Language Models

    Aug 3, 2026Victor Ojewale, Ro Encarnación, Suresh Venkatasubramanian +1LLM EvaluationHuman-in-the-Loop Evaluation

  3. The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations

    Jul 31, 2026Ilya MikhelsonEducational AssessmentMulti-Turn Dialogue Evaluation

  4. Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding

    Jul 31, 2026Eileen Ye, Jiawen Tao, Yaoming Li +7Conversational MemoryLLM Evaluation

  5. Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm

    Jul 30, 2026Ming Wang, Jiaqi Wu Young, Wenfang Wu +2Emotional Support ConversationHuman-AI Interaction

  6. Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation

    Jul 30, 2026Yuhang Zhu, Mingxuan Du, Benfeng Xu +3LLM EvaluationLarge Language Model-Based Role-Play Simulation

  7. Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases

    Jul 28, 2026Rui Yang, Weihao Xuan, Yi Lin +23Medical VLMsMulti-Turn Dialogue Evaluation

  8. RUMBA: Russian User Memory Benchmark

    Jul 23, 2026Elizaveta Shevtsova, Inna Glebkina, Mark Baushenko +2Temporal Reasoning in Language ModelsTemporal Reasoning

  9. One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies

    Jul 23, 2026Minh Ngoc Ta, My Anh Tran Nguyen, Duong D. Nguyen +2LLM EvaluationClarification Question Generation

  10. CultureTalk-ID: A Multi-Task Dialogue Benchmark for Cultural Commonsense in Indonesian Local Languages

    Jul 23, 2026Muhammad Dehan Al Kautsar, Salsabila Pranida, Bilal Elbouardi +1Multilingual Language Model EvaluationMulti-Turn Dialogue Evaluation

  11. LLMs Get Lost in Evolving User Intent

    Jul 22, 2026Jihoon Tack, Philippe Laban, Jennifer NevilleLLM Agent EvaluationAI Agent Benchmarks

  12. MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents

    Jul 21, 2026Guofeng Zhang, Yizeng Quan, Huaiyi Fang +6LLM Agent EvaluationMulti-Turn Dialogue Evaluation

  13. Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment

    Jul 19, 2026Wentao Liu, Siyu Song, Xi Chen +4LLM AlignmentLarge Language Model-Based Role-Play Simulation

  14. StabilityBench: Benchmarking Instability in LLMs

    Jul 17, 2026Emma Kondrup, Zachary Yang, Anne Imouza +1LLM EvaluationLanguage Model Generation Evaluation

  15. Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

    Jul 16, 2026Yijiang Li, Huiqi Zou, Bingyang Wang +1VLM EvaluationVLM Hallucination

  16. Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations

    Jul 14, 2026Monica Munnangi, Saiph SavageMulti-Turn Dialogue EvaluationClinical Language Model Evaluation

  17. Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging

    Jul 11, 2026Jinglan Gong, Jiefan Lu, Hewei Guo +5Language Model Generation EvaluationPersona Consistency

  18. Cognitive World Models for Process-Level Social Influence Evaluation

    Jun 28, 2026Minghui Ma, Bin Guo, Han Wang +4LLM EvaluationCognitive Modeling

  19. 5ting at SemEval-2026 Task 8: Strong End-to-End Multi-Turn RAG via LLM-Based Reranking and Faithfulness Control

    Jun 27, 2026Thien-Qua-T-Nguyen, Chi Hoang, Nguyen Tran +3Retrieval-Augmented GenerationMulti-Turn Dialogue Evaluation

  20. SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

    Jun 24, 2026Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu +2Audio-Language Model EvaluationVoice Agent Evaluation

  21. Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment

    Jun 23, 2026Ali Pourghasemi Fatideh, Wilder Baldwin, Maria Dhakal +2Requirements EngineeringLLM Evaluation