Multi-Turn Dialogue Evaluation

Latest papers 104

All topics
CardsList
  1. ProMediConv: Benchmarking Proactive Conversational Agents in Legal Dispute Mediation

    Sep 11, 2026Zesheng Wei, Mengfan Li, Wenhao Liu +3Automated NegotiationLLM Agent Evaluation

  2. RESCUE-BENCH: Towards Relation-Aware Multi-Party Emotional Support Conversation Systems

    Sep 10, 2026Haichuan Hu, Yang Xiao, Mingni Tang +7Emotional Support ConversationMulti-Turn Dialogue Evaluation

  3. S3S^3-Bench: Evaluating Speech Interaction Models as Scientific Voice Assistants

    Sep 9, 2026Heyang Liu, Jiayi Huang, Wenyang Xiao +8Audio QASpoken Dialogue Systems

  4. Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation

    Sep 3, 2026Yuhe Wu, Guangyu Wang, Yujie Chen +7Moral Reasoning in Language ModelsLLM Reliability

  5. A Tri-Agent Framework for Evaluating and Aligning Question Clarification Capabilities of Large Language Models

    Sep 2, 2026Yikai Zhao, Saurabh Pandey, Pradeep Kumar MisraMulti-Agent LLM SystemsClarification Question Generation

  6. TalkFa: A Unified Benchmark for Farsi Dialogue Generation and Understanding

    Sep 1, 2026Neda Jamshidi, Kamyar Zeinalipour, Fahimeh Akbari +3Multilingual Language Model EvaluationMulti-Turn Dialogue Evaluation

  7. Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling

    Sep 1, 2026Kangjia Zhao, Jiajun Li, Haozhan Shen +8Tool-Use EvaluationLLM Agent Evaluation

  8. Augmenting Interviewer Judgments of Patient Experience with Automatic Language Analysis

    Aug 31, 2026Aowen Shi, Michal Balazia, Danilo Postin +4Multi-Turn Dialogue EvaluationClinical NLP

  9. Evaluating the Capabilities of LLMs for Persuasive Dialogue

    Aug 30, 2026Jordan Robinson, Angus R. Williams, Katie Atkinson +1LLM EvaluationMulti-Agent Debate

  10. Benevolent Bias in Multi-Turn Human-Agent Dialogue

    Aug 29, 2026Qianqi Liu, Jin Huang, Fethiye Irmak Dogan +1Social Bias in Language ModelsAlgorithmic Bias

  11. TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue

    Aug 25, 2026Freeman Jiang, Ramon Sanabria, Soham Deshmukh +16Spoken Dialogue SystemsMulti-Turn Dialogue Evaluation

  12. TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

    Aug 16, 2026Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu +1Adversarial TrainingLLM Jailbreak Attacks

  13. SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

    Aug 13, 2026Qianxi Yan, Chunrong Chen, Jiuzhou Zhao +3LLM Agent Skill LearningMulti-Turn Dialogue Evaluation

  14. Dead text or binding clause? Measuring and restoring constraint influence in black-box LLM dialogues

    Aug 12, 2026Haoyuan ZhuInstruction FollowingLLM Reliability

  15. DuplexWorld: Can voice agents help you get through the day?

    Aug 11, 2026Aryan Vijay Bhosale, Harshit Rajgarhia, Akhil Pothanapalli +3Voice Agent EvaluationSpoken Dialogue Systems

  16. Illusion of Alignment: Detecting Hidden Disagreement in Collaborative Dialogue

    Aug 8, 2026Kaiming Liu, Fuwen Luo, Ziyue Wang +6Multi-Turn Dialogue EvaluationHuman-AI Collaboration

  17. DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

    Aug 8, 2026Anthony Miyaguchi, Conor JohnstonLLM EvaluationLLM-as-a-Judge

  18. PHASE-Tree: Modeling Character-State Evolution in Long-Horizon Role-Playing Dialogue

    Aug 7, 2026Bo Tang, Jianan Yang, Junyi Zhu +7Personality Modeling in Language ModelsMulti-Turn Dialogue Evaluation

  19. TradeVerse: A Longitudinal Benchmark of Political Negotiation in International Trade

    Aug 6, 2026Debodeep Banerjee, Amitangshu DasguptaLLM EvaluationAutomated Negotiation

  20. Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation

    Aug 4, 2026Saqib Shouqi, Abdullah Nazly, Januki Wanniarachchi +1Adversarial Attacks on LLMsLLM Agent Evaluation

  21. MonitrLLM: A Community-Centered Evaluation Infrastructure for Large Language Models

    Aug 3, 2026Victor Ojewale, Ro Encarnación, Suresh Venkatasubramanian +1LLM EvaluationHuman-in-the-Loop Evaluation

  22. The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations

    Jul 31, 2026Ilya MikhelsonEducational AssessmentMulti-Turn Dialogue Evaluation