Multi-Turn Dialogue Evaluation

Latest papers 104

All topics
CardsList
  1. FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses

    Jun 3, 2026Nicholas SabanLLM EvaluationAgent Evaluation

  2. MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue

    May 30, 2026Yue Jiang, Xue Jiang, Lihua Zhang +6Multimodal Large Language ModelsMultimodal Hallucination

  3. Personalized Turn-Level User Conversation Satisfaction Benchmark

    May 28, 2026Zhefan Wang, Zhiqiang Guo, Weizhi Ma +3Human Preference EvaluationLLM Personalization

  4. DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing Agents

    May 28, 2026Rongsheng Zhang, Jiji Tang, Junnan Ren +6Large Language Model-Based Role-Play SimulationLong-Horizon Agent Evaluation

  5. RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator

    May 20, 2026Zhenwei Tang, Zhaoyan Liu, Rasa Hosseinzadeh +3LLM EvaluationPairwise Comparison

  6. AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence

    May 20, 2026Kate M. Lubrano, Faisal Sayed, Ankita Rathod +4LLM EvaluationEmotion Recognition in Conversations

  7. MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks

    May 20, 2026Junhao Ruan, Abudukeyumu Abudula, Bei Li +8Conversational SearchSynthetic Benchmark Generation

  8. SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs

    May 15, 2026Avijit Shil, Suman SamuiLLM EvaluationFactual Consistency Evaluation

  9. Beyond Continuity: Challenges of Context Switching in Multi-Turn Dialogue with LLMs

    May 10, 2026Aditya Sinha, Harald Steck, Vito Ostuni +1LLM EvaluationMulti-Turn Dialogue Evaluation

  10. Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

    May 2, 2026Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida +6LLM EvaluationLLM-as-a-Judge

  11. Evaluating Temporal Consistency in Multi-Turn Language Models

    Apr 24, 2026Yash Kumar Atri, Steven L. Johnson, Tom HartvigsenLLM EvaluationTemporal Reasoning in Language Models

  12. When Users Are Happy but Agents Are Wrong: Multi-Dimensional Evaluation of Tool-Augmented Dialogue

    Oct 22, 2025Tanya Shourya, Yingfan Wang, Zhaoyi Joey Hou +3Tool-Use EvaluationAI Agent Benchmarks

  13. Inverse Turing Bench: Evaluating Language Models as Judges of Human vs. AI Dialogue

    Date pendingWilliam Hager, Ishika Rathi, Masum Hasan +1LLM EvaluationAI-Generated Text Detection