Multi-Turn Benchmark

Momentum

2 papers in the last four weeks, down 71% on the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 50

All topics
CardsList
  1. CypherTurn: A Multi-Turn Benchmark for Conversational Text-to-Cypher Evaluation and the Autonomy Divergence

    Sep 29, 2026Yuzhe Zhang, Weijie Zhu, Haolin Yang +5Reasoning GraphsText2Cypher

  2. Do Coding Agents Reuse Existing Code or Reinvent the Wheel?

    Sep 28, 2026Dongsheng Ma, Sizhe Wang, Xinyi Huang +5Coding AgentsReuse

  3. TQTS-Bench: A Multi-Syntax Benchmark for Text-to-Query over Time-Series Databases

    Sep 28, 2026Fei Lyu, Zhiyi Peng, Jiaming Liu +5Text-To-SqlMulti-Turn Benchmark

  4. A primer on evaluation methods for large language models in healthcare

    Sep 13, 2026Suzannah E McKinney, Phuc Vu, Samuel A Justice +7Large Language Model EvaluationHealthcare

  5. KC-Bench: A Dynamic Interactive Benchmark for Evaluating Knowledge Conflicts in LLM Agents

    Sep 3, 2026Yaxing Lyu, Shengjie Zhou, Binbin Toh +2Large Language Model AgentsMulti-Turn Benchmark

  6. ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models

    Aug 10, 2026Yilin Jiang, Xiaorong Zhu, Fei Tan +9Multi-Turn Benchmark

  7. TeXFix-Bench: An Empirically Grounded Multi-Format Benchmark for LLM-Based Document Source Repair

    Aug 7, 2026Prajwal S. VenkateshmurthyRepairDocumentation

  8. TRACE: A Multi-Layer Benchmark for Human AI Controller Coordination Under Drift and Failure

    Aug 7, 2026Joshua Zuniga, Srinivasan Subramanian, Ramya Madhuri Narapureddy +1TracesArtificial Intelligence Control

  9. MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs

    Aug 3, 2026Saman Sarker Joy, Niloy FarhanLarge Language Model EvaluationSycophancy

  10. Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models

    Aug 2, 2026Fali Wang, Ali Al-Lawati, Iliyas Bektas +5Reasoning BenchmarkMulti-Turn Benchmark

  11. Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding

    Jul 31, 2026Eileen Ye, Jiawen Tao, Yaoming Li +7Multi-Turn InteractionsDialogue

  12. MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning

    Jul 29, 2026Weijie Wu, Junbo Li, Lin Li +2Large Audio Language ModelsAudio Understanding

  13. StanceFlip: A Comprehensive Multi-Dimensional Benchmark for Multimodal Conversational Stance Flipping Forecasting

    Jul 27, 2026Heyan Chai, Xin Li, Wenjie Wang +5Multimodal Sentiment AnalysisFlips

  14. TEmBed-T: A Multi-Dimensional Benchmark for Table-Level Embeddings

    Jul 27, 2026Ayeen Poostforoushan, Liane Vogel, Carsten BinnigText EmbeddingsMulti-Turn Benchmark

  15. Remedying Coarsening-Based GNN Training under Heterophily via Adaptive Complementary Enhancement

    Jul 24, 2026Guoming Li, Jian Yang, Xukun Wang +3Graph Neural NetworksHeterogeneity

  16. One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies

    Jul 23, 2026Minh Ngoc Ta, My Anh Tran Nguyen, Duong D. Nguyen +2ClarificationQuestion

  17. LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

    Jul 14, 2026Michael Solodko, Steven Gong, Guangwei Yu +3Data LakesMultimodal Query

  18. Domain-Aware Scaling Laws Uncover Data Synergy

    Jul 13, 2026Kimia Hamidieh, Lester Mackey, David Alvarez-MelisSynergyLarge Language Model Pretraining

  19. Understanding Cross-Rig Generalization in Automotive Perception: a Multi-Rig Benchmark and Rig Variation Metrics

    Jun 25, 2026Tim Alexander Bader, Tim Dieter Eberhardt, Maximilian Dillitzer +1Autonomous Driving PerceptionCamera

  20. InvestPhilBench: A Multi-Layer Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy

    Jun 24, 2026Mingguang Chen, Bo QuFinancial Strategy ResearchFinance Benchmarks

  21. SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

    Jun 17, 2026Linghao Feng, Yinqian Sun, Dongqi Liang +8Large Language Model BenchmarksMulti-Turn Benchmark

  22. Quo Vadis, Visual In-Context Learning? A Unified Benchmark Across Domains and Tasks

    Jun 9, 2026Pradnya Halady, Jiale Wei, Zdravko Marinov +2Visual In-Context LearningIn-Context Learning

  23. Dense Contexts Are Hard Contexts: Lexical Density Limits Effective Context in LLMs

    Jun 4, 2026Giovanni Dettori, Matteo Boffa, Danilo Giordano +2Multi-Turn BenchmarkHard

  24. TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning

    May 31, 2026Yaxuan Kong, Qingren Yao, Yuqi Nie +7Agentic BenchmarksAgentic Reasoning

  25. Gated Graph Attention Networks with Learnable Temperature

    May 28, 2026Zhongtian Ma, Hao Wu, Yexin Zhang +2Interleaved Graph AttentionMulti-Turn Benchmark

  26. PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers

    May 26, 2026Ngoc Phan Phuoc Loc, Toan Huynh La Viet, Thanh Tran Khanh +8Peer ReviewMulti-Turn Benchmark

  27. WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

    May 25, 2026Kaining Ying, Hengrui Hu, Siyu Ren +6Video World ModelsMulti-Turn Benchmark

  28. Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

    May 21, 2026Piercosma Bisconti, Matteo Prandi, Federico Pierucci +11Large Language Model SafetySafety Benchmarks

  29. Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows

    May 14, 2026Zixin Chen, Peng Liu, Rui Sheng +6TutorsAgentic Benchmarks

  30. SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation

    May 11, 2026Niyati Rawal, Sushant Ravva, Shah Alam Abir +5Vision-Language NavigationSpatial Reasoning

  31. PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

    May 10, 2026Zhen Hang, Yushan Yashengjiang, Junhui Li +21Neural Partial Differential Equation SolversPartial Differential Equations

  32. Have Graph -- Will Lift? The Case for Higher-Order Benchmarks

    May 8, 2026Bastian RieckHigher-Order StructuresMulti-Turn Benchmark

  33. SEQUOR: A Multi-Turn Benchmark for Realistic Constraint Following

    May 7, 2026Beatriz Canaverde, Duarte M. Alves, José Pombal +2InstructionInstruction-Tuned Models

  34. Linear Semantic Segmentation for Low-Resource Spoken Dialects

    May 7, 2026Kirill Chirkunov, Younes Samih, Abed Alhakim Freihat +1DialectsArabic

  35. Multimodal LLMs are not all you need for Pediatric Speech Language Pathology

    Apr 29, 2026Darren Fürst, Sebastian Steindl, Ulrich SchäferSpeech Language ModelsDysarthric Speech

  36. Domain-level metacognitive monitoring in frontier LLMs: A 33-model atlas

    Apr 21, 2026Jon-Paul CacioliMmlu-ProMulti-Turn Benchmark

  37. Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

    Apr 20, 2026Samuel G. Balter, Ethan Jerzak, Connor T. JerzakMultimodal Large Language ModelsModalities

  38. SciImpact: A Multi-Dimensional, Multi-Field Benchmark for Scientific Impact Prediction

    Apr 18, 2026Hangxiao Zhu, Yuyu Zhang, Ping Nie +1Scientific DiscoveryCitations

  39. Is This Edit Correct? A Multi-Dimensional Benchmark for Reasoning-Aware Image Editing

    Apr 16, 2026Yixuan Ding, Wei Huang, Ruijie Quan +2Image EditingEdit

  40. Local Constrained Bayesian Optimization

    Mar 9, 2026Jing Jingzhe, Fan Zheyi, Szu Hui Ng +1Bayesian OptimizationTrust Region

  41. Region-Specific Calibration Achieves Excellent Inter-Device Reliability for Smartphone Dermatology: A Multi-Device Benchmark on Korean Facial Skin

    Dec 26, 2025Sungwoo Kang, Jong-Kook KimSmartphone PhotographsDevice

  42. From Charts to Code: A Hierarchical Benchmark for Multimodal Models

    Oct 20, 2025Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu +8Image-To-Code GenerationChart