Diagnostic Benchmark

Momentum

9 papers in the last four weeks, down 18% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 116

All topics
CardsList
  1. MS-Exam-Gen: Source-Grounded Benchmark Construction for Evaluating LLMs on Textual Multiple Sclerosis MRI Knowledge

    Oct 5, 2026Abdul Basit, Muhammad Abdullah Hanif, Muhammad ShafiqueMultiple SclerosisDiagnostic Benchmark

  2. R-GroundBench: A Diagnostic Benchmark for R-Group Groundingin Markush Molecular Editing

    Sep 30, 2026Xin Wang, Zichuan Ying, Xinna Lin +8Chemical StructuresMoleculenet

  3. KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy

    Sep 29, 2026Xueting Fang, Zehui Li, Yang Yang +5Clinician TrustDiagnostic Benchmark

  4. Beyond Legibility: Benchmarking Visual Text Rendering and In-Place Editing in Unified Video Generation

    Sep 29, 2026Ziying Zhang, Litao Li, Junchao Liao +4Text-To-Video Generation ModelFew-Shot Font Generation

  5. AgentHop: A Diagnostic Benchmark for Agentic Multi-Hop Scientific Question Answering

    Sep 28, 2026Chanhee Park, Jeongho Yoon, Sungbin Han +2Agentic BenchmarksDiagnostic Benchmark

  6. PhysAlign: A Benchmark for Evidence-Grounded Role Alignment in Multimodal Physics Reasoning

    Sep 27, 2026Kecheng Liang, Haoyang Liu, Zexin Chen +5DiagramsMultimodal Reasoning

  7. LegendBench: A Diagnostic Benchmark for Legend Understanding with Counterfactual Interventions

    Sep 21, 2026Xinnuo Zhang, Zhike Tang, Jing Xu +2ChartDiagnostic Benchmark

  8. Same Words, Different Actions: Paired Turn-Taking Evaluation under Rewritten Dialogue Contexts

    Sep 15, 2026Shuofeng Zhao, Hongwei Cai, Wenke Fan +9Turn-TakingDialogue Benchmarks

  9. MedRoundsQA: A Persona and Difficulty Aware Evaluation for Multi-Turn Medical Consultations

    Sep 14, 2026Youssef Mohamed, Ahmed Heakl, Qinrong Cui +13Diagnostic Benchmark

  10. ExBind: A Controlled Diagnostic Benchmark for Visual-to-Executable Correspondence

    Sep 1, 2026Ziqian Wang, Yuxiao Cheng, Tingxiong Xiao +1Diagnostic Benchmark

  11. Reliable Benchmarking of Artifact Detection in Computational Pathology: A Reproducibility and Uncertainty Analysis

    Aug 31, 2026Konstantinos Moutselos, Ilias MaglogiannisWhole-Slide ImagesComputational Pathology

  12. Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence

    Aug 13, 2026Jakub Pokrywka, Łukasz Grzybowski, Antoni Lasik +3Medical Visual Question AnsweringMultiple-Choice Visual Question Answering

  13. Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

    Aug 12, 2026Weihao Bo, Shan Zhang, Yanpeng Sun +7DiagramsDiagnostic Benchmark

  14. Chartography: A Benchmark for Professional Chart Understanding

    Aug 11, 2026Suhaas Garre, Chris Mutty, Sushant Mehta +1ChartDiagnostic Benchmark

  15. FormStruct-Bench:A Hierarchical and Diagnostic Benchmark for Table-Form Document Structure Recognition

    Aug 11, 2026Lujie Ban, Jiangtao Zhu, Yuanheng Yu +2Structured ContextDocument

  16. From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing

    Aug 10, 2026Jutao Xiao, Yuan Qu, Dongsheng Ma +7Document ParsingTabular Data

  17. VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

    Aug 10, 2026Jiajun Xu, Yanghao Zhou, Jingyun Liao +6Long-Video BenchmarksVibe Coding

  18. Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities

    Aug 9, 2026Harish Kashyap, Kiran Byadarhaly, Sriram Chakaravarthy +2DiagramsDiagnostic Benchmark

  19. TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

    Aug 9, 2026Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da QuachLeaf Disease ClassificationTomato Diseases

  20. PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

    Aug 9, 2026Dongjie Xu, Julius, Hanchi Dong +6Large Language Model EvaluationDiagnostic Benchmark

  21. DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction

    Aug 4, 2026Xuyang Liu, Yibin Han, Zhenwei Zhang +8Diagnostic Benchmark

  22. WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

    Aug 3, 2026Yuxue Yang, Shuyao Shang, Jiahe Wang +13Video World ModelsWorld Models

  23. AcoustiTrace: When Plausible Sound Violates Physics

    Aug 3, 2026Shiyang Li, Yuewen Cao, Yihao Liu +4Audio-Video GenerationAcoustic

  24. TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

    Aug 1, 2026Jin Zhang, Linyu Li, Weili Jiang +7Multilingual Healthcare Q&AClinical Reasoning Training

  25. Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification

    Jul 29, 2026Linyu Li, Zhi Jin, Yichi Zhang +6Reasoning BenchmarkDiagnostic Benchmark

  26. Polistemics: Evaluating LLMs as Information Mediators in Politics & Elections

    Jul 28, 2026Baran Peters, Gabor Hollbeck, Robert Jakob +1Political DiscourseEpistemic State Replication

  27. PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

    Jul 28, 2026Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou +11PatientsDiagnostic Benchmark

  28. When Does Deep Representation Learning Help Single-Cell Clustering? A Sensitivity-Aware Diagnostic Benchmark for Biomedical AI Pipelines

    Jul 28, 2026Nguyen Thanh Phong, Truong Viet Vu, Nguyen Ha Thu +4Single-Cell RnaClustering

  29. ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

    Jul 27, 2026Ali Ansari, Yasmin Mohammadi, Farnoush Nili +3DiagramsSchema

  30. GraphRareBench: An Auditable Graph-Evidence Benchmark for Phenotype-Driven Rare-Disease Diagnosis

    Jul 27, 2026Guiling Guo, Jia Yang, Jiahao Xu +3Rare DiseaseBiomedical Knowledge Graph

  31. LA-RL: Label-Aware Self-Reflection for Reinforcement Learning in Information Extraction

    Jul 26, 2026Xiao You, Tianwei Yan, Zixu Shan +2Information ExtractionRelation Extraction

  32. CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

    Jul 23, 2026Hanseok Oh, Parishad BehnamGhader, Benno Krojer +4Knowledge-Based Visual Question AnsweringDiagnostic Benchmark

  33. PhenSPINE: A Standardized Benchmark for Spine Pathology Diagnosis

    Jul 22, 2026Duong Ngoc Vu, Hai Son Nguyen, Trong-Nghia Nguyen +4Magnetic Resonance Imaging DatasetMulti Organ Computed Tomography Segmentation

  34. PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

    Jul 21, 2026Dankai Liao, Tianyi Zhang, Yufeng Wu +6Whole-Slide ImagesPathology Foundation Models

  35. PathReportEval: A Systematic Benchmark for Pathology Report Generation

    Jul 20, 2026Suryakant Singh, Sejuti Majumder, Beatrice Knudsen +2ReportDiagnostic Benchmark

  36. VEHBench: A Stage-Local Diagnostic Benchmark for LLM-Assisted Vibration Energy Harvester Design

    Jul 20, 2026Depeng Su, Yuyu Luo, Guobiao HuLarge Language Models(LlmsDiagnostic Benchmark

  37. Measuring and Improving Complex-Atomic Answer Consistency in Endoscopic VQA

    Jul 20, 2026Yuhao Liu, Cheng Zhao, Guanghui YueColonoscopyDiagnostic Benchmark

  38. Can Multimodal Large Language Models Understand OCT?

    Jul 18, 2026Baochen Fu, Wenzhi Deng, Baihao Jin +5Optical Coherence TomographyMultimodal Benchmarks

  39. MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection

    Jul 16, 2026Goktug OzkanArtificial Intelligence SafetyClinician Trust

  40. Capabilities of Claude Fable 5 on Biomedical Challenge Problems

    Jul 12, 2026Dominic Okonkwo, Magnus Hodgson, Temitope I. David +1Biomedical TextDiagnostic Benchmark

  41. MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

    Jul 9, 2026Hantao Zhang, Jinru Sui, Ed Li +2Multi-View3D Scene Understanding

  42. HamQASBench: A Hamiltonian-Informed Diagnostic Benchmark for Evaluating Quantum Architecture Search

    Jul 6, 2026Jiayang Niu, Akib Karim, Yan Wang +5Diagnostic BenchmarkMoleculenet

  43. MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

    Jul 3, 2026Hanwen Wang, Sihan Liang, Zhiwei Liu +4Materials ScienceDiagnostic Benchmark

  44. MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding

    Jul 2, 2026Yuan Wang, Shujian Gao, Songtao Jiang +2Medical Visual Question AnsweringDiagnostic Benchmark

  45. PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

    Jul 1, 2026Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi +1MemoryagentbenchScientific Agents

  46. SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation

    Jun 29, 2026Filippo Ruffini, Marco Salmé, Rosa Sicilia +2Radiology Report GenerationMedical Vision-Language Models

  47. Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

    Jun 26, 2026Hohin Kwan, Hongyu Li, Ray Zhang +5Visual EvidenceMultimodal Large Language Models

  48. EHR-Complex: Benchmarking Medical Agents for Complex Clinical Reasoning

    Jun 22, 2026Yitong Qiao, Lei Liu, Yue Shen +4Clinical Reasoning TrainingElectronic Health Records

  49. WeGenBench: A Multidimensional Diagnostic Benchmark towards Text-to-Image Model Optimization

    Jun 18, 2026Qian Liang, Xiaomin Li, Ying Zhang +6Modern Text-To-Image ModelsText-To-Image

  50. Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis

    Jun 17, 2026Hong-Tao Yu, Chen-Wei Xie, Yuxin Peng +2Fine-Grained PerceptionMultimodal Benchmarks

  51. ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

    Jun 16, 2026Hong Yang, Basura FernandoEmbodied Artificial IntelligenceDiagnostic Benchmark