Multi-Dimensional Evaluation

Momentum

15 papers in the last four weeks, up 88% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 113

All topics
CardsList
  1. Towards Trustworthy AI for Glioma Diagnosis: A Task-Aware Evaluation of Uncertainty Quantification

    Sep 30, 2026Gonzalo Esteban Mosquera Rojas, Sebastian R. van der Voort, Carolin M. Pirkl +3GliomaBrain Tumor Classification

  2. Breaking the Illusion of Review Reliability under Static Evaluation: SCOPE Fuzzing for LLM-based Scientific Reviewers

    Sep 29, 2026Zhuo Chen, Hao Zeng, Jiawei Liu +6Peer ReviewFuzzing

  3. Recommendation Ranking Off-Policy Evaluation under Ranking-Dependent Examination via Examination-Relevance Decomposition

    Sep 28, 2026Riki Okamura, Toshiharu SugawaraPolicy EvaluationRanking

  4. Unmasking Shortcut Learning in IoT Intrusion Detection: A Forensic, Multi-Paradigm Evaluation of Feature Dependence and Data Leakage

    Sep 23, 2026Uday Shankar Roy, Mahbuba Jahan MinuIntrusion DetectionInternet Of Thing

  5. From Offline Proxies to Online Decisions: A Layered Engagement Evaluation Framework for Conversational AI

    Sep 21, 2026Xuanyi Li, Vaskar Nath, Hossein Amirkhani +2AnalyticsConversational Artificial Intelligence

  6. Beyond EER: Multi-Dimensional Evaluation of Information Leakage in Speaker De-Identification

    Sep 16, 2026Seungmin Seo, Oleg Aulov, P. Jonathon Phillips +2De-IdentificationSpeaker

  7. Beyond Pixel Similarity: Task-Aware Evaluation of GAN-Based Synthetic Sonar Data for Robotic Perception

    Sep 16, 2026Hannan Ejaz Keen, Muhammad Moazam Fraz, Karsten BernsSynthetic Image DetectionForward-Looking Sonar

  8. Rubric-Aligned Disentangled Evaluation of Human Simultaneous Interpreting

    Sep 11, 2026Ziyu Zhang, Satoshi NakamuraInter-Annotator AgreementMulti-Dimensional Evaluation

  9. Grounded Evaluation and Repair for NL-to-PDDL Problem Generation

    Sep 9, 2026Joana Rosa, Pedro Santos, Valdemar Oliveira +3Large Language Model PlanningLarge Language Model Generation

  10. Navigating the digital spectrum: Assessing political bias, stability, and downstream fairness in Large Language Models

    Sep 8, 2026Luka Debevc, Nishan Chatterjee, Antoine Doucet +2Large Language Model BiasHate Speech Detection

  11. Mind the Gap: Robustness Risks in PII Detection Systems

    Sep 3, 2026Adeel Zafar, Slawomir NowaczykRealistic Threat ModelNamed-Entity Recognition

  12. Ten Architectures, One Error: Shared Failure Modes in Hyperspectral Classification under Spatially Disjoint Evaluation

    Sep 1, 2026Ehsan Faghih, Fatemeh Ashrafi, Marguerite Moore +1Hyperspectral ImageImage Classification

  13. TaxCE : A Framework for Automated Taxonomy Construction and Evaluation at Scale

    Aug 31, 2026Sandeep Sricharan Mukku, Albert Aristotle Nanda, Rohit PyatiTaxonomyTopic Modeling

  14. ARAC: Benchmarking Auto-Research's Alignment and Completeness on End-to-End Researchs

    Aug 13, 2026Jiale Cui, Yueyao Yuan, Kaixi Zhong +3Research AutomationAuto Research

  15. HexEval: An Evidence-Driven Hexagonal Framework for Multidimensional Scholar Assessment

    Aug 11, 2026Xiaokang Qu, Yiting LinAssessmentMulti-Dimensional Evaluation

  16. VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

    Aug 10, 2026Jiajun Xu, Yanghao Zhou, Jingyun Liao +6Long-Video BenchmarksVibe Coding

  17. How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots

    Aug 7, 2026Eric Nichols, Alva Markelius, Hatice GunesMulti-Dimensional EvaluationSafety Benchmarks

  18. Unmasking Removal-Budget Confounding: A Matched Operating-Point Evaluation Framework for Adaptive Data Cleaning

    Aug 6, 2026Wei-Hsiang Chen, Pin-Hsuan Yu, Chen-Hsuan Fang +1Adversarial CorruptionClear

  19. Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding

    Aug 6, 2026Ming Wang, Yuqing Zhang, Tingna Xie +5CreativityLarge Language Model Decoding

  20. OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents

    Aug 6, 2026Xinying Cai, Minghao Guo, Jiahe Liu +7Portfolio ConstructionMulti-Dimensional Evaluation

  21. OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing

    Aug 5, 2026Chenxuan Miao, Yutong Feng, Yi Lu +6Video EditingMulti-Dimensional Evaluation

  22. Paired Recipient-based Evaluation of Survival Prediction for Deceased Donor Kidney Transplants

    Aug 4, 2026Misaki Matsuura, Mohammadreza Nemati, Dulat Bekbolsynov +2Chronic Kidney DiseaseSurvival Predictions

  23. Coarse-to-Fine Registration of Jawbone CT and Intraoral Scan Data Using GeDi and ICP with Pseudo-IOS Ground Truth

    Aug 3, 2026Sho Mitarai, Hikaru Kayo, Hisashi Ozaki +2Intraoral ScansImage Registration

  24. MonitrLLM: A Community-Centered Evaluation Infrastructure for Large Language Models

    Aug 3, 2026Victor Ojewale, Ro Encarnación, Suresh Venkatasubramanian +1Large Language Model EvaluationMulti-Dimensional Evaluation

  25. CraftAlign: Feature-Grounded Evaluation and Revision Guidance for AI Stories

    Aug 2, 2026Yang Yang, Boyun Xu, Shaofeng Liang +5Value AlignmentMulti-Dimensional Evaluation

  26. Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

    Jul 31, 2026Yingmao Miao, Pengfei Zhang, Xiaochen Lv +5Image EditingMulti-Reference Image Generation

  27. A corrective agentic hybrid RAG and an operations-grounded evaluation for a scientific facility

    Jul 27, 2026Rajat Sainju, Dariusz Jarosz, Hairong Shang +5Hievi-RagAgentic Retrieval-Augmented Generation Systems

  28. Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets

    Jul 27, 2026Zongyou Yang, Yinghan HouMulti-Dimensional EvaluationMath Problems

  29. CSPF: A Constrained Shared-Private Fusion Method for Non-Verifiable Preference Evaluation

    Jul 23, 2026Hehao Zhang, Danli Wang, Xinyuan Wang +1Preference Alignment LearningMulti-Dimensional Evaluation

  30. A Multi-Dimensional Evaluation of Explainability in Media Bias Detection

    Jul 22, 2026Ting Chen, Raina Zhang, Benjamin M. Ampel +1ExplainabilityMulti-Dimensional Evaluation

  31. Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

    Jul 20, 2026Pin Qian, Su Wang, Yihang Chen +5Agentic BenchmarksPersonalized Large Language Model Agents

  32. JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

    Jul 20, 2026Qingjia Huang, Jingyu Zhang, Jianguo Wu +6Large Language Model JailbreaksJailbreak Attacks

  33. A Formally Grounded ODRL Evaluator: Implementation and Comparison

    Jul 17, 2026Jaime Osvaldo Salas, Paolo Pareti, Adeel Aslam +2Policy EvaluationMulti-Dimensional Evaluation

  34. How Well Does AI-Generated Feedback Work? Intrinsic and Extrinsic Evaluation across more than 20,000 EFL Essay Drafts

    Jul 16, 2026Steven Coyne, Diana Galvan-Sosa, Ryan Spring +4Automated Essay ScoringFeedback

  35. AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities

    Jul 15, 2026Kai Chen, Zichen Ding, Jiaye Ge +20Agentic EvaluationsMulti-Dimensional Evaluation

  36. HEDGEHOG: Hierarchical Evaluation of Drug Generators Through Rigorous Filtration

    Jul 14, 2026Daria A. Ryabchenko, Pavel Gurevich, Shamil Kadyrov +5Molecular GenerationDrug Discovery

  37. Prior-matched evaluation of operational Earth-observation classifiers: a three-number reporting method demonstrated on Sentinel-1 internal-wave detection

    Jul 8, 2026João Pinelo, João Gonçalves, Arun Shukla +1ClassifierReport

  38. CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion

    Jul 6, 2026Adam Fisch, Daniel Deutsch, Joshua Maynez +5Model EvaluationMulti-Dimensional Evaluation

  39. A Failure-Mode Benchmark for Polymorphic Sybil Poisoning in RAG

    Jul 4, 2026Donghyun Lee, Juntae KimPoisoningQuestion-Answering Benchmarks

  40. RCT: A Robot-Collected Touch-Vision-Language Dataset for Tactile Generalization

    Jun 30, 2026Jingbo He, Michael Färber, Roberto CalandraTactileLarge-Scale Robot Demonstration Datasets

  41. A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models

    Jun 27, 2026Nuo Chen, Lulin Liu, Zihao Li +12Physics SimulationCollision Prediction

  42. Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

    Jun 25, 2026Sangwoo Cho, Kushal Chawla, Pengshan Cai +4Large Language Model EvaluationEvaluation Agent

  43. Measuring Research Difficulty of Academic Papers: A Case Study in Natural Language Processing

    Jun 24, 2026Haochuan Li, Jingyuan Li, Yi Zhao +4Multi-Dimensional EvaluationNatural Language Processing

  44. Uncertainty-based Debiasing and Unlearning for Decontamination

    Jun 22, 2026Guangzhi Sun, Xiao Zhan, Mark GalesLarge Language Model UnlearningDebiasing

  45. Can LLMs Control Readability? A Multi-Dimensional Evaluation Framework for CEFR-Controlled Arabic Generation

    Jun 20, 2026Nour Rabih, Chatrine Qwaider, Ted BriscoeArabic Natural Language ProcessingReadability

  46. Prompt, Plan, Extract: Zero-Shot Agentic LLMs Workflows for Lung Pathology Extraction from Clinical Narratives

    Jun 18, 2026Aman Pathak, Cheng Peng, Mengxian Lyu +8Clinical NotesLarge Language Model Pipelines

  47. X+Slides: Benchmarking Audience-Conditioned Slide Generation

    Jun 17, 2026Haodong Chen, Xuanhe Zhou, Wei Zhou +6Multi-Dimensional EvaluationSessions

  48. AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows

    Jun 16, 2026Jiahui Niu, Huizi Yu, Wenkong Wang +11Large Language Model EvaluationReal-World Clinical Workflows