Assessment

Momentum

13 papers in the last four weeks, up 117% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 77

All topics
CardsList
  1. Beyond Decodability: Do Acoustic Factors Drive Predictions in Speech-Based Alzheimer's Assessment?

    Oct 1, 2026Serli Kopar, Alkis Koudounas, Roshan P. Rane +3AcousticAlzheimer

  2. CredWise: A Controlled Agentic Decision-Intelligence Framework for Explainable and Auditable Credit-Risk Assessment

    Sep 29, 2026Aakash Kumar TiwariCredit Risk PredictionStep-Level Credit

  3. Recommendation Ranking Off-Policy Evaluation under Ranking-Dependent Examination via Examination-Relevance Decomposition

    Sep 28, 2026Riki Okamura, Toshiharu SugawaraPolicy EvaluationRanking

  4. RLE-Bench: A Qualifying Exam for Coding Agents as Robot Learning Engineers

    Sep 28, 2026Haitong Ma, Chenxiao Gao, Rushi Qiang +2Coding AgentsRobot Systems

  5. Designing and Analysing Argument Mining Pipelines: Towards a Comprehensive Assessment

    Sep 22, 2026Siddharth Bhargava, Sara Tonelli, Patricia Martín-RodillaArgumentation FrameworksNatural Language Processing

  6. E-AVI: Evidence-Grounded Multimodal Assessment for Automated Video Interviews

    Sep 17, 2026Haoshen Wang, Dongbo Che, Zeyi Xie +3Multimodal EvaluationFine-Grained Video Understanding

  7. Scientific Image Quality Assessment via Multi-modal Retrieval-Augmented Generation

    Sep 17, 2026Yinuo Zhang, Bingshuo Liu, Zhiying Tu +6Image Quality AssessmentMultimodal Retrieval Augmented Generation

  8. Assessment of Non-Institutional AI Tool Usage Among Clinicians

    Sep 14, 2026Sarah Pungitore, Jarrod MosierClinical Decision SupportClinical

  9. Prism-SQA: An Interpretable and Adaptable Neural Framework for Surface Electromyography Quality Assessment

    Sep 11, 2026Kuan-Chen Wang, Kai-Chun Liu, Ping-Cheng Yeh +2Surface ElectromyographyPhysiological Data

  10. Analyzing Traditional and Neural Approaches to Multilingual Readability Assessment

    Sep 11, 2026Joshua Wong, Chris TannerReadabilityTransformer Architectures

  11. SurgSkill-Bench: A Benchmark for Multimodal Surgical Skill Assessment

    Aug 31, 2026Chaohui Dang, Zheheng Jiang, James Glasbey +3SurgeryMultimodal Evaluation

  12. Ideation Arena: Evaluating LLM Generated Research Ideas with Battle-style Human Expert Assessment

    Aug 30, 2026Zhiyu Chen, Keyu Zhao, Jigao Fu +8Scientific IdeationAssessment

  13. CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

    Aug 13, 2026Nhan Phan, Ilona Lähteenmäki, Anna von Zansen +4Speech EncoderAssessment

  14. Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence

    Aug 13, 2026Jakub Pokrywka, Łukasz Grzybowski, Antoni Lasik +3Medical Visual Question AnsweringMultiple-Choice Visual Question Answering

  15. HexEval: An Evidence-Driven Hexagonal Framework for Multidimensional Scholar Assessment

    Aug 11, 2026Xiaokang Qu, Yiting LinAssessmentMulti-Dimensional Evaluation

  16. Accurate but Natural? Diagnosing Grammatical and Idiomatic Gaps in Japanese EFL Writing

    Aug 10, 2026Steve Woollaston, Brendan Flanagan, Hiroaki OgataGrammaticalityIdiom

  17. Action- and Language-Conditioned Video Assessment for Embodied Control

    Aug 8, 2026Hwanhee Kim, Jaehyun Jang, Seungmin Cha +3FeedbackAssessment

  18. SetEasy: A Multi-Modal Classroom Engagement Assessment and Seating Optimization Framework

    Aug 7, 2026Zhihao Xie, Hongye Yang, Shien LiuClassroomsData-Driven

  19. SciQNet: Two-Stage Multimodal Adaptation for Scientific Image Quality Assessment

    Aug 6, 2026Yin-Loon Khor, Yi-Jie Wong, Jing Jie Tan +1Image Quality AssessmentMultimodal Evaluation

  20. Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets

    Aug 2, 2026Wenhui Chen, Jianlin Chen, Ziyao Lin +2OmissionsAssessment

  21. AI-Based Thesis Assessment: An Empirical Study of Human Evaluation Priorities and Their Impact on Automated Assessment

    Aug 1, 2026Garv Vikram Gursahaney, Baskhad Idrisov, Thorsten Fröhlich +1Peer ReviewArtificial Intelligence Evaluation

  22. The MADRS Pipeline: Supporting Depression Assessment in Clinical Trials

    Jul 30, 2026Mila Fodor, Katalin Ócsai, Francesco Periti +2DepressionMental Health

  23. Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset

    Jul 29, 2026Mayank Sharma, Savira Nadela, Tyler MattesonFrontier ModelsAssessment

  24. Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

    Jul 28, 2026Wenjie Zhou, Yunting Liu, Renjiao Tang +1Psychometric PropertiesCognitive Diagnosis

  25. Assessment in Team Problem-Solving Exercises in Computing Education

    Jul 21, 2026Valdemar Švábenský, Jan Vykopal, Sukrit Leelaluk +3Computerized Adaptive TestingComputer Science

  26. Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs

    Jul 21, 2026Harry Rogers, Sally Shiels, Ashley Tomlinson +5Reference-Guided Multimodal In-Context VerificationClinician Trust

  27. An Exam for Active Observers

    Jul 17, 2026Jiarui Zhang, Muzi Tao, Shangshang Wang +3Recent Vision-Language ModelsMultimodal Large Language Models

  28. WrAFT: a Modularized Automated Writing Evaluation System for Argumentative Essays

    Jul 16, 2026Adnan Labib, Yixuan Huang, Jiahui Wu +3Automated Essay ScoringWriting

  29. Optimization Is Not All You Need

    Jul 13, 2026Minh Hua, Rita RaleyPrompt OptimizationCounter Turing Test

  30. i-EXAM: Instructable and Explainable Attack Connectivity Graph Modeler

    Jul 7, 2026Rakesh Podder, Wadia Ganim, Sarath Sreedharan +2Security EvaluationDiverse Hardening Strategies

  31. Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach

    Jul 2, 2026Manuel Alonso-Carracedo, Ruben Fernandez-Boullon, Pedro Celard +2GradingAssessment

  32. Attacking UTMOS: Probing the Robustness of a Speech Quality Assessment Model

    Jun 30, 2026Wen-Chin Huang, Tomoki TodaSpeakerAssessment

  33. DNA Language Models: An Assessment of Pre-Training for Fine-Tuning Tasks

    Jun 29, 2026Romain Karpinsky, Julien Mozziconacci, Mickaël DelceyGenerative Pretrained TransformersTransformer Architectures

  34. LLM-Based Examination of Eligibility Criteria from Securities Prospectuses at the German Central Bank

    Jun 25, 2026Serhii Hamotskyi, Akash Kumar Gautam, Christian HänigLarge Language Model PipelinesGerman

  35. LLM Performance on a Real, Double-Marked GCSE Benchmark

    Jun 23, 2026Malachy Fox, Kavi Samra, Paul JungGradingAssessment

  36. What Does a Pathological Speech Assessment Model Know about Acoustic Features? A Case Study on Oral and Oropharyngeal Cancer Patients

    Jun 23, 2026Tuan Nguyen, Corinne Fredouille, Alain Ghio +2Wav2VecDysarthric Speech

  37. AgentCAT: Simulating Computerized Adaptive Testing via Multi-Agent Large Language Models

    Jun 20, 2026Weiyuan Zhou, Haiping Ma, Xiaoshan Yu +3Computerized Adaptive TestingAssessment

  38. Towards Dys-XAI: Influence-Based Explanations for Dysarthria Severity Assessment

    Jun 19, 2026Xiaoliang Wu, Qiyang Sun, Yupei Li +3ExplainabilityXai

  39. Mitigating Scoring Errors and Compensating for Nonverbal Subtests in Speech-Based Dementia Assessment

    Jun 17, 2026Franziska Braun, Christopher Witzl, Andreas Erzigkeit +4Dysarthric SpeechSeed-Tts-Eval Benchmark

  40. Mental-R1: Aligning LLM Reasoning for Mental Health Assessment

    Jun 11, 2026Xin Wang, Boyan Gao, Yibo Yang +1Mental HealthLLM Reasoning Strategies

  41. Event-Aligned Analysis of Multi-Rater Pain Assessments Using Continuous Wearable Physiology

    Jun 11, 2026Saba A. Farahani, Elahe Khatibi, Thomas D. Hughes +3Wearable PhysiologyRater

  42. Reassessing High-Performing LLMs on Polish Medical Exams: True Competence or Bias-Driven Performance?

    Jun 10, 2026Antoni Lasik, Jakub Pokrywka, Łukasz Grzybowski +7Diagnostic BenchmarkMultiple-Choice Questions

  43. On the Limits of LLM-as-Judge for Scientific Novelty Assessment

    Jun 10, 2026Soumitra Sinhahajari, Navonil Majumder, Soujanya PoriaScientific IdeationLlm-As-A-Judge

  44. Towards Fully Automated Exam Grading: Fairness-Aware Recognition of Handwritten Answers with Foundation Models

    Jun 9, 2026Hartwig GrabowskiGradingHandwriting

  45. A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales

    Jun 8, 2026Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini +1Speech Language ModelsProficiency

  46. Hybrid E-Assessment in Higher Education: Semi-Automated Grading of Paper-Based Written Examinations

    Jun 7, 2026Hartwig Grabowski, Michael CanzComputerized Adaptive TestingAssessment

  47. Extending Responsibility-Sensitive Safety for the Assessment of Offloaded Autonomous Driving Services

    Jun 5, 2026Robin Dehler, Aryan Thakur, Michael BuchholzAutonomous DrivingOffloading

  48. Agents' Last Exam

    Jun 3, 2026Yiyou Sun, Xinyang Han, Weichen Zhang +307Artificial Intelligence AgentsAssessment

  49. Optimizing Latent Representations for Robust Building Damage Assessment Onboard Earth Observation Satellites

    May 28, 2026Thomas Goudemant, Benjamin FrancesconiPost-Disaster Damage AssessmentAssessment

  50. The Cases LJP Never Sees: Prosecution Decision Prediction for More Complete Criminal Liability Assessment

    May 27, 2026Junyu Lu, Qi Wei, Peishuo Zheng +6MljaildeAssessment

  51. LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?

    May 26, 2026Xiaohan Wang, Mingze Yin, Yilin Zhao +2Computerized Adaptive TestingLarge-Scale Benchmark

  52. A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays

    May 25, 2026Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot +1Llm-As-A-JudgeLarge Language Model Judges