Grading

Momentum

6 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 59

All topics
CardsList
  1. Better Deck or Different Judge? Evaluating Agentic Harness Gains in Corporate and Investment Banking

    Sep 30, 2026Ludovic Gibert, Matis Despujols, Andre-Louis RochetGradingLarge Language Model Judges

  2. Multi-task learning for the automatic grading of enlarged perivascular space burden using MRI

    Sep 29, 2026Jesse Phitidis, William N. Whiteley, Joanna M. Wardlaw +11Vessel SegmentationMagnetic Resonance Imaging

  3. Where LLM Graders Succeed and Break: Evidence from Two Computer-Science Exams

    Sep 24, 2026Ali Habibullah, Yazan Alshoibi, Mohammad Alshiekh +2GradingComputer Vision

  4. Jointly Predicting Courses and Grades Using a Transformer-Based Model

    Aug 13, 2026Paul SavalaForecasting BackboneSequence Modeling

  5. Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing

    Aug 9, 2026Minhan Cho, Jimin KweonLLM Reasoning StrategiesValidation

  6. WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader

    Aug 6, 2026Boshui Chen, Huiping Liu, Shaolei ZhangWebGrading

  7. RADAR: Rubric-Aware Dependency and Redundancy Analysis for LLM-as-Judge Evaluation

    Aug 3, 2026Divyansh Singh, Reza Davari, Afra MashhadiLlm-As-A-JudgeGrading

  8. The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations

    Jul 31, 2026Ilya MikhelsonComputerized Adaptive TestingSocratic Dialogue

  9. GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

    Jul 27, 2026Jiacheng Lu, Sinuo Wang, Wentao Zhao +12Finance BenchmarksGrading

  10. CrossSpine: Multi-scale Cross-sequence Attention with Anatomical Priors for Automated Pfirrmann Grading

    Jul 22, 2026Hai Son Nguyen, Duong Ngoc Vu, Trong-Nghia Nguyen +5Anatomical PriorsMulti-Scale Attention

  11. Measuring Reward-Seeking via Contrastive Belief Updates

    Jul 21, 2026Axel Højmark, Jérémy Scheurer, Evgenia Nitishinskaya +5Progress Reward ModelingReward Signal

  12. Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations

    Jul 14, 2026Monica Munnangi, Saiph SavageStudent MisconceptionsLarge Language Models Fail

  13. Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

    Jul 14, 2026Xing Zhang, Guanghui Wang, Yanwei Cui +4Agentic EvaluationsEvaluation Metrics

  14. Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

    Jul 9, 2026Ethan Leung, Elias Lumer, Corey Feld +3Large Language Model JudgesCitations

  15. Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach

    Jul 2, 2026Manuel Alonso-Carracedo, Ruben Fernandez-Boullon, Pedro Celard +2GradingAssessment

  16. Clinical Risk-Aware Multi-Level Grading for Coronary Artery Stenosis through Curved Feature Reconstruction

    Jun 29, 2026Shishuang Zhao, Hongtai Li, Junjie Hou +1Geometric ReconstructionCurves

  17. The strength of clinical evidence is recoverable from language model representations but not from their stated grades

    Jun 27, 2026Soroosh Tayebi ArastehLarge Language Model ReliabilityEvidence Conflict

  18. Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System

    Jun 23, 2026Tian Zheng, Kai-Tai HsuGradingData Science Agents

  19. LLM Performance on a Real, Double-Marked GCSE Benchmark

    Jun 23, 2026Malachy Fox, Kavi Samra, Paul JungGradingAssessment

  20. Semantic Grading of Written Answers in Low-Resource Language Bangla Using a Fine-Tuned Lightweight Language Model

    Jun 10, 2026Meherun Farzana, Aniket Joarder, Mahmudul Hasan +1BanglaGrading

  21. Towards Fully Automated Exam Grading: Fairness-Aware Recognition of Handwritten Answers with Foundation Models

    Jun 9, 2026Hartwig GrabowskiGradingHandwriting

  22. A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales

    Jun 8, 2026Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini +1Speech Language ModelsProficiency

  23. Hybrid E-Assessment in Higher Education: Semi-Automated Grading of Paper-Based Written Examinations

    Jun 7, 2026Hartwig Grabowski, Michael CanzComputerized Adaptive TestingAssessment

  24. Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses

    Jun 7, 2026Qilin Zhou, Zhuo Wang, Yue Li +1GradingSoftware Engineering

  25. EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading

    Jun 4, 2026Zhihao Wu, Linhai Zhang, Taiyi Wang +4Grading

  26. LLMs as Teaching Assistants for Mathematics Exam Grading: Reliability, and Practical Usability

    Jun 1, 2026Aastha Sapkota, M. G. Sarwar MurshedGradingPreliminary Study

  27. BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

    May 27, 2026Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach +6Legal Reasoning TasksGerman

  28. From Kellgren-Lawrence to Calcium Pyrophosphate Crystal Deposition: A Soft-Labelling Framework for Knee Osteoarthritis Assessmen

    May 27, 2026Francisco Bérchez-Moreno, Riccardo Rosati, Maria Chiara Fiorentino +6SeverityChronic Kidney Disease

  29. GRADE: Generalizable Reasoning-Aware Dialogue Evaluation for AI Tutors

    May 27, 2026Parth Bhalerao, Jeromy Chang, David Chou +1TutorsGrading

  30. Machine learning applied to emerald gemstone grading: framework proposal and creation of a public dataset

    May 22, 2026FB Pena, D Crabi, Sandro C Izidoro +2Silver BulletGrading

  31. GradeLegal: Automated Grading for German Legal Cases

    May 20, 2026Abdullah Al Zubaer, Lorenz Wendlinger, Simon Alexander Nonn +2GradingLegal Reasoning Tasks

  32. LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation

    May 19, 2026Shanshan Xu, Johan Lindholm, Amogh Raina +2Legal Reasoning TasksLegal Domain

  33. Automated Grading of Handwritten Mathematics Using Vision-Capable LLMs

    May 18, 2026Jacob Levine, Miguel Aenlle, Craig Zilles +2GradingHandwriting

  34. High Precision Hydraulic Excavator Control for Heavy-Duty Grading

    May 10, 2026Lennart Werner, Pol Eyschen, Sean Costello +2Control ArchitecturePrecision

  35. Creating and Evaluating K-12 GenAI Assessment Graders Through Context Engineering

    May 8, 2026Zewei Tian, Alex Liu, Lief Esbenshade +6GradingGenerative Artificial Intelligence

  36. LaTA: A Drop-in, FERPA-Compliant Local-LLM Autograder for Upper-Division STEM Coursework

    May 6, 2026Jesse A. RodríguezGradingModifications

  37. Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?

    May 4, 2026Spandan Garg, Vikram Nitin, Yufan HuangGrading

  38. Estimating LLM Grading Ability and Response Difficulty in Automatic Short Answer Grading via Item Response Theory

    Apr 30, 2026Longwei Cong, Sonja Hahn, Sebastian Gombert +3GradingItem Response Theory

  39. Confidence Estimation in Automatic Short Answer Grading with LLMs

    Apr 30, 2026Longwei Cong, Sonja Hahn, Sebastian Gombert +3GradingConfidence Estimation

  40. Knee-xRAI: An Explainable AI Framework for Automatic Kellgren-Lawrence Grading of Knee Osteoarthritis

    Apr 25, 2026Azmul A. Irfan, Nur Ahmad Khatim, Alfan Alfian Irfan +3XaiDigitally Reconstructed Radiographs

  41. Controllable Spoken Dialogue Generation: An LLM-Driven Grading System for K-12 Non-Native English Learners

    Apr 24, 2026Haidong Yuan, Haokun Zhao, Wanshi Xu +4ProficiencyGrading

  42. REC-CBM: Rubric-Aware Error-Correction Concept Bottleneck Models for Trustworthy Open-Ended Grading

    Apr 24, 2026Chengshuai Zhao, Fan Zhang, Kumar Satvik Chaudhary +4GradingConcept Bottleneck Models

  43. GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing

    Mar 12, 2026Mingxin Liu, Ziqian Fan, Zhaokai Wang +13Image EditingGrading

  44. Am I More Pointwise or Pairwise? Revealing Position Bias in Rubric-Based LLM-as-a-Judge

    Feb 2, 2026Yuzheng Xu, Tosho Hirasawa, Tadashi Kozuno +1Llm-As-A-JudgeModel Judgments

  45. No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding

    Mar 7, 2025Michael Krumdick, Charles Lovering, Varshini Reddy +2Llm-As-A-JudgeGrading