Scoring

Momentum

10 papers in the last four weeks, up 25% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 71

All topics
CardsList
  1. Scoring Higher, Answering Worse: Mitigating Reward Hacking in Rubric-Based RL via Protocol-Level Rubrics

    Sep 30, 2026Maoqi Liu, Junwei He, Bowen Zhang +5RubricsScoring

  2. Text2Sim: Agentic Physics-Based Simulation Generation with Distilled Expertise

    Sep 29, 2026Xiaoyu Xiong, Tsun-Hsuan Wang, Yi-Ling Qiao +2Physics SimulationAgentic

  3. When the Score Becomes the Target: Rethinking Metric Validity in Autonomous Driving

    Sep 28, 2026Morui Zhu, Deyuan Qu, Qi Chen +2Autonomous DrivingScoring

  4. Can LLMs Catch a Rigged Backtest? A Clean-Control Calibration Benchmark

    Sep 23, 2026Makar Ulesov, Vladislav Smirnov, Omar Ibrahim +1Model AuditingCode Quality

  5. MORSE: Multi-Context Ordering via Reverse Scoring for Evidence-Preserving Compression

    Sep 23, 2026Ke Wan, Yifan Wang, Liheng Lai +1Data Compression MethodsBounded-Memory

  6. You Should Be Properly Scoring Your Odometry

    Sep 22, 2026Ola Rønning, Usama Saqib, Andrzej WąsowskiOdometryRobust Lidar-Inertial Odometry

  7. How Calibration Content Shapes Attention-Based Reranking

    Sep 15, 2026Petros Karypis, Hossein Rajaby Faghihi, Peter Chen +4Cross-Encoder RerankingRelevance

  8. The Answer Path and the Grounding Instruction in LLM Question Answering over Knowledge Graphs

    Sep 9, 2026Arquimedes CanedoKnowledge GraphsSparql

  9. GLASS: Graph-Language Alignment with Spherical Scoring for Transferable Graph-Level Anomaly Detection

    Sep 4, 2026Xudong Wang, Chris Ding, Tongxin Li +1Generalist Graph Anomaly DetectionMotion-Language Alignment

  10. Designing Versatile Samples for Learned Trajectory Scoring

    Sep 1, 2026Yaguang Li, Jiaru Zhang, Chuheng Wei +2Trajectory GenerationClassical Planning

  11. A Unified Uncertainty-Aware Back-End for Speaker Verification: Scoring, Normalization, and Calibration

    Sep 1, 2026Junjie Li, Kong Aik LeeAutomatic Speaker VerificationSpeaker

  12. Retrieval, Scoring, and Decoding Shape Performance and Stability in LLM-based Conversational Recommendation

    Aug 31, 2026Ante Kapetanovic, Tomislav Duricic, Andro Mercep +1Cross-Encoder RerankingRecommendation

  13. Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation

    Aug 30, 2026Nishant Balepur, Paiheng Xu, Wei Ai +3Multiple-Choice QuestionsScoring

  14. When Do Supervised UQ Ensembles Improve LLM Hallucination Detection? A Robustness Study

    Aug 25, 2026Mohit Singh Chauhan, Vipin Gyanchandani, Dylan BouchardLarge Language Model HallucinationHallucination Detection

  15. Personalized Scorer Modeling: A Learning-Based Framework for Deriving Robust Sleep Stage Labels from Multiple Experts

    Aug 12, 2026Seyyed Ali Hoseini, Javad Baseri, Hamid Saadatfar +2SleepScoring

  16. Structure-Enhanced Features and Quality-Aware Dynamic Anchor Scoring for Robust Lane Detection

    Aug 10, 2026Weize Cai, Yongqi Dong, Zhida Shao +2Unsupervised DetectionFeature Extraction

  17. Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias

    Aug 3, 2026Baicheng Lin, Lingxi Jin, Kyung-Seok MinRubric-Based ScoringScoring

  18. LOCUS-DT: Localization via Observation-Conditioned Uncertainty Scoring with Digital Twins

    Aug 1, 2026Haozhe Lei, Roberto Bomfin, Marwa Chafii +1Indoor LocalizationDigital Twins

  19. CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation

    Jul 31, 2026Mengting Chen, Yanshu Sun, Wanting Liang +5Task-Specific RubricsRubrics

  20. ICLE++: Modeling Fine-Grained Traits for Holistic Essay Scoring

    Jul 30, 2026Shengjie Li, Vincent NgAutomated Essay ScoringScoring

  21. Learning Color Grading, No Photo Sharing: Federated Aesthetic Preference Learning for Personalized Image Enhancement

    Jul 30, 2026Chuanzhi Xu, Ziyuan Tao, Jean Julien KNell +5Image EnhancementFedavg

  22. PhaseAware: Interpretable Human-in-the-Loop Rehabilitation Scoring with Boundary Monitoring

    Jul 22, 2026Yankai Zheng, Yuhe Liu, Yuxin Ma +8RehabilitationMultimodal Evaluation

  23. Self-supervised Speech Comparison for L2 Phone, Rhythm, and Intonation Scoring

    Jul 15, 2026Stephen McIntosh, Reuben Smit, Daisuke Saito +2Grapheme-To-PhonemeProsody

  24. Q-Score: A Quantum-Native Scoring Function for Molecular Docking

    Jul 2, 2026Kangyu Zheng, Yidong Zhou, Ruihao Li +3Quantum ChemistryQuantum Approximate Optimization Algorithm

  25. Role-Aware Neural Convex Divergence Heads for Asymmetric Representation Learning

    Jul 2, 2026He Huang, Lu Shen, Yunfeng Huang +1DivergenceEntailment

  26. Scoring Is Not Enough: Addressing Gaps in Utility-fairness Trade-offs for Ranking

    Jun 24, 2026Shubham Singh, Ian A. Kash, Mesrob I. OhannessianAlgorithmic FairnessScoring

  27. PsyScore: A Psychometrically-Aware Framework for Trait-Adaptive Essay Scoring and ZPD-Scaffolded Feedback

    Jun 18, 2026Wei Xia, Jin Wu, Haoran Shi +2Automated Essay ScoringScoring

  28. Confusion-Aware Transfer Teacher Curriculum Learning Framework: Disentangling Scoring and Pacing Effects

    Jun 16, 2026Savini Kommalage, Sanka Mohottala, Asiri Gawesha +5Adaptive CurriculumCurriculum

  29. Test-Time Trajectory Optimization for Autonomous Driving

    Jun 5, 2026Yihong Xu, Eloi Zablocki, Yuan Yin +4Autonomous DrivingRobust Trajectory

  30. Auditing Demonstration Curation Metrics: Action-Only Scorers Fail on the Structural Defects That Degrade Imitation Policies

    Jun 4, 2026Aarav BediBehavior CloningDefect

  31. AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making

    Jun 2, 2026Sangwon Baek, Kyu Yeon Hur, Kyunga KimRaterArtificial Intelligence Evaluation

  32. What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs

    Jun 1, 2026Abhishek Aich, Sparsh Garg, Vijay Kumar BG +2Ava-VlmSlices

  33. Beyond Agreement: Scoring Panel-Surfaced Biomedical Entity Candidates for Curator Triage

    May 29, 2026Shuheng Cao, Ruiqi Chen, Renjie Cao +3Medical OntologyNamed-Entity Recognition

  34. Prompt-Level Reward Specifications for Open-Ended Post-Training

    May 28, 2026Zijun Weng, Xiaohui Hu, Shuangyong Song +3Post-TrainingOffline Reinforcement Learning

  35. Learnable Assessment Skills for LLM-based Automated Scoring: Rubric Construction via Iterative Optimization

    May 28, 2026Yun Wang, Xin Xia, Xuansheng Wu +2Rubric-Based ScoringTask-Specific Rubrics

  36. Proper Scoring Rules for Agentic Uncertainty Quantification

    May 23, 2026Suresh Raghu, Satwik Pandey, Shashwat PandeyUncertainty ScoreScoring

  37. Ontology-constrained multi-LLM scoring of hypothesis support in the predictive processing literature

    May 23, 2026Hamed Nejat, Alexander Maier, Jesse Spencer-Smith +1Predictive CodingHypothesis

  38. Trajectory-Based Difficulty Scoring for Reliable Learning on Tabular Data

    May 23, 2026Tomer Lavi, Bracha Shapira, Nadav RappoportTabular DataEnsemble

  39. CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning

    May 14, 2026Sining Ang, Yuguang Yang, Canyu Chen +1Autonomous NavigationScoring

  40. Multi-Dimensional Model Integrity and Responsibility Assessment Index and Scoring Framework

    May 14, 2026Phuc Truong Loc Nguyen, Thanh Hung Do, Truong Thanh Hung Nguyen +1Tabular LearningScoring

  41. CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution

    May 13, 2026Tom ZehlePrompt OptimizationScoring

  42. Concordia: Self-Improving Synthetic Tables for Federated LLMs

    May 11, 2026Jimin Huang, Duanyu Feng, Nuo Chen +8Federated LearningLarge Language Model Adaptation

  43. Mental Health AI Safety Claims Must Preserve Temporal Evidence

    May 9, 2026Srimonti Dutta, Ratna KandalaArtificial Intelligence SafetySafety Claims

  44. Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

    May 7, 2026Yuan Wang, Ouxiang Li, Yulong Xu +8Generative Video ModelsScoring