Scores

Momentum

23 papers in the last four weeks, up 92% on the four weeks before. 0.3% of all new papers.

Jul 6Week of Sep 21

Latest papers 94

All topics
CardsList
  1. VIEScore2: Unified Image Evaluation with Spatially Grounded Explanations

    Oct 1, 2026Xianda Du, Max Ku, Weiming Ren +5Multi-Image Editing BenchmarksSynthetic Image Detection

  2. Score the Update, Not the Token: Descent-Aligned Routing for Combinatorial LoRA Experts

    Sep 30, 2026Priya Nair, Lukas Brenner, Maya Lindqvist +5ExpertsMulti--Task Learning

  3. GA-EIRFS: A Geometry-Augmented Repeat-Factor Sampling Method for Long-Tailed LiDAR 3D Object Detection

    Sep 29, 2026Taufiq Ahmed, Constantino Álvarez Casado, Daniel Herrera Castro +33D Object DetectionObject Detection

  4. Think Before You Score: Thinking Reward Model for Visual Generation

    Sep 29, 2026Xuehai Bai, Zhenchen Tang, Yang Shi +9Progress Reward ModelingVisual Generation

  5. From Scores to Samples: Elastic Forcing for Autoregressive Video Generation

    Sep 28, 2026Chi Zhang, Yueyi Liu, Shi Haoyang +5Autoregressive Video GenerationDistribution Matching Distillation

  6. When the Score Becomes the Target: Rethinking Metric Validity in Autonomous Driving

    Sep 28, 2026Morui Zhu, Deyuan Qu, Qi Chen +2Autonomous DrivingScoring

  7. Concept Score Relearning: A Unified Cross-Architecture Attack on Concept Erasure

    Sep 27, 2026Hong Xi Tae, Jiaming Zhang, Wenwen He +2Concept ErasureText-To-Image Diffusion Models

  8. Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding

    Sep 23, 2026Fan Zhang, Yankai Chen, Zhuohan Xie +11ContractsLanguage Model Computes

  9. Auditing Proxy-Based Validation Across Text Spans

    Sep 22, 2026Daein Weon, Dong Ho KangValidationScores

  10. Can Vision-Language Models Judge Olympic Diving? From Reasoning to Scores in Zero-Shot Action Quality Assessment

    Sep 16, 2026Henry O. Velesaca, David Freire-Obregon, Luigi Miranda +1AthleticismOpen-Vocabulary Action Recognition

  11. I code or AI code: A comparative evaluation of AI-rated scores in classroom observations

    Sep 16, 2026Y. Fong, J. Xiang, T. Y. D. Chan +2ClassroomsComputerized Adaptive Testing

  12. Split Conformal Prediction with Label-Shift-Adjusted Bayesian Scores

    Sep 14, 2026Hyeonsu Lee, Juyeon Kim, Erkhembayar Jadamba +2Nonconformity ScoresOnline Conformal Prediction

  13. Generalized Score Matching for Parameter Estimation on Convex Domains

    Sep 11, 2026Nishanth Shetty, Saisuchith Mahajan, Chandra Sekhar SeelamantulaMaximum LikelihoodUncertainty Score

  14. Scored vs. Generated Readouts in Behavioral Language Models: An Empirical Study of Elicitation Format

    Sep 9, 2026Touchapon Kraisingkorn, Krittin Pachtrachai, Wachiravit ModecruaFree-Form Textual RationalesReadout

  15. From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection

    Sep 8, 2026Mengzhe Geng, Yujia Lu, Manuela Kunz +1SpeakerDestination-Only Scoring

  16. API Benchmark Scores Do Not Reliably Transfer to Chatbot Interfaces

    Sep 8, 2026Jennifer Wang, Joachim Baumann, Daniel E. Ho +1Application Programming InterfacesScores

  17. zScore-N: A Neural Network for On-Chain Wallet Reputation Scoring

    Sep 8, 2026Girish G N, Ashutosh Sahoo, Akshay SP +2ReputationScores

  18. Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents

    Sep 7, 2026Jingjie Ning, Shanshan Zhong, Xiaochuan Li +1Model AuditingArtificial Intelligence Research

  19. SHELF: A Synthetic Harness for Multi-Task Bibliographic Benchmarking

    Sep 2, 2026Michael J. BommaritoLarge Language Model EvaluationTerm Frequency-Inverse Document Frequency

  20. Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of Tokens

    Sep 1, 2026Matteo He, William F. Shen, Xinchi Qiu +1ReadoutLogit Lens

  21. Verdict Instability of OOD Scores under Reference Resampling

    Sep 1, 2026Donghoon Lee, Shinjin KangVerdictScores

  22. Can LLMs Take the Pulse of the Economy? A Real-Time Evaluation of LLM Nowcasts on Macroeconomic Indicators

    Aug 31, 2026Xinyue Zhao, Ruiyi Zhang, Liqin Ye +3Large Language Model ForecastingLarge Language Model Evaluation

  23. Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation

    Aug 30, 2026Nishant Balepur, Paiheng Xu, Wei Ai +3Multiple-Choice QuestionsScoring

  24. QuoteBench: How Matched Scores Can Hide Command-Path Failures

    Aug 13, 2026Shangao Li, Yao Zhang, Volker Tresp +1ScoresFinance Benchmarks

  25. Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

    Aug 13, 2026Yiwei Li, Wanli Yang, Hexiang Tan +10Long-Horizon AgentsAutonomous Agents

  26. CAS: A Causal Attribution Score for Local and Global Explainable Artificial Intelligence

    Aug 12, 2026Michael Georgiades, Charalambia VarnavaShapley Additive ExplanationsShapley Value

  27. LookBack: Where and How to Score LVLM Responses via Visual Reference Usage

    Aug 12, 2026Beomsik Cho, Jinhyeong Kim, Dongseok Lee +1Citation HallucinationResponses

  28. Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents

    Aug 11, 2026Sourabrata Mukherjee, Kalika Bali, Sunayana SitaramMultilingual AgentsConstrained Decoding

  29. TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

    Aug 9, 2026Yidong Wang, Yan Zhan, Ziteng Feng +16Progress Reward ModelingReward Functions

  30. Support Selection Beyond Smooth DAG Exactness: Completion Geometry,Score Margins, and Selective Certificates

    Aug 8, 2026Rui Wu, Zongyuan Chen, Hong XieDirected Acyclic GraphCertificates

  31. From Non-Convex Self-Concordant Regularization to Scalable Quasi-Newton Training of PINNs

    Aug 4, 2026Chenhao Si, Kang An, Shiqian Ma +1Parametric Physics-Informed Neural NetworkNewton

  32. Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores

    Aug 4, 2026Zeyu Zhang, Bradly C. StadieMemorizationValidation

  33. ScoreField: Neural Inverse Scattering with Score-Based Generative Priors

    Aug 3, 2026Wenhan Guo, Yuan Gao, Yu SunBayesian Inverse ProblemsNeural Fields

  34. ScoreShield: Differentially Private Release of Similarity Scores

    Jul 27, 2026Behrooz Razeghi, Parsa RahimiΔ)$-Differential PrivacyMembership Inference Attacks

  35. From Score Approximation to Distribution Approximation in Score-Based Diffusion Models

    Jul 24, 2026Lan V. TruongScore-Based Diffusion ModelDiffusion Models

  36. Generative Video Compression with Adaptive Score Distillation

    Jul 24, 2026Naifu Xue, Zhaoyang Jia, Haosen Li +7Video CompressionData Compression Methods

  37. Interventional Score Geometry for Causal Inference

    Jul 24, 2026Mojtaba EslamiCausal InferencesScores

  38. CODA: Cascaded Online Discontinuity-Aware Alignment for Real-Time Image-Based Score Following

    Jul 24, 2026Yining Yang, Ruogu Chen, Jie HanScoresReal-Time Systems

  39. Mean-to-Score Discrete Diffusion: Posterior-Mean Denoisers for Score Entropy

    Jul 23, 2026Jingyuan Li, Xiaoyi Jiang, Yixuan Jiang +4Score-Based Diffusion ModelUncertainty Score

  40. From a Word-Level Dictionary to Sentence-Level Semantics: Multilingual Grievance Labelling with Contextual Models

    Jul 23, 2026Lin Tian, Marian-Andrei RizoiuLinguisticsMultilingual

  41. The Tractability Landscape of Sampling with Inexact Scores

    Jul 21, 2026Anming Gu, Kevin Tian, Hubert Yang +1Optimal Sample ComplexityIndependent-Pool Single-Draw Oracle

  42. Dense-Sparse Dynamic Time Warping for Customizing Piano Concerto Accompaniments

    Jul 20, 2026TJ Tsai, Kavi Dey, Yigitcan Ozer +1AccompanimentInstrument

  43. Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

    Jul 20, 2026Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly +2Coding AgentsReasoning Skills

  44. Is One Score Enough? Assessing Singing Quality of Songs with Temporal Score Curves

    Jul 18, 2026Yishan Lv, Jing Luo, Xinyu Yang +1Scores

  45. Bayesian Experimental Design via Score Matching

    Jul 9, 2026Angus Phillips, Gavin Kerrigan, Tom RainforthBayesian Experimental DesignBayesian Neural Networks

  46. A Large-Scale Sparse Multiobjective Optimization Algorithm Based on Optimal Performance Scores

    Jul 6, 2026Jia-Lin Mai, Min-Rong Chen, Guo-Qiang Zeng +2Multi-Objective OptimizationScores

  47. Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks

    Jul 2, 2026Jihan Yao, Gantavya Bhatt, Arnav Das +16Large Language Model BenchmarksGeometry-Aware Uncertainty Coresets

  48. Quantifying the Uncertainty of Blindly Estimated Room Embeddings Using a Dispersion-Calibrated Score

    Jul 1, 2026Yang Xiang, Philipp Götz, Emanuël A. P. Habets +3Discrete Speech RepresentationsUncertainty

  49. Laplace-Fisher Gate Identities for Optimal Matrix-Gated Blended Score Estimation

    Jun 23, 2026Alois Duston, Tan Bui-ThanhUncertainty ScoreBayesian Inverse Problems

  50. Null-Calibrated Conformal Selection via Target-Membership Scores

    Jun 21, 2026Seungjin ChoiNonconformity ScoresConformal Selection