Validation

Momentum

39 papers in the last four weeks, up 457% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 191

All topics
CardsList
  1. A rubric landscape for evaluating clinical reasoning in large language models: what exists, what is missing, and what needs to be combined

    Oct 1, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoClinical Reasoning TrainingLLM Reasoning Strategies

  2. Scientific Discovery under Validation Congestion via Multi-Fidelity Pairwise Rankings

    Oct 1, 2026Kevin Tirta Wijaya, Alston Lo, Michael Sun +2Drug DiscoveryScientific Discovery

  3. Model validation in machine learning: A scenario-based guide from hold-out splits to nested group cross-validation in biomedical and applied research

    Oct 1, 2026Mehmet Baygin, Sengul Dogan, Turker TuncerCross ValidationValidation

  4. The Price of Correlated Tests: How Strict Should a Model Release Gate Be?

    Oct 1, 2026Marco PollanenReleaseGating

  5. Reliability-Aware Checkpoint Selection for Domain Generalization

    Sep 30, 2026Jinshi Liu, Jiahao Li, Pan Liu +5Multimodal Domain GeneralizationModel Checkpoints

  6. Hard-Gate Candidacy in a Deployed Validator Suite

    Sep 30, 2026Xin XuGatingValidation

  7. VACE: Validation-Gated Alternating Co-Evolution of Agent Models and Harnesses

    Sep 29, 2026Jiexing Qi, Yu He, Jun Liu +9Language-Model AgentsCo-Evolution

  8. WitnessGym: Benchmarking Coding Agents on the Construction of Bug Witnesses

    Sep 29, 2026Haomin Qi, Xiangzhe Xu, Yiming Huang +2BugCoding Agents

  9. Design and Validation of an Antagonistic Tendon-Driven Dexterous Robotic Hand with Bidirectional Operation

    Sep 28, 2026Chunghyeon Lee, Hyukjun Kwon, Sungeon Kim +2Robotic HandsBimanual Manipulation

  10. When Valid Tool Calls Change Meaning: Formation-Consistent Dispatch for LLM Agents

    Sep 28, 2026Geonwoo Kim, Brent ByungHoon KangAgentic DeploymentsCall

  11. When Is an SAE Feature Interpretable? A Validation Ladder for EEG Foundation Models

    Sep 28, 2026Yucong Cao, Chenqi Li, Tingting ZhuElectroencephalography Foundation ModelsSparse Autoencoder Features

  12. Large Language Models for Structured Clinical Data Analysis: Dual-Agent Grounding and Validation

    Sep 28, 2026Erfan D. Dehkalani, Seetha Shankaran, Abbot R. Laptook +3Data Science AgentsValidation

  13. Artificial Societies Benchmark: A Validation Framework for Synthetic Research

    Sep 24, 2026Edoardo Chidichimo, Min Jun Jung, Felix P. S. Wallis +1SurveyValidation

  14. Human-AI-Powered Hypothesis Testing: Cost-Aware Selective AI Scoring and Sequential Human Escalation

    Sep 24, 2026Dae Woong, Ham, Xuejun Zhao +2Artificial Intelligence EvaluationEscalation

  15. Consequential Behaviour and Representational Fairness in the Validation of Synthetic Research

    Sep 23, 2026Florian Kutzner, Celina Kacperski, Laura de Molière +4ValidationSurvey

  16. Receptiveness, Not Sycophancy: Distinguishing Engagement from Deference in Language Models

    Sep 22, 2026Calvin Isley, Johann Gaebler, Max Lamparth +2SycophancyConversational Context

  17. A Practical Guide on Graphical Model Validation

    Sep 22, 2026Mario V. WüthrichActuarial RatemakingProbabilistic Graphical Models

  18. Auditing Proxy-Based Validation Across Text Spans

    Sep 22, 2026Daein Weon, Dong Ho KangValidationScores

  19. SSP-Bench: A Hybrid Data Generation Framework for Safety, Security, and Privacy Evaluation

    Sep 21, 2026Fatih Deniz, Yazan Boshmaf, Issa KhalilSecurityValidation

  20. Prediction-Powered Smoothing and Validation for Disaggregated AI Evaluation

    Sep 17, 2026Sho Kawano, Zehang Richard Li, Paul A. ParkerArtificial Intelligence EvaluationConfidence Intervals

  21. GraphSkillAA: Attribution-Guided Skill-Graph Updating with Targeted Validation and Rollback

    Sep 17, 2026Ziqiao Shang, Ling-Yue Ge, Lan-Zhe GuoUnsupervised Skill DiscoveryFrozen Language Model

  22. FCA-Guided Counterfactual Explanations for Multi-Modal Breast Cancer Diagnosis: A Framework Achieving Perfect Validity with Emergent Sparsity

    Sep 17, 2026Abdullahi Isa, Souley Boukari, Muhammad AliyuCancer DetectionCounterfactual Explanation

  23. Reproducibility is not construct validity: LLM measurement of institutionally situated communication

    Sep 17, 2026Veronika Batzdorfer, Carlo Romano Marcello Alessandro SantagiustinaInter-Annotator AgreementLarge Language Model Evaluation

  24. The segmentation ceiling: why explicit left-ventricular masks do not improve learned ejection-fraction regression

    Sep 17, 2026Farshid Farhadi Khouzani, Paul La Plante, Bryar Mustafa Shareef +1Left-Ventricular Ejection FractionCeiling

  25. VAST: V2X/Dynamic Map-Aware Autonomous Driving Systems Validation Toolchain

    Sep 17, 2026Shunsuke Ito, Takuya AzumiV2XAutomated Vehicles

  26. PESTO: Formally Correct Registration of LiDAR Point Clouds with Limited Overlap

    Sep 16, 2026Valen Yamamoto, Matteo Marchi, Paulo TabuadaLight Detection And Ranging Point CloudsPoint Clouds

  27. Beyond Measurement Metrics: A Human-Centered Framework for Semantic Validation of Network Traffic Classification

    Sep 15, 2026Igor Cherepanov, David Sessler, Alex Ulmer +2ExplainabilityTraffic

  28. Can We Trust the Judges? Validation of Factuality Evaluation Methods via Answer Perturbation

    Sep 14, 2026Sarra Gharsallah, Adele Robaldo, Mariia Tokareva +5JudgesValidation

  29. Turkish MMLU Pro: Traceable Option Augmentation and Its Validity Limits in Turkish Multiple-Choice Evaluation

    Sep 14, 2026M. Ali BayramMultiple-Choice QuestionsMmlu-Pro

  30. Autonomous Chemical Mechanistic Discovery through Agentic Reasoning and Validation

    Sep 12, 2026Dong Li, Sixuan Mi, Zihao Ye +10ReactionResearch Automation

  31. When Validation Stops Learning: Auditing Update Admission for Continual Embodied Agents

    Sep 12, 2026Qinzhen Ma, Ruihai WuAdmissibilityReplay-Based Continual Learning

  32. CHOIR: heterogeneity-aware conformal prediction for crash injury severity across driver safety strata

    Sep 10, 2026Amir Rafe, Subasish DasCertificationCrashes

  33. AXON: A ROS 2 RMW with Shared-Memory/QUIC Transport and QKD/ML-KEM Key Establishment

    Sep 9, 2026Sergio Sánchez de la Fuente, Miguel Ángel González-Santamarta, Francisco Javier Rodríguez-Lera +2Robot Operating SystemPost-Quantum Cryptography

  34. API Benchmark Scores Do Not Reliably Transfer to Chatbot Interfaces

    Sep 8, 2026Jennifer Wang, Joachim Baumann, Daniel E. Ho +1Application Programming InterfacesScores

  35. Validating DBpedia Triple Sets for Natural Language Generation

    Sep 7, 2026Mark Andrade, Simon Mille, Anya Belz +1RdfNatural Language

  36. Fresh Memory, Stale Plans: Derivation Currency for Distributed LLM-Agent Memory

    Sep 3, 2026Evan Chen, Shiqiang Wang, Christopher G. BrintonGradient StalenessPeak Memory

  37. Design and Validation of a Lightweight, Low-Profile Powered Knee Prosthesis with Quasi-Direct Drive Actuation

    Sep 2, 2026Ross J. Cortino, Ryan Posh, Emily G. Keller +1FeetSoft Pneumatic Actuators

  38. Fi-ImageNet-1k: An OOD Benchmark From the Inside of the ImageNet-1k Validation Set

    Sep 1, 2026Ruslan Rozumnyi, Matěj Suchánek, Tomáš Vojíř +2Out-Of-Distribution DetectionImagenet

  39. Spending Scarce Confirmatory PET Measurements: Target-Aligned Validation in A4/LEARN

    Aug 23, 2026Eliuvish Han Cui, Qiang Yang, Meredith Mengmeng ZhangPositron Emission TomographyValidation

  40. Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

    Aug 13, 2026Junhao Luo, Ning Huang, Ziqi Sha +2Evaluation ProtocolsModel Auditing

  41. When Do Task Vectors Interfere? Mapping the Validity Boundaries of Weight-Space Composition

    Aug 10, 2026Chencheng Zhu, Xiaoyang Li, Taotao CaiWeight-SpaceTask-Level

  42. Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing

    Aug 9, 2026Minhan Cho, Jimin KweonLLM Reasoning StrategiesValidation

  43. Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production

    Aug 9, 2026Cong Ming, Jingyi Chen, Bin Liu +4GuardrailLarge Language Model Safety

  44. Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores

    Aug 4, 2026Zeyu Zhang, Bradly C. StadieMemorizationValidation

  45. FastGFDs: Efficient Validation of Graph Functional Dependencies with Desbordante

    Aug 3, 2026Anton Chernikov, Yurii Litvinov, Kirill Smirnov +1SubgraphsProfiling

  46. Beyond Component Testing: Validating Agentic AI Systems

    Jul 31, 2026Fabio Orazio Mirto, Luca D'Agati, Giuseppe Tricomi +4Production Agentic SystemsModel-Based Multi-Agent Systems

  47. Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?

    Jul 30, 2026Xiaonan Xu, Wenjing WuAutomated Program RepairBug

  48. Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

    Jul 30, 2026Phuc Pham, Truong-Son HyBioinformaticsAgentic Workflows

  49. Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription

    Jul 29, 2026Ting-Kai Hsu, Wei-Chin Wang, Kai-Xi Hong +1Multi-Instrument Music TranscriptionTranscription

  50. VaLiDRec: Variable-Length LLM-Aligned Semantic IDs for Generative Recommendation

    Jul 28, 2026Shutong Qiao, Wei Yuan, Tong Chen +3Sequential RecommendationRecommendation

  51. RIDGE: An Autonomous Framework for Validation and Method Discovery in LLM-Generated Option Pricing

    Jul 28, 2026Liexin Cheng, Xue Cheng, Shuaiqiang Liu +1Mathematical FinanceValidation