Validation

Momentum

39 papers in the last four weeks, up 457% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 191

All topics
CardsList
  1. Who Annotates in NLP? A Large-scale Assessment of Human Annotation Reporting between 2018 and 2025

    Jun 1, 2026Maria Kunilovskaya, Gagan Bhatia, Lisa Sophie Albertelli +10Human AnnotationsAnnotations

  2. Automated Essay Scoring and Language Certification: Assessing Generalizability, Agreement and Validity for French

    Jun 1, 2026Rodrigo Wilkens, Rémi Cardon, Vincent Folny +1Automated Essay ScoringMulti-Dimensional Evaluation

  3. Multi-Agent Conformal Prediction with Personalized Statistical Validity

    May 30, 2026Martin V. Vejling, Christophe A. N. Biscio, Adrien Mazoyer +2Online Conformal PredictionHeterogeneity

  4. Projectional Decoding: Towards Semantic-Aware LLM Generation

    May 28, 2026Boqi Chen, José Antonio Hernández López, Aren A. BabikianLarge Language Model GenerationDecoding

  5. Cross-modal characterization of infant cry: validation of a chest-surface accelerometer in extracting acoustic vocal function measures

    May 27, 2026Winko W. An, Saketh Sundar, Lisa Yankowitz +2Accelerometer DataVocalizations

  6. Auditable Climate Risk Intelligence from Fragmented ESG Data: Deterministic Orchestration and Imbalance-Aware Learning for Scope 1-3 Validation

    May 23, 2026Karan Sehgal, Khawar Naveed BhattiReproducibilityValidation

  7. Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

    May 22, 2026Zhimin Zhao, Zehao Wang, Abdul Ali Bangash +2Model EvaluationEngineering

  8. Valid and Expressive Copulas for Irregular Multivariate Time Series

    May 22, 2026Christian Klötergens, Tom Hanika, Lars Schmidt-Thieme +1Gaussian CopulaMultivariate Time-Series

  9. Ontological Knowledge Blocks: Executable Compliance and Profile-Based Validation for Trustworthy AI Systems

    May 22, 2026Aasish Kumar Sharma, Julian M. KunkelGovernanceOntology

  10. Causal Machine Learning Is Not a Panacea: A Roadmap for Observational Causal Inference in Health

    May 20, 2026Donna Tjandra, Trenton Chang, Sonali Parbhoo +8Causal InferencesValidation

  11. Everywhere Valid Bounds on False Discovery Proportions in Conformal Inference

    May 20, 2026Ziang Song, Ying Jin, Emmanuel J. CandèsFalse Discovery RateConformal Inference

  12. Generative-Evaluative Agreement: A Necessary Validity Criterion for LLM-Enabled Adaptive Assessment

    May 19, 2026Grandee Lee, Yue Wang, Che Yee Lye +1Computerized Adaptive TestingRubrics

  13. Validate Your Authority: Benchmarking LLMs on Multi-Label Precedent Treatment Classification

    May 17, 2026M. Mikail Demir, M. Abdullah CanbazLegal Reasoning TasksMulti-Label Classification

  14. Practical Validity Conditions for Byzantine-Tolerant Federated Learning

    May 15, 2026Mélanie Cambus, Darya Melnyk, Tijana Milentijević +1Byzantine AttacksLog-Ratio-Based Gaussian Trust Weight

  15. Position: Early-Stage Quality Assurance in Annotation Pipelines Is More Cost-Effective Than Late-Stage Validation

    May 15, 2026Sunil Kothari, Sumukha Sharma Thoppanahalli Chandramouli, Naman Khandelwal +8Data QualityAnnotations

  16. Autonomous Intelligent Agents for Natural-Language-Driven Web Execution with Integrated Security Assurance

    May 14, 2026Vinil Pasupuleti, Siva Rama Krishna Varma Bayyavarapu, Shrey TyagiPenetration TestingBrowser Agent

  17. VERA-MH: Validation of Ethical and Responsible AI in Mental Health

    May 13, 2026Luca Belli, Kate H. Bentley, Josh Gieringer +6ChatbotsMental Health

  18. Incentivizing Truthfulness and Collaborative Fairness in Bayesian Learning

    May 12, 2026Rachael Hwee Ling Sim, Jue Fan, Xiao Tian +3Algorithmic FairnessIncentives

  19. Large Language Models for Causal Relations Extraction in Social Media: A Validation Framework for Disaster Intelligence

    May 12, 2026Ujun Jeong, Saketh Vishnubhatla, Bohan Jiang +3Disaster ResponseSocial Media

  20. Rethinking external validation for the target population: Capturing patient-level similarity with a generative model

    May 11, 2026Mohammad Azizmalayeri, Ameen Abu-Hanna, Saskia Houterman +2Cross ValidationValidation

  21. Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents

    May 7, 2026Hailey Onweller, Elias Lumer, Austin Huber +3CitationsGeneration Provenance

  22. Forecasting Green Skill Demand in the Automotive Industry: Evidence from Online Job Postings

    May 6, 2026Sabur Butt, Joshua N. Arrazola E., Hector G. Ceballos +1JobsSustainability

  23. External Validation of Deep Learning Models for BI-RADS Breast Density Prediction from Ultrasound Images

    May 6, 2026Yuxuan Chen, Arianna Bunnell, Yanqi Xu +4MammographyArea Under The Receiver Operating Characteristic Curve

  24. Practical validation of synthetic pre-crash scenarios

    May 6, 2026Jian Wu, Ulrich Sander, Carol Flannagan +1Two-Sample TestingValidation

  25. Conformalized Percentile Interval: Finite Sample Validity and Improved Conditional Performance

    May 4, 2026Ran Zou, Wanrong Zhu, Bin NanConditional DistributionFinite-Sample

  26. Static Analysis of Recursive SHACL

    May 4, 2026Anouk Oudshoorn, Magdalena Ortiz, Mantas SimkusShapes Constraint LanguageTractability

  27. Reliability-Oriented Multilingual Orthopedic Diagnosis: A Domain-Adaptive Modeling and a Conceptual Validation Framework

    May 4, 2026Danish Ali, Li Xiaojian, Sundas Iqbal +1Multilingual Healthcare Q&ALarge Language Model Adaptation

  28. Principles and Guidelines for Randomized Controlled Trials in AI Evaluation

    May 3, 2026Christopher Kelly, Angelica Chowdhury, Alexandra Campili +5Artificial Intelligence EvaluationControlled Study

  29. CP-SynC: Multi-Agent Zero-Shot Constraint Modeling in MiniZinc with Synthesized Checkers

    May 3, 2026Yuliang Song, Eldan CohenConstraint SatisfactionChess

  30. Operating-Layer Controls for Onchain Language-Model Agents Under Real Capital

    Apr 28, 2026T. J. Barton, Chris Constantakis, Patti Hauseman +4Large Language Model AgentsValidation

  31. Validation of Whole-Slide Foundation Models for Image Retrieval in TCGA Data

    Apr 28, 2026Tianhao Lei, Parsa Esmaeilkhani, Saghir Alfasly +5Whole-Slide ImagesDigital Pathology

  32. Defective Task Descriptions in LLM-Based Code Generation: Detection and Analysis

    Apr 27, 2026Amal Akli, Mike Papadakis, Maxime Cordy +1Code GenerationLarge Language Model Generation

  33. Measuring Successful Cooperation in Human-AI Teamwork: Development and Validation of the Perceived Cooperativity and Teaming Perception Scales

    Apr 27, 2026Christiane Attig, Christiane Wiebel-Herboth, Patricia Wollstadt +3Human-Ai CollaborationCooperation

  34. Progressive Approximation in Deep Residual Networks: Theory and Validation

    Apr 27, 2026Wei Wang, Xiao-Yong Wei, Qing LiResidual NetworksDeep Learning

  35. Quantum Knowledge Graph: Modeling Context-Dependent Triplet Validity

    Apr 27, 2026Yao Wang, Zixu Geng, Jun YanKnowledge GraphsRdf

  36. An AI-Based Supervisory Measurement Integrity Validation Layer for Cyber-Resilient AC/DC Protection in Inverter-Based Microgrids

    Apr 26, 2026Ahmad Mohammad Saber, Ahmed Saber Refae, Davor Svetinovic +4Distributed Energy ResourcesVoltage

  37. An Integrated Framework for Explainable, Fair, and Observable Hospital Readmission Prediction: Development and Validation on MIMIC-IV

    Apr 24, 2026Isaac Tosin AdisaReadmission PredictionRoc-Auc

  38. PrismaDV: Automated Task-Aware Data Unit Test Generation

    Apr 23, 2026Hao Chen, Arnab Phani, Sebastian SchelterTest GenerationData Science Agents

  39. Evaluating Patient Safety Risks in Generative AI: Development and Validation of a FMECA Framework for Generated Clinical Content

    Apr 23, 2026Lydie Bednarczyk, Jamil Zaghir, Julien Ehrsam +11Large Language Model SafetySummarization

  40. Early-Stage Product Line Validation Using LLMs: A Study on Semi-Formal Blueprint Analysis

    Apr 22, 2026Viet-Man Le, Thi Ngoc Trang Tran, Sebastian Lubos +2Validation

  41. Aether: Network Validation Using Agentic AI and Digital Twin

    Apr 20, 2026Jordan Auge, Sam Betts, Giovanna Carofiglio +3Optical NetworksDigital Twins

  42. Design and Validation of a Low-Cost Smartphone Based Fluorescence Detection Platform Compared with Conventional Microplate Readers

    Apr 16, 2026Zhendong Cao, Katrina G. Salvante, Ash Parameswaran +2MicroscopySmartphone Photographs

  43. Multi-Perspective LLM Annotations for Valid Analyses in Subjective Tasks

    Mar 22, 2026Navya Mehrotra, Adam Visokay, Kristina GligorićLarge Language Model AnnotationsHuman Annotations

  44. LLM-as-a-judge validity in physics assessment depends more on the task than the model

    Mar 16, 2026Will Yeadon, Tom Hardy, Paul Mackay +1Llm-As-A-JudgeValidation

  45. Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

    Mar 12, 2026Mei Chee Leong, Ying Gu, Hui Li Tan +2Multimodal Large Language ModelsValidation