Scientific Reproducibility

Latest papers 76

All topics
CardsList
  1. VERITAS: Towards a General-Purpose Replication Tool for Scientific Research

    Jul 3, 2026Haokun Liu, Filbert Aurelian Tjiaranata, Chenhao TanAI Coding AgentsScientific Reproducibility

  2. Coding-agents can replicate scientific machine learning papers

    Jul 2, 2026Atharva Hans, Ilias BilionisCoding AgentsLLM Agent Evaluation

  3. The Agentic Garden of Forking Paths

    Jul 1, 2026Jiacheng Miao, Jonathan K Pritchard, James ZouAI Agents for Scientific DiscoveryScientific Reproducibility

  4. Mitigating LLM-based p-Hacking by Preregistering for the Next LLM

    Jun 26, 2026Maria Thomas, Kristina Gligoric, Nihar B. ShahScientific Reproducibility

  5. Computational Analysis of Heart Rate Variability in Healthy Adults

    Jun 25, 2026María J. Lado, Arturo J. Méndez, Leandro Rodriguez-Liñares +4ElectrocardiographyScientific Reproducibility

  6. AI-Assisted Computational Reproducibility on the FABRIC Testbed

    Jun 24, 2026Komal Thareja, Paul Ruth, Berent Aldikacti +1AI Coding AgentsAI-Assisted Scientific Research

  7. Life After Benchmark Saturation: A Case Study of CORE-Bench

    Jun 23, 2026Nitya Nadgir, Sayash Kapoor, Kangheng Liu +11OOD GeneralizationAI Agent Evaluation

  8. PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation

    Jun 23, 2026Leyi Sheng, Han Sun, Zhen Sun +4AI Safety EvaluationMultimodal Jailbreak Attacks

  9. Making AI Scientists Auditable from Evidence to Claim

    Jun 17, 2026Zijian Wang, Hanqi Li, Ziyue Yang +17Data ProvenanceScientific Reproducibility

  10. ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

    Jun 16, 2026Shanda Li, Qiuhong Anna Wei, Jingwu Tang +5LLM Agent EvaluationAI Agent Benchmarks

  11. The Shift Toward Open and Reproducible AI Research

    Jun 15, 2026Kevin L Coakley, Thijs Snelleman, Holger Hoos +1ML ReproducibilityScientific Reproducibility

  12. Agentic Publication Protocol: An Attempt to Modernize Scientific Publication

    Jun 15, 2026Sirui Lu, Xiao-Liang QiAI-Assisted Scientific ResearchScientific Communication

  13. Automated reproducibility assessments in the social and behavioral sciences using large language models

    Jun 11, 2026Tobias Holtdirk, Pietro Marcolongo, Anna Steinberg Schulten +7AI-Assisted Scientific ResearchScientific Reproducibility

  14. AI Coding Agents Can Reproduce Social Science Findings

    Jun 9, 2026Meysam Alizadeh, Mohsen Mosleh, Fabrizio Gilardi +2AI Coding AgentsAI Agent Benchmarks

  15. Deterministic Integrity Gates for LLM-Assisted Clinical Manuscript Preparation: An Auditable Biomedical Informatics Architecture

    Jun 8, 2026Yoojin Nam, Jinhoon Jeong, Namkug KimLLM Answer VerificationLLM Auditing

  16. Traxia: A Framework for Verifiable, Agent-Native Scientific Publishing

    Jun 6, 2026Wisdom DogahData ProvenanceScholarly Peer Review

  17. Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation

    Jun 6, 2026Katelyn Xiaoying Mei, Yi-Li Hsu, Minjoon Choi +5Human-in-the-Loop EvaluationScientific Reproducibility

  18. Cluster Analysis with Resampling for Validation and Exploration (CARVE)

    May 29, 2026Kai R. Wycik, Tiffany M. Tang, Tarek M. Zikry +1ClusteringScientific Reproducibility

  19. ERICA: Quantifying Replicability of Cluster Analysis

    May 29, 2026Siamak K. Sorooshyari, Manuel A. Rivas, Robert TibshiraniClusteringML Reproducibility

  20. Replicable Simulation-Based Robot Validation through Provenance

    May 28, 2026Argentina Ortega, Samuel Wiest, Frederik Pasch +1Data ProvenanceRobotics Simulation

  21. UniACE: A Unified Framework for Evaluating LLM Agentic Capabilities

    May 27, 2026Pengyu Zhu, Lijun Li, Yaxing Lyu +8LLM Agent EvaluationAI Agent Benchmarks

  22. ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence

    May 25, 2026Rui Meng, Bhavana Dalvi Mishra, Jiefeng Chen +10Data ProvenanceCitation Verification

  23. SafetyRepro: Configuration-Conditional Rank Instability on Alignment Benchmarks

    May 25, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangPairwise ComparisonPairwise Preference Evaluation

  24. Position: AI for Science Should Treat Measurement-to-Dataset Pipelines as Inference Components

    May 23, 2026Ling Zhan, Xiaoyao Yu, Tao JiaAI for ScienceUncertainty Quantification

  25. What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema

    May 20, 2026Mahdi Naser Moghadasi, Faezeh GhaderiBenchmark AuditingLLM Auditing

  26. Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction

    May 13, 2026Darius A. Faroughy, Sofia Palacios Schweitzer, Ian Pang +2AI Agents for Scientific DiscoveryAI Agent Evaluation

  27. It's not the Language Model, it's the Tool: Deterministic Mediation for Scientific Workflows

    May 13, 2026Marios Adamidis, Danae Katrisioti, Yannis Tzitzikas +1LLM Tool UseScientific Reproducibility

  28. Decomposing the Generalization Gap in PROTAC Activity Prediction: Variance Attribution and the Inter-Laboratory Ceiling

    May 12, 2026Thor Klamt, Wolfgang Nejdl, Ming TangMolecular Property PredictionScientific Reproducibility

  29. Quantifying the Reconstructability of Astrophysical Methods with Large Language Models and Information Theory: A Case Study in Spectral Reconstruction

    May 11, 2026Hsing Wen Lin, Zong-Fu SieLLM AuditingScientific Reproducibility