ML Reproducibility

ML: Machine Learning

Momentum

14 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 85

All topics
CardsList
  1. Reproducible LLM Inference Benchmarking: A Sequential Isolation Protocol for Regression Testing

    Oct 7, 2026Arnold Olympio, Juan Manuel Servera Bondroit, Wael Abdelmalek +2LLM InferenceML Reproducibility

  2. Beyond the Model: The Critical Role of Data Filtering in Clinical Machine Learning

    Oct 5, 2026Noah Subedar, Colin Campbell, Wenjing Zhang +3Training Data CurationML Reproducibility

  3. Technical Report on the Turba Fertilizer Machine Learning Stack in Morocco

    Oct 5, 2026Abdelghani Belgaid, Zakaria Mahmoud, Fahd Chibani +3Surrogate ModelingML Reproducibility

  4. Measuring and Reducing Cross-Vendor Mismatch in Language Models

    Oct 4, 2026Erland Hilman Fuadi, Chong Tian, Xiaosong Ma +1Efficient Neural Network InferenceML Reproducibility

  5. Model validation in machine learning: A scenario-based guide from hold-out splits to nested group cross-validation in biomedical and applied research

    Oct 1, 2026Mehmet Baygin, Sengul Dogan, Turker TuncerData LeakageML Reproducibility

  6. Dating the Model: Hidden Dates in System Prompts Affect LLM Evaluation

    Sep 29, 2026Mario Sanz-Guerrero, Minh Duc Bui, Manuel Mager +1LLM EvaluationLanguage Model Generation Evaluation

  7. Making Cross-Continental Federated Learning Repeatable with FLIP: a Multi-Application Study

    Sep 28, 2026Rafael Garcia-Dias, Alexandre Triay Bagur, Chayanin Tangwiriyasakul +20HealthcareML Reproducibility

  8. Identical Runs, Different Results: Benchmarking AI Coding Agents on Open-Weight Models

    Sep 27, 2026Eduardo Ariño de la Rubia, Szilard PafkaAI Coding AgentsLLM Agent Evaluation

  9. RECLAIM: Can Agents Reproduce the Claims of Machine Learning Papers?

    Sep 23, 2026Mithil Salunkhe, Haochen Ding, Samridhi Verma +1LLM Agent EvaluationAI Agent Benchmarks

  10. Reproducible AI Requires Reproducible Randomness

    Sep 22, 2026Anthony Bertrand, Tom Schmitt, Engelbert Mephu Nguifo +1ML ReproducibilityScientific Reproducibility

  11. Accelerating the Mitigation of LLM Inference Nondeterminism Across GPU Architectures

    Sep 22, 2026Liam Cooper, Shinnung Jeong, Hyeran Jeon +2GPU Kernel OptimizationLLM Inference Acceleration

  12. Exposing Blind Spots in Deep Imbalanced Regression Evaluation

    Sep 21, 2026Noah C. Puetz, Jens U. Brandt, Marc Hilbert +3Class-Imbalanced LearningML Reproducibility

  13. Rethinking How We Evaluate Methodological Progress in Health AI

    Sep 16, 2026Florent Pollet, Matthew McDermottML ReproducibilityLongitudinal EHR Modeling

  14. TuiML: Machine Learning for AI Agents

    Sep 16, 2026Nilesh Verma, Nick Lim, Albert Bifet +1Tool-Using AgentsML Reproducibility

  15. OPEN-1B: A Fully Auditable Training Run

    Sep 15, 2026John Donaghy, Brian Wilcox, Oğuzhan Ersoy +6Neural Network VerificationLLM Auditing

  16. Model Retirement Creates Reproducibility Risk in Biomedical AI Publications

    Sep 7, 2026Nathan Wolfrath, Meghan Conroy, Thomas Kosten +7ML ReproducibilityScientific Reproducibility

  17. Training seeds and model-selection stability in recommender-system evaluation

    Sep 2, 2026Juan Manuel Rodriguez, Oleg Lesota, Antonela TommaselRecommender SystemsML Reproducibility

  18. A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation

    Sep 1, 2026Hodong Lee, Sanghee Park, Dohoon Ryu +4ML ReproducibilityMultimodal Foundation Models

  19. MURANO: Design, Run, and Reproduce Mechanistic Interpretability Experiments as Composable Pipelines

    Aug 31, 2026Alireza Bayat Makou, Emirhan Böge, Phu Gia Hoang +5LLM InterpretabilityInterpretable ML

  20. Workflow Cards: Structured Summaries of Workflow Executions Using Provenance Data

    Aug 11, 2026Nicola Giuseppe Marchioro, Gabriele Padovani, Amal Gueroudji +5Data ProvenanceML Reproducibility

  21. Seeds Before Objectives: Rethinking Evaluation for Low-Resource Garhwali ASR

    Aug 11, 2026Karamvir Singh Batra, Prathamjyot Singh, Ashima Sood +2ASR EvaluationML Reproducibility

  22. Why Ranking Anomaly Detection Algorithms Isn't as Reliable as You May Think

    Aug 5, 2026Simon Klüttermann, Jérôme Rutinowski, Frederik Polachowski +1Benchmark DesignML Reproducibility

  23. Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

    Aug 4, 2026Mohsen Hariri, Weicong Chen, Nahal Shahini +11LLM EvaluationTest-Time Scaling

  24. One Run Is Not an Idea: The Implementation Lottery in Automated Research

    Jul 29, 2026Jingjie Ning, Shanshan Zhong, Xiaochuan Li +2ML ReproducibilityAutonomous Research Agents

  25. GlucoTune: A Unified Framework for Blood Glucose Preprocessing, Forecasting, and Benchmarking in Diabetes

    Jul 23, 2026Davide Marelli, Giorgia Rigamonti, Mirko Paolo Barbato +1Type 1 DiabetesTime Series Forecasting

  26. Teach it to stop, not just to click

    Jul 19, 2026Barada Sahu, Shivesh PandeyAI Agent ReliabilityAgent Reliability

  27. Is Model Instability just Noise to be Tolerated or a Property that can be Managed?

    Jul 11, 2026Amirali Rayegan, Lunxiao Li, Tim MenziesStochastic OptimizationAutomated Software Engineering

  28. GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI

    Jul 6, 2026Huzhenyu Zhang, Shenghai Yuan, Wenrui Yan +4GPU AccelerationRobotics Simulation

  29. Coding-agents can replicate scientific machine learning papers

    Jul 2, 2026Atharva Hans, Ilias BilionisCoding AgentsLLM Agent Evaluation

  30. The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation

    Jun 18, 2026Nicolas Dufour, Alexei A. Efros, Patrick PérezML ReproducibilityImage Generation Evaluation

  31. ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

    Jun 16, 2026Shanda Li, Qiuhong Anna Wei, Jingwu Tang +5LLM Agent EvaluationAI Agent Benchmarks

  32. The Shift Toward Open and Reproducible AI Research

    Jun 15, 2026Kevin L Coakley, Thijs Snelleman, Holger Hoos +1ML ReproducibilityScientific Reproducibility

  33. Incentives and Evidence in Learned Service Orchestration

    Jun 15, 2026Syed Izhan Khilji, Alireza Furutanpey, Schahram DustdarRL ControlReinforcement Learning

  34. RecourseBench: A Modular Framework for Reproducible Algorithmic Recourse Evaluation

    Jun 15, 2026Zahra Khotanlou, Hashir Ahmed, Chenghao Tan +2Benchmark DesignAutomated Evaluation

  35. Mojo: A Promising Tool for Scalable Financial AI Efficiency

    Jun 14, 2026Henry HanQuantitative FinanceML Reproducibility

  36. BrainSurgery: Reproducible and Reliable Declarative Weight Manipulations for Model Editing and Upcycling

    Jun 8, 2026Gianluca Barmina, Annemette Broch Pirchert, Andrea Blasi Núñez +2ML Reproducibility

  37. Execution Realism and Reproducibility in LLM-Based Trading Systems: A Systematic Scoping Review and Evidence Audit

    Jun 6, 2026Junyi Yao, Zihao Zheng, Baichuan Li +1ML ReproducibilityFinance

  38. Accelerating Reproducible Research in Synthetic EHR Generation

    Jun 5, 2026Jalen Jiang, Chufan Gao, Ethan Rasmussen +2Synthetic Data GenerationML Reproducibility

  39. Jacobi-Anger Method for Deterministic Initialization in Implicit Neural Representation

    Jun 4, 2026Mohammed Alsakabi, Kejia Hu, John M. Dolan +1Implicit Neural RepresentationsNeural Network Initialization

  40. Tight list replicability bounds via a novel sphere covering theorem

    Jun 4, 2026Ari Blondal, Hamed Hatami, Pooya Hatami +2ML ReproducibilityStatistical Learning Theory

  41. Revisiting Vul-RAG: Reproducibility and Replicability of RAG-based Vulnerability Detection with Open-Weight Models

    Jun 3, 2026Sabrina Kaniewski, Fabian Schmidt, Tobias HeerRetrieval-Augmented GenerationLLM Evaluation

  42. Reproducibility is the New Copyleft: Defining AGI-oriented Reproducible Builds

    Jun 2, 2026Masayuki HattaML ReproducibilityAI Governance

  43. ERICA: Quantifying Replicability of Cluster Analysis

    May 29, 2026Siamak K. Sorooshyari, Manuel A. Rivas, Robert TibshiraniClusteringML Reproducibility

  44. Modeling Robotics Dataset Construction as an Artifact-Based Build Process

    May 29, 2026Leon Pohl, Lukas Beer, George Sebastian +1RoboticsAutomated Software Engineering

  45. A Unified and Reproducible Experimentation Framework for Speech Understanding

    May 29, 2026Jing Peng, Junhao Du, Chenghao Wang +21Audio-Language Model EvaluationML Reproducibility

  46. Croissant Tasks: A Metadata Format for Reproducible Machine Learning Evaluations

    May 28, 2026Omar Benjelloun, Leonardo Martins Bianco, Isabelle Guyon +8ML Reproducibility

  47. stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation

    May 20, 2026Lucas Maes, Quentin Le Lidec, Luiz Facury +9World ModelsML Reproducibility

  48. A Reproducible Log-Driven AutoML Framework for Interpretable Pipeline Optimization in Healthcare Risk Prediction

    May 19, 2026Rui Huang, Lican HuangClass-Imbalanced LearningInterpretable ML