AI for Science

Latest papers 117

All topics
CardsList
  1. OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences

    Oct 8, 2026Zhiyi Li, Sihan Hu, Tianning Xiao +4AI for ScienceScientific Reasoning in Language Models

  2. SciExam for ENSO: Can AI Agents Build Climate Models?

    Oct 7, 2026Yinling Zhang, Langchen Liu, Dongbin Xiu +4AI for ScienceAI Agent Benchmarks

  3. OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software

    Sep 30, 2026Dingyuan Dai, Heli Qi, Lei Liu +28Computer-Use Agent BenchmarksAI for Science

  4. Searching for BSM Experimental Signatures with Large Lagrangian Models

    Sep 29, 2026Ibrahim Elsharkawy, Victoria Knapp-Perez, Wahid Bhimji +1AI for ScienceHigh-Energy Physics

  5. ASCEND: Personal AI Agents for Autonomous Scientific Computing Across HPC Clusters and GPU Workstations

    Sep 26, 2026J. Paul Liu, Uthpala Herath, Andrew PetersenAI for ScienceHigh-Performance Computing

  6. PhyMo: A Physical-Field Modality for Multimodal AI4Physics

    Sep 23, 2026Henan Sun, Haitao Hu, Jin Liu +4AI for ScienceCross-Modal Representation Learning

  7. PrimeScientist: Strategic Allocation of Research Effort in Autonomous Research

    Sep 15, 2026Xinle Yu, Fan Bai, Kaiser Sun +5AI for ScienceAutonomous Research Agents

  8. The AI-Enabled Scientific Frontier

    Sep 14, 2026Gabriel Manso, Emma Fu, Neil ThompsonAI for ScienceAI-Assisted Scientific Research

  9. AgentIdeaBench: Benchmarking Scientific Ideation in the Agent Era

    Sep 7, 2026Yunxiang Mo, Tianshi Zheng, Yisen Gao +7AI for ScienceAI Agent Evaluation

  10. BixBench3: Benchmarking AI agents on research-study-scale computational biology tasks

    Aug 26, 2026Zane Koch, Asmamaw T. Wassie, Javier Valdes-Aleman +5AI for ScienceAI Agent Benchmarks

  11. K-Bench: measuring model performance on real scientific agent requests

    Aug 21, 2026Aubrey M. Brueckner, Darshil Patel, Yuhuan He +1AI for ScienceLLM Agent Evaluation

  12. The ethics of artificial intelligence in the life sciences: Universality, cultural diversity and an architecture of care

    Aug 5, 2026Jean-Pierre Changeux, Gustavo Deco, Morten L. KringelbachAI for ScienceHuman-Centered AI

  13. Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design

    Aug 4, 2026Zejun Liu, Jian Wu, Ru Peng +4AI for ScienceBenchmark Design

  14. POMDPs for Autonomous Science Exploration

    Aug 4, 2026Daniel Guirguis, Nathan Wallace, Hanna Kurniawati +1Belief-Space PlanningAI for Science

  15. Towards a new paradigm of scientific discovery with socialized artificial intelligence

    Aug 3, 2026Xinjie Yao, Xingxin Xu, Xiyuan Gao +21AI for ScienceHuman-in-the-Loop AI

  16. Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side Decidable

    Aug 2, 2026Wenhui Chen, Jianlin Chen, Ziyao Lin +1Reward HackingAI for Science

  17. Artificial Intelligence and Modeling & Simulation: An Overview

    Aug 1, 2026Niclas Feldkamp, Philippe J. Giabbanelli, Istvan DavidAI for Science

  18. An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop

    Jul 30, 2026Yiwen Zhang, Eloise Zeng, Jaeha Lee +1AI for ScienceHuman-in-the-Loop AI

  19. TCA-SIR: Learning Target-Conditioned Abstractions for Scientific Inspiration Retrieval

    Jul 30, 2026Yuto Suzuki, Farnoush Banaei-KashaniAI for ScienceScientific Hypothesis Generation

  20. SciToolAgent-Evo: An Ontology-Aware Self-Evolving Agent for Open-World Scientific Tool Acquisition

    Jul 30, 2026Yuqi Tang, Chenyi Zhou, Libin Wang +3AI for ScienceLLM Agent Skill Learning

  21. Can AI Follow In Einstein's Footsteps?

    Jul 30, 2026Michael Shalyt, Nathan Regev, Marin Soljačić +1AI for ScienceScientific Hypothesis Generation

  22. Agentic Autoresearch for CT Reconstruction

    Jul 24, 2026Andreas Maier, Lucas Kachelriess, Siming Bayer +4AI for ScienceSparse-View CT Reconstruction

  23. From Overload to Insights: How AI Agents Can Support Scientists in Analyzing Complex Data

    Jul 18, 2026Tim Fuchs, Luca Gelisio, Steffen Hauf +1AI for ScienceAI-Assisted Scientific Research

  24. Monkey King Bang: A Unified Scientific Multimodal Foundation Model

    Jul 17, 2026Hesen Chen, Xinyu Su, Xiaomeng Yang +11AI for ScienceUnified Multimodal Models

  25. CoWeaver: A Bi-directional, Learnable and Explainable Matching Engine for Mixed Human-Agent Science Collaboration

    Jul 17, 2026Jiayao Gu, Kexin Chu, Peidong Liu +5AI for ScienceAI-Assisted Scientific Research

  26. BrainPilot: Automating Brain Discovery with Agentic Research

    Jul 16, 2026Haoxuan Li, Tianci Gao, Jianhe Li +13AI for ScienceLLM Agent Orchestration

  27. Networked Intelligence: Active Shared Context Graphs for Human-AI Team Science

    Jul 14, 2026Sutanay Choudhury, Jeffrey J. Czajka, Lummy M. O. Monteiro +15AI for ScienceMulti-Agent Communication

  28. From Observation to Insight: Mechanistic World Models and the Quest for Autonomous Discovery

    Jul 14, 2026Ingmar Posner, Anson Lei, Bernhard SchölkopfAI for ScienceWorld Models

  29. Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists

    Jul 13, 2026Chuhan Shi, Xiaoquan Ren, Sicheng Song +3AI for ScienceLLM Evaluation

  30. Are We Ready for AI-Driven Discovery? AI Verification Before the Next Fundamental Physics Breakthrough

    Jul 10, 2026Gaia Grosso, Vinicius Mikuni, Lukas HeinrichAI for ScienceHuman Oversight of AI

  31. Compressing the Validation Bottleneck: An Agentic Self-Driving Lab for Scientific Discovery

    Jul 5, 2026Kyunghoon Hur, Chihun LeeAI for ScienceMultifidelity Modeling

  32. Statistically Meaningful Geometry and Gauge Symmetry Breaking: A Geometric Foundation for Scientific Discovery and Intelligence Emergence

    Jul 3, 2026Bing Cheng, Yi-Shuai Niu, Howell Tong +1AI for ScienceCausal Discovery

  33. MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

    Jul 3, 2026Hanwen Wang, Sihan Liang, Zhiwei Liu +4VLM EvaluationAI for Science

  34. PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

    Jul 1, 2026Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi +1Computer-Use Agent BenchmarksAI for Science

  35. Scaling Storm-Resolving Atmospheric AI Simulation to the Entire Planet

    Jun 30, 2026Zeyuan Hu, Akshay Subramaniam, Noel Keen +9AI for ScienceTransformer

  36. DDIAgents: Mechanism-Conditioned Context Flow for Drug-Drug Interaction Prediction

    Jun 30, 2026Zhenqian Shen, Yu Liu, Xiaoyi Fu +1Multi-Agent LLM SystemsAI for Science

  37. SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

    Jun 29, 2026Zhiyuan Ma, Zhengfeng Shi, Yuning An +6AI for ScienceImage Generation

  38. Building AI-Ready Data Systems for Space Life Sciences, Aerospace Medicine, and Deep Space Exploration

    Jun 27, 2026Sylvain V. Costes, Sergio Garcia Busto, Ryan T. Scott +15AI for ScienceAI Governance

  39. A Multi-Level Validation and Traceability Framework for AI-Generated Telescope Scheduling Decisions

    Jun 25, 2026Hengchu Xiao, Chuanjun WangAI for ScienceExplainable Artificial Intelligence

  40. Accelerating Returns and the Qualitative Engine for Science

    Jun 24, 2026Guojun LiaoAI for ScienceScientific Reasoning

  41. NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

    Jun 23, 2026Yuru Wang, Lejun Cheng, Yuxin Zuo +14AI for ScienceCoding Agents

  42. BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery

    Jun 19, 2026Jieyi Wang, Bingxuan Li, Nanyi Jiang +9AI for ScienceMulti-Agent Orchestration

  43. SciLens: Multi-modal Scientific Claim Verification with Agentic Entailment and Grounding

    Jun 18, 2026Yueming Wang, Tianshi Zheng, Jiaxin Bai +3Multimodal GroundingAI for Science

  44. Measuring Biological Capabilities and Risks of AI Agents

    Jun 18, 2026Patricia Paskov, Jeffrey Lee, Kyle Brady +1AI for ScienceAI Agent Evaluation

  45. SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

    Jun 17, 2026Linghao Feng, Yinqian Sun, Dongqi Liang +8LLM Safety BenchmarksAI for Science

  46. Speaking the Language of Science: Toward a General-Purpose Generative Foundation Model for the Natural Sciences

    Jun 15, 2026Mingyang Li, Yurou Liu, Jieping Ye +3AI for ScienceGenerative Modeling

  47. SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific Creativity

    Jun 14, 2026Yifan Mo, Xiao Fu, Yue Su +4AI for ScienceLLM Evaluation

  48. Agents-K1: Towards Agent-native Knowledge Orchestration

    Jun 11, 2026Zongsheng Cao, Bihao Zhan, Jinxin Shi +23KG ConstructionAI for Science

  49. LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories

    Jun 11, 2026Baochang Ren, Xinjie Liu, Xi Chen +15AI for ScienceRobot Skill Learning

  50. A Three-Layer Framework for AI in Scientific Discovery

    Jun 11, 2026Guojun LiaoAI for ScienceScientific Reasoning