Scientific Reasoning in Language Models

Latest papers 34

All topics
CardsList
  1. OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences

    Oct 8, 2026Zhiyi Li, Sihan Hu, Tianning Xiao +4AI for ScienceScientific Reasoning in Language Models

  2. Ontology-Grounded, Reasoner-Verified Benchmarks for Evaluating LLM Reasoning in Scientific AI

    Sep 30, 2026Nishtha N. Vaidya, Stephan Grimm, Thomas Hubauer +1LLM EvaluationSynthetic Benchmark Generation

  3. Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers

    Sep 30, 2026Yerim Oh, Young-Jun Lee, Jaewoo Ahn +2AI-Generated Text DetectionScientific Reasoning in Language Models

  4. Does Learning Protein Folding Generalize to Broader Reasoning?

    Sep 30, 2026Yong Liu, Zhanpeng Shi, Yizhou Dang +4Protein Structure PredictionStructured Reasoning

  5. MechBench: Can AI Scientific Agents Discover Mechanisms Beyond Phenomenal Laws?

    Sep 28, 2026Zihan Yu, Jiadong Zhang, Jialin Cheng +2Scientific DiscoveryAI Agent Benchmarks

  6. MechReasoner: A Simulator and Benchmark for Mechanistic Reasoning in Qualitative Physics

    Sep 28, 2026Danilo Gusicuma, André FreitasPhysical ReasoningScientific Reasoning in Language Models

  7. The Marathon of Scientific Reasoning: Robustness of Scientific Agents to Perturbations in Multi-Turn Interactions

    Sep 28, 2026Xiaoting Lyu, Xinbo Ma, Yufei Han +5AI Agent BenchmarksScientific Reasoning in Language Models

  8. PhysFieldBench: Can Multimodal Models Understand Physical Fields?

    Sep 28, 2026Yuezhou Ma, Huikun Weng, Jialong Wu +5Physical ReasoningMultimodal Large Language Models

  9. SciGen-Verifier: A Multimodal Reasoner for Explainable Verification in Scientific Image Generation

    Sep 27, 2026Jiali Chen, Zhengteng Lin, Zuqi Wang +6Image Generation EvaluationScientific Reasoning in Language Models

  10. DISCERN: Can AI Agents Work Like Scientists and Guide Discovery?

    Sep 27, 2026Nan Huang, Mario Tapia-Pacheco, Kun Zhou +4AI Agent ReliabilityScientific Hypothesis Generation

  11. Jev for Scientific Decisions: Evaluating Semantic Choices and Their Consequences

    Sep 21, 2026Boyuan Deng, Shuyi Fan, Hongyang Zhang +1AI-Assisted Scientific ResearchLLM Decision-Making

  12. Tool-Augmented On-Policy Distillation for LLM Domain Adaptation in Sequence-Based Omics Tasks

    Sep 20, 2026Jie Ying, Zhefan Wang, Zihong Chen +11LLM EvaluationOn-Policy Distillation

  13. VERPO: Verified Evidence Regularized Policy Optimization

    Sep 5, 2026Haijiang Li, Chengyu Lv, Yi Zhang +8RL for Language Model ReasoningCredit Assignment in RL

  14. TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs

    Aug 11, 2026Valentin Rodionov, Shamil AssylbekovLLM EvaluationLLM Reliability

  15. Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

    Aug 7, 2026Taolin Han, Yuchen Zhang, Jinghang Wang +22Scientific ReasoningScientific Discovery

  16. Divergence Decoding: Training-Free Capability Fusion

    Jul 28, 2026Yimi Wang, Hao Li, Shuo Yang +6LLM RoutingScientific Reasoning in Language Models

  17. Chemical Chain-of-Thought Functions as a Hallucination-Prone Molecular Scratchpad

    Jul 23, 2026Jiatong Li, Yuxuan Ren, Weida Wang +2CoT FaithfulnessScientific Reasoning

  18. Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model

    Jul 22, 2026Markus J. BuehlerMechanistic InterpretabilityScientific Reasoning in Language Models

  19. Consensus as Privileged Context for Label-Free Self-Distillation

    Jul 15, 2026John Gkountouras, Josip Jukić, Ivan TitovSelf-Training for Language ModelsLanguage Model Distillation

  20. Evidence-Informed LLM Beliefs for Continual Scientific Discovery

    Jun 28, 2026Dhruv Agarwal, Reece Adamson, Andrew McCallum +3Scientific Hypothesis GenerationBelief Updating in LLMs

  21. SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

    Jun 14, 2026Jingru Guo, Xiangyuan Xue, Lian Zhang +6LLM Agent OrchestrationMultimodal Reasoning

  22. SciR: A Controllable Benchmark for Scientific Reasoning in LLMs

    Jun 11, 2026Pierre Beckmann, Marco Valentino, Andre FreitasLLM EvaluationScientific Reasoning

  23. DN-Hypo-Pipeline: An AI-Driven Workflow for Generating Hypotheses using Large Language Models and Scientific Explanations

    Jun 7, 2026Lei Lin, Ronghao Wang, Chunbao Zhou +2Scientific ReasoningScientific Hypothesis Generation

  24. FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games

    Jun 3, 2026Leonardo Bertolazzi, Katya Tentori, Raffaella BernardiLLM EvaluationAI Agent Benchmarks

  25. SocraticPO: Policy Optimization via Interactive Guidance

    Jun 3, 2026Zirui Liu, Jie Ouyang, Qi Liu +8RL for Language Model ReasoningLLM-Guided RL