Scientific QA

QA: Question Answering

Momentum

9 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 39

All topics
CardsList
  1. Arctic Questions, Missing Answers: A Dataset and Benchmark for LLM Abstention in Arctic Science

    Oct 7, 2026Benjamin Wilcox, Dawei Gao, Pradeeban Kathiravelu +3LLM AbstentionLLM Evaluation

  2. From Papers to Mechanisms: An Evidence-Grounded Knowledge Substrate for Scientific Language Models

    Oct 5, 2026Qiuhui Chen, Yibo Liu, Tao Dai +3Knowledge Augmentation for Language ModelsScientific QA

  3. PhysicsMate: A Curriculum-Grounded Bengali Benchmark for Secondary Physics QA with Small-Model Adaptation

    Sep 30, 2026Rashid Azraf Jahin, Saadman Sajid, Khan Raiyan Ibne Reza +1Benchmark DesignScientific QA

  4. PathAnchor: Path-Structured Evidence for Scientific Agents

    Sep 30, 2026Qiuhui Chen, Jiafan Lu, Shuaimin Tang +5Evidence-Grounded ReasoningScientific QA

  5. Where Scientific Search Agents Fail: Decision-Checkpoint Auditing of Exposure and Inspection Attempts

    Sep 29, 2026Hongmin Li, Wanli ZhaoAI Agent AuditingScientific QA

  6. Re-ranking and Late Interaction Drive Retrieval Quality: A Controlled Comparison of RAG Strategies for Scientific Question Answering

    Sep 29, 2026Bhagyesh Rathi, Eshan Chawla, William B. AndreopoulosLate Interaction RetrievalScientific QA

  7. AgentHop: A Diagnostic Benchmark for Agentic Multi-Hop Scientific Question Answering

    Sep 28, 2026Chanhee Park, Jeongho Yoon, Sungbin Han +2Multi-Hop QATool-Augmented Language Model Agents

  8. Large Knowledge Model: A Knowledge Foundation for Agentic Science at Scale

    Sep 23, 2026Yuan Huang, Sihan Hu, Hongyu Gu +18KG ConstructionAI Agents for Scientific Discovery

  9. Rethinking Domain Specialization for Open-Ended Scientific Reasoning in Astronomy Language Models

    Sep 15, 2026Vanessa Lama, Sanjay Das, Emily Herron +5LLM EvaluationScientific QA

  10. Lit3R: Retrieve-Relate-Read for Evidence-Grounded Question Answering over Scientific Literature

    Sep 15, 2026Akira Ise, Kotaro Kumagai, Yuta Yamaguchi +3Scientific QAEvidence-Grounded Generation

  11. SciDocBench: A Workflow-Centered Benchmark and Data Pipeline for Scientific Document Understanding

    Sep 4, 2026Shenxi Wu, Yuhong Liu, Haosong Zhang +8Document UnderstandingLLM Evaluation

  12. From Terminology to Diagrams: Visual-Instruction Generation for Scientific Diagram Understanding

    Sep 1, 2026Raul Ortega, José Manuel Gómez-PérezVisual Question AnsweringScientific QA

  13. EGT-KG: Evidence-Grounded Typed KG Retrieval for Practical Scientific QA with Small Language Models

    Aug 31, 2026Muran Yu, Jiechao Gao, Yuandong Pan +5Graph Retrieval-Augmented GenerationSmall Language Models

  14. LitTraceQA: A Benchmark for Multi-Stage Grounding and Verification in Scientific Question Answering

    Aug 7, 2026Xuye Liu, Yimu Wang, Peng Shi +7Scientific QAEvidence-Grounded Generation

  15. SciRet: A Compute-Aware Empirical Study of Retrieval and Reranking for Scientific RAG

    Aug 4, 2026Kaysarul Anas Apurba, Md. Hasibul Hasan, Rofiqul Alam Shehab +1Cross-Encoder RerankingScientific QA

  16. EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

    Jul 30, 2026Luigi Sigillo, Matteo Silvestri, Francesco Tabaro +9LLM Agent OrchestrationScientific QA

  17. SciDataSailor: Deep Scientific Data Exploring

    Jul 29, 2026Jiyong Rao, Yicheng Qiu, Chi Zhang +2Scientific QAAI Agent Benchmarks

  18. A corrective agentic hybrid RAG and an operations-grounded evaluation for a scientific facility

    Jul 27, 2026Rajat Sainju, Dariusz Jarosz, Hairong Shang +5Graph Retrieval-Augmented GenerationScientific QA

  19. VecTree-RAG: An Agentic Retrieval-Augmented Generation Framework Combining Vector and Tree Retrieval for Efficiency and Accuracy

    Jul 25, 2026Xinyan Zhong, Yuwei Shi, Yuqi Wei +3Scientific QAAgentic RAG

  20. Querying Multimodal Scientific Papers with AI: Practices and Preferences Across Blind, Low-Vision, and Sighted Scientists

    Jul 20, 2026Arnavi Chheda-Kothary, Lucy Lu Wang, Joseph Chee Chang +1Multimodal Large Language ModelsScientific QA

  21. DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

    Jul 15, 2026Brandon Michaels, Brendon JohnsonRetrieval-Augmented GenerationCitation Verification

  22. NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models

    Jun 25, 2026Henry Shaowu Yuchi, Michal Kucer, Benjamin H. Sims +2LLM EvaluationScientific QA

  23. Agentic Hybrid RAG for Evidence-Grounded Muon Collider Analysis

    Jun 9, 2026Ruobing Jiang, Dawei Fu, Cheng Jiang +6Scientific QAHigh-Energy Physics

  24. MMClima: A Framework for Multimodal Climate Science Data and Evaluation

    Jun 8, 2026Muhammad Umer Sheikh, Hassan Abid, Khawar Shehzad +2Climate ScienceScientific QA

  25. TechRAG: Evidence-Gated Multimodal Agentic RAG for Technical Literature Reasoning

    Jun 1, 2026Kanwar Bharat SinghMultimodal RAGScientific QA

  26. ProtStructQA: A Denotation Threshold in Protein Structural Reasoning

    May 30, 2026Aravind Mandiga, Guoming Li, Jin Lu +3LLM EvaluationScientific QA

  27. OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

    May 28, 2026Wanhao Liu, Jiaqing Xie, Qian Tan +10Benchmark DesignScientific QA