Question Answering

Also known as QA

Momentum

23 papers in the last four weeks, up 28% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 165

All topics
CardsList
  1. A Self Consistency Based Reranking for Narrative Question Answering

    Jun 14, 2026Molham Mohamed, Ali HamdiSelf-Consistency DecodingQuestion Answering

  2. SANA: What Matters for QA Agents over Massive Data Lakes?

    Jun 11, 2026Austin Senna Wijaya, Jiaxiang Liu, Haonan Wang +1LLM Agent EvaluationQuestion Answering

  3. Operads for compositional reasoning in LLMs

    Jun 11, 2026Nathaniel Bottman, Kyle RichardsonMulti-Hop QACompositional Reasoning

  4. uva-irlab-conv at SemEval-2026 Task 8: Multi-Turn RAG with Learned Sparse Retrieval and Listwise Reranking

    Jun 10, 2026Simon Lupart, Kidist Amde Mekonnen, Zahra Abbasiantaeb +1Retrieval-Augmented GenerationQuestion Answering

  5. When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

    Jun 6, 2026Yiheng Wang, Yueqian Lin, Lichen Zhu +3Multimodal Large Language ModelsQuestion Answering

  6. SPARC: A Multi-Agent System for Electrical Circuit Question Answering

    Jun 5, 2026Mushtari Sadia, Zhenning Yang, Umme Habiba Lamia +3Multi-Agent LLM SystemsQuestion Answering

  7. Improving Answer Extraction in Context-based Question Answering Systems Using LLMs

    Jun 4, 2026Hafez Abdelghaffar, Ahmed Alansary, Ali HamdiLLM Fine-TuningQuestion Answering

  8. IA-RAG: Interval-Algebra-Driven Temporal Reasoning for Dynamic Knowledge Retrieval

    Jun 4, 2026Xiaoman Wang, Yaoze Zhang, Wenzhuo Fan +7Retrieval-Augmented GenerationTemporal IR

  9. Narrative Knowledge Weaver: Narrative-Centric Retrieval-Augmented Reasoning for Long-Form Text Understanding

    Jun 4, 2026Qiuyu Tian, Fengyi Chen, Yiding Li +9Retrieval-Augmented GenerationLong-Context QA

  10. UniCAD: A Unified Benchmark and Universal Model for Multi-Modal Multi-Task CAD

    Jun 3, 2026Jingyuan Chen, Sheng Jin, Haopeng Sun +23D ReconstructionMultimodal Large Language Models

  11. Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions

    Jun 2, 2026Atm Mizanur Rahman, Md Arid Hasan, Syed Ishtiaque Ahmed +1Multilingual Language Model EvaluationLLM Evaluation

  12. Towards Lightweight Reliability: Using Soft Prompts for Hallucination Mitigation in Large Language Models

    May 30, 2026S M Tahmid Siddiqui, Akib Jawad Ononto, Anoop Singhal +1LLM Hallucination MitigationQuestion Answering

  13. SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

    May 30, 2026Qiming Shi, Zhaolu Kang, Yunfan Zhou +2Credit Assignment in RLStep-Level Credit Assignment in RL

  14. When English Rewrites Local Knowledge: Global Narrative Dominance in Large Language Models

    May 28, 2026Md Arid Hasan, Ruwad Naswan, Farhan Samir +2Multilingual Language Model EvaluationLLM Grounding

  15. Can LLM Teams Play What? Where? When?

    May 28, 2026Anastasia Kotelnikova, Viktor Byzov, Maria Dolzhenkova +1Multi-Agent LLM SystemsLLM Agent Evaluation

  16. LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?

    May 27, 2026HuiMing Fan, Xiao Wang, Zheng Chu +5Computer-Use Agent BenchmarksLLM Agent Evaluation

  17. PetroBench: A Benchmark for Large Language Models in Petroleum Engineering

    May 27, 2026Xiang Wang, Tingting Zhang, Sen Wang +4LLM EvaluationQuestion Answering

  18. KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

    May 27, 2026Haechan Kim, Seungjun Chung, Inkyu Park +2Audio-Language Model EvaluationQuestion Answering

  19. Query Symbolically or Retrieve Semantically? A Dataset and Method for Semi-Structured Question Answering

    May 26, 2026Mateusz Czyżnikiewicz, Ryszard Tuora, Adam Kozakiewicz +6Graph Retrieval-Augmented GenerationQuestion Answering

  20. PersLitEval: Fine-grained Benchmark and Evaluation of LLMs on Persian Literature Questions

    May 26, 2026Ruhallah Niazi, Faeze Ghorbanpour, Alexander FraserLLM EvaluationQuestion Answering

  21. Granuscore: A Reference-Free Measure of Granularity for Text Analysis and Question Answering

    May 26, 2026Lukas Ellinger, Alexander Fichtl, Miriam Anschütz +1Question Answering

  22. Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation

    May 25, 2026Joris Baan, Wilker Aziz, Barbara Plank +1Clarification Question GenerationQuestion Answering

  23. Inference Time Optimization with Confidence Dynamics

    May 24, 2026Yu Wang, Minghao Liu, Jiayun Wang +3Inference-Time OptimizationConfidence Estimation in Language Models