Question-Answer Pairs

Momentum

8 papers in the last four weeks, against 1 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 48

All topics
CardsList
  1. Video-Index: A Curated Meta-Benchmark for Video Understanding

    Oct 1, 2026Enxin Song, Yinuo Xu, Shusheng Yang +2Long-Video BenchmarksLong Videos

  2. Evaluating the Evaluators: Diagnosing Large Multimodal Models for AI-Generated Image Assessment

    Sep 29, 2026Yu Zhao, Jiarui Wang, Huiyu Duan +5Modern Text-To-Image ModelsLarge Multimodal Models

  3. Grounding Memory Summarization in Utility Intent

    Sep 27, 2026Zhenyu Lei, Mingjia Shi, Xingbo Fu +3Conversational MemorySummarization

  4. Voice of Reason: Reinforcement Learning for Spoken Math

    Sep 16, 2026Timothée Weisselberger, Edouard Graves, Alexandre DéfossezSpeech Language ModelsMathematical Reasoning Benchmarks

  5. When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control

    Sep 15, 2026Ali ŞenolAbstentionCommitment

  6. The Cost of Compression: A Rate-Distortion Limit on Factual Hallucination

    Sep 14, 2026Xi Wang, Shijia Xu, Rongfeng GuoFactual RecallVisual Hallucinations

  7. ORQA: An Occupation-Realistic Question and Answer Framework for LLM Professional Knowledge

    Sep 14, 2026Shreyas Krishnan, Serina Chang, Abhishek NagarajQuestion-Answer Pairs

  8. Don't `Well, Actually' Me Unless You Know What You're Talking About: Weak Presupposition Verification Degrades General QA Performance

    Aug 6, 2026Shenran Wang, Vered Shwartz, Hila GonenQuestion-Answer PairsAssumptions

  9. Exploiting Intrinsic Duality for Multi-Hop Question Generation

    Aug 1, 2026Maodong Li, Xinyue Kang, Yuanchen Shi +1Multi-Hop ReasoningFaithful Question Generation

  10. Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations

    Jul 14, 2026Monica Munnangi, Saiph SavageStudent MisconceptionsLarge Language Models Fail

  11. From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b

    Jul 7, 2026Taeyun Roh, Eunha Lee, Wonjune Jang +3Biomedical TextQuestion-Answer Pairs

  12. LuxSQA: Ask Me in Luxembourgish with TTS-Augmented Spoken Question Answering

    Jul 2, 2026Nina Hosseini-Kivanani, Marco Matassoni, Alessio BruttiQuestion-Answer PairsLuxembourgish

  13. EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

    Jun 23, 2026Yijia Lei, Jinzhao Li, Yichi Zhang +3Egocentric VideoQuestion-Answer Pairs

  14. AdaMem: Learning What to Remember with Adaptive Memory Policies for Personalized Agents

    Jun 19, 2026Xingyu Chen, Rui Wang, Zhaopeng Tu +1Long-Horizon Task PlanningQuestion-Answer Pairs

  15. Context-Aware RL for Agentic and Multimodal LLMs

    Jun 15, 2026Peiyang Xu, Bangzheng Li, Sijia Liu +4Multimodal Large Language ModelsMultimodal Reasoning

  16. EHRNote-ChatQA: A Benchmark for Evidence-Grounded Multi-Turn Clinical Question Answering over Longitudinal Discharge Summaries

    Jun 14, 2026Jiyoun Kim, Muhan Yeo, Eunhye Jang +14Question-Answer Pairs

  17. S1-DeepResearch: Beyond Search, Toward Real-World Long-Horizon Research Agents

    Jun 13, 2026Yao Dong, Xinglin Xiao, Liwei Dong +5Deep ResearchLong-Horizon Agents

  18. Personal AI Agent for Camera Roll VQA

    Jun 3, 2026Thao Nguyen, Krishna Kumar Singh, Donghyun Kim +2Visual MemoryQuestion-Answer Pairs

  19. Ryze: Evidence-Enriched Data Synthesis from Biomedical Papers

    May 30, 2026Yeqi Huang, Yue Chen, Yanwei Ye +2Biomedical TextQwen3

  20. SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

    May 30, 2026Qiming Shi, Zhaolu Kang, Yunfan Zhou +2Question-Answer Pairs

  21. MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

    May 29, 2026Qian Kou, Xiaofeng Shi, Yulin Li +4Visual ReasoningMultimodal Large Language Models

  22. AMNESIA: A Large Scale Medical Unlearning Benchmark Suite with Disease-Informed Analysis

    May 28, 2026Saeedeh Davoudi, Reihaneh Iranmanesh, Ophir Frieder +1Unlearning MethodExact Unlearning

  23. Brain-IT-VQA: From Brain Signals to Answers

    May 28, 2026Roman Beliy, Matias Cosarinsky, Oliver Heinimann +2Functional Magnetic Resonance ImagingTextvqa

  24. IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams

    May 26, 2026Jinzhao Li, Yinuo Chen, Wenxuan Song +5ProactiveMultimodal Large Language Models

  25. TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering

    May 23, 2026Liying Han, Kang Yang, Oliver Wang +9Temporal ReasoningSkills

  26. ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

    May 22, 2026Xiaoyuan Li, Keqin Bao, Moxin Li +5Large Language Model Reinforcement LearningQuestion-Answer Pairs

  27. NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

    May 19, 2026Mohammad H. Abbasi, Favour Nerrise, Shaurnav Ghosh +12Medical Visual Question AnsweringMagnetic Resonance Imaging

  28. Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering

    May 12, 2026Maryam Amirizaniani, Benjamin Charles Germain Lee, Jevin West +1Large Language Model PersonalizationQuestion-Answer Pairs

  29. How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue

    May 11, 2026Hui Lu, Xueyuan Chen, Huimeng Wang +4Full-Duplex Speech ModelsDialogue

  30. Telegraph English: Semantic Prompt Compression via Structured Symbolic Rewriting

    May 6, 2026Mikhail L. Arbuzov, Sisong Bei, Ziwei Dong +2RewriteData Compression Methods

  31. CLaC at SemEval-2026 Task 6: Response Clarity Detection in Political Discourse

    May 4, 2026Nawar Turk, Lucas Miquet-Westphal, Leila KosseimLarge Language Model ResponsesInterviews

  32. HealthNLP_Retrievers at ArchEHR-QA 2026: Cascaded LLM Pipeline for Grounded Clinical Question Answering

    Apr 29, 2026Md Biplob Hosen, Md Alomgeer Hussein, Md Akmol Masud +3Electronic Health RecordsClinical Reasoning Training

  33. DIAGRAMS: A Review Framework for Reasoning-Level Attribution in Diagram QA

    Apr 29, 2026Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Manan Suri +4DiagramsReasoning Graphs

  34. LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document Summarization

    Apr 28, 2026Huyen Nguyen, Haoxuan Zhang, Yang Zhang +2SummarizationLong-Form Generation

  35. Can MLLMs "Read" What is Missing?

    Apr 23, 2026Jindi Guo, Chaozheng Huang, Xi FangMultimodal Large Language ModelsQuestion-Answer Pairs

  36. RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering

    Apr 22, 2026Marisa Hudspeth, Patrick J. Burns, Brendan O'ConnorMultilingual BenchmarkQuestion-Answer Pairs

  37. Structure Guided Retrieval-Augmented Generation for Factual Queries

    Apr 21, 2026Miao Xie, Xiao Zhang, Yi Li +1Question-Answer PairsQueries

  38. Evaluating Hallucinations in Domain-Adapted Large Language Models

    Apr 19, 2026Sanchita Porwal, Sai Prasath S, Xingjian Bi +1Large Language Model HallucinationHallucination Detection

  39. BAGEL: Benchmarking Animal Knowledge Expertise in Language Models

    Apr 17, 2026Jiacheng Shen, Masato Hagiwara, Milad Alizadeh +9SpeciesReasoning Benchmark

  40. SpatialMosaic: A Multiview VLM Dataset for Partial Visibility

    Dec 29, 2025Kanghee Lee, Jungi Hong, Sion Lee +4Multimodal Large Language ModelsVisibility

  41. DocHop-QA: Towards Multi-Hop Reasoning over Multimodal Document Collections

    Aug 20, 2025Jiwon Park, Seohyun Pyeon, Jinwoo Kim +4Multimodal DocumentsQuestion-Answer Pairs

  42. SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA

    Apr 10, 2025Sher Badshah, Ali Emami, Hassan SajjadLarge Language Model EvaluationQuestion-Answering Benchmarks

  43. QDA-SQL: Questions Enhanced Dialogue Augmentation for Multi-Turn Text-to-SQL

    Jun 15, 2024Yinggang Sun, Ziming Guo, Haining Yu +5Text-To-SqlQuestion-Answer Pairs