Answer

Momentum

24 papers in the last four weeks, up 50% on the four weeks before. 0.3% of all new papers.

Jul 6Week of Sep 21

Latest papers 181

All topics
CardsList
  1. From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Large Language Models

    Jun 2, 2026Hongyu Guo, Hao Li, He Cao +2ChemistryAnswer

  2. HypothesisMed: Inference-Time Answer Fusion and Structured Hypothesis-Space Reporting for Biomedical Question Answering

    May 31, 2026Md Motaleb Hossen Manik, Ge WangBiomedical TextMedical Visual Question Answering

  3. Not All Flips Are Conformity: Decomposing Stance Convergence in Multi-Agent LLM Debate

    May 30, 2026Xiqi Hao, Zengqing Wu, Yu-Xuan Qiu +4Multi-Agent DebateDebate

  4. KG-Guard: Graph-Based Hallucination Detection for Knowledge Base Question Answering

    May 29, 2026Albert Sawczyn, Piotr Bielak, Tomasz KajdanowiczKnowledge GraphsHallucination Detection

  5. SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks

    May 29, 2026Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang +1Self-PlayTask-Specific Rubrics

  6. On the impact of retrieved content representations in RAG Pipelines

    May 29, 2026Jonathan J Ross, Bevan Koopman, Anton van der Vegt +1Retrieval-Augmented Generation PipelinesAnswer

  7. Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?

    May 28, 2026Yue Zhang, Zun Wang, Han Lin +3Spatial ReasoningVisual Evidence

  8. Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs

    May 28, 2026Vinay Samuel, Yapei Chang, Mohit IyyerDiversityInstruction-Tuned Models

  9. Brain-IT-VQA: From Brain Signals to Answers

    May 28, 2026Roman Beliy, Matias Cosarinsky, Oliver Heinimann +2Functional Magnetic Resonance ImagingTextvqa

  10. Bridging the Detection-to-Abstention Gap in Reasoning Models under Insufficient Information

    May 27, 2026Renjie Gu, Jiaxu Li, Yihao Wang +8Large Reasoning ModelsIncomplete

  11. CuriosAI Submission to the CASTLE Challenge at EgoVis 2026

    May 27, 2026Yuto Kanda, Hayato Tanoue, Takayuki HoriChallengesAnswer

  12. Query Symbolically or Retrieve Semantically? A Dataset and Method for Semi-Structured Question Answering

    May 26, 2026Mateusz Czyżnikiewicz, Ryszard Tuora, Adam Kozakiewicz +6Knowledge GraphsSymbol-

  13. When the Strongest Teacher Is Not the Best Teacher: Student-Centric Answer Selection

    May 26, 2026Zhengyu Hu, Zheyuan Xiao, Linxin Song +10TeacherEffective Distillation

  14. AuthTrace: Diagnosing Evidence Construction in Thematically Dense Single-Author Corpora

    May 25, 2026Xiaoqing Wu, Feifei Li, Haoliang Ming +1Text CorporaTraces

  15. How Many Tools Should an LLM Agent See? A Chance-Corrected Answer

    May 23, 2026Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh +1Large Language Model AgentsLarge Language Model Tool Use

  16. SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval

    May 21, 2026Ningyuan Li, Haiyang Shen, Mugeng Liu +4Search AgentsAnswer

  17. Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer

    May 21, 2026Jewon Yeom, Jaewon Sok, Heejun Kim +3Large Language Model HallucinationLarge Language Models Fail

  18. Wasserstein Equilibrium Decoding for Reliable Medical Visual Question Answering

    May 18, 2026Luca Hagen, Johanna P. Müller, Weitong Zhang +2Medical Visual Question AnsweringQwen3

  19. Stop When Reasoning Converges: Semantic-Preserving Early Exit for Reasoning Models

    May 17, 2026Dehai Min, Giovanni Vaccarino, Huiyi Chen +3Large Reasoning ModelsRedundancy

  20. Auditing Reasoning-Trace Memorization Claims after Unlearning with Head-Conditioned Canaries

    May 17, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangMemorizationDeepseek

  21. When Answers Stray from Questions: Hallucination Detection via Question-Answer Orthogonal Decomposition

    May 14, 2026Siyang Yao, Erhu Feng, Yubin XiaHallucination DetectionAnswer

  22. VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

    May 12, 2026Chenhao Qiu, Yechao Zhang, Xin Luo +2Long Video Question AnsweringTemporal Grounding

  23. Hindsight Hint Distillation: Scaffolded Reasoning for SWE Agents from CoT-free Answers

    May 12, 2026Shengjie Wang, Guanghe Li, Zonghan Yang +1HindsightLong-Horizon Agents

  24. LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

    May 11, 2026Xueqi Cheng, Yushun DongLarge Language Model RoutingMultimodal Large Language Models

  25. Functional Stable Model Semantics and Answer Set Programming Modulo Theories

    May 10, 2026Michael Bartholomew, Joohyung LeeAnswer Set ProgrammingSatisfiability

  26. WASIL: In-the-Wild Arabic Spoken Interactions with LLMs

    May 9, 2026Zien Sheikh Ali, Hamdy Mubarak, Soon-Gyo Jung +3ArabicAnswer

  27. VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer Selection

    May 8, 2026James Petullo, Sonny George, Dylan Cashman +1Reasoning TracesMajority Voting

  28. Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts

    May 8, 2026Yi-Chang Chen, Feng-Ting Liao, Da-shan Shiu +1Reasoning ChainLLM Reasoning Strategies

  29. Inference-Time Budget Control for LLM Search Agents

    May 7, 2026Zhengru Fang, Senkang Forest Hu, Zhonghao Chang +6Question-Answering BenchmarksToken Budget Allocation

  30. DataDignity: Training Data Attribution for Large Language Models

    May 7, 2026Xiaomin Li, Andrzej Banburski-Fahey, Jaron LanierLarge Language Model EvaluationAnswer

  31. The First Token Knows: Single-Decode Confidence for Hallucination Detection

    May 6, 2026Mina GabrielSemantic EntropySelf-Consistency

  32. CLEAR: Revealing How Noise and Ambiguity Degrade Reliability in LLMs for Medicine

    May 1, 2026Kevin H. Guo, Chao Yan, Avinash Baidya +5Large Language Model ReliabilityAnswer

  33. ClipTBP: Clip-Pair based Temporal Boundary Prediction with Boundary-Aware Learning for Moment Retrieval

    Apr 30, 2026Ji-Hyeon Kim, Ho-Joong Kim, Seong-Whan LeeMultimodal AlignmentRepresentation-Alignment Loss

  34. All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

    Apr 27, 2026Leonardo Haw-Yang Foo, Chih-Kai Yang, Chen-An Li +2Large Audio Language ModelsAudio Understanding

  35. Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

    Apr 25, 2026Boqi Chen, Xudong Liu, Yunke Ao +1Constrained DecodingAnswer

  36. Large Language Models Decide Early and Explain Later

    Apr 24, 2026Ayan Datta, Zhixue Zhao, Bhuvanesh Verma +3LLM Reasoning StrategiesChain-of-Thought Reasoning

  37. RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering

    Apr 22, 2026Marisa Hudspeth, Patrick J. Burns, Brendan O'ConnorMultilingual BenchmarkQuestion-Answer Pairs

  38. An Answer is just the Start: Related Insight Generation for Open-Ended Document-Grounded QA

    Apr 21, 2026Saransh Sharma, Pritika Ramu, Aparna Garimella +1Open-Ended ResponsesQuestion-Answering Benchmarks

  39. Streamliners for Answer Set Programming

    Apr 21, 2026Florentina Voboril, Martin Gebser, Stefan Szeider +1Answer Set ProgrammingAnswer

  40. ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering

    Apr 20, 2026Yindong Zhang, Wenmian Yang, Yiquan Zhang +1Real Estate DataJobs

  41. Navigating the Conceptual Multiverse

    Apr 20, 2026Andre Ye, Jenny Y. Huang, Alicia Guo +3Interpretive LayerAnswer

  42. Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

    Apr 16, 2026Nishanth Madhusudhan, Vikas Yadav, Alexandre LacosteMultimodal ReasoningAbstention

  43. Asking What Matters: Reward-Driven Clarification for Software Engineering Tasks

    Apr 16, 2026Sanidhya Vijayvargiya, Vijay Viswanathan, Graham NeubigClarificationElicitation

  44. An Isotropic Approach to Efficient Uncertainty Quantification with Gradient Norms

    Mar 31, 2026Nils Grünefeld, Jes Frellsen, Christian HardmeierUncertainty QuantificationPredictive Uncertainty

  45. Investigating Learner-Aware Design of LLM-Generated Educational Feedback

    Feb 12, 2026Momoka Furuhashi, Kouta Nakayama, Noboru Kawai +3FeedbackMultiple-Choice Questions

  46. Same Answer, Different Representations: Hidden instability in VLMs

    Feb 6, 2026Farooq Ahmad Wani, Alessandro Suglia, Rohit Saxena +6InstabilityAnswer

  47. R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

    Jan 25, 2026Zhuohong Chen, Zhengxian Wu, Zirui Liao +6Knowledge-Based Visual Question AnsweringReranking

  48. Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts

    Oct 10, 2025Xinyi Wang, Jinyi Han, Zishang Jiang +7LLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  49. Explain Before You Answer: A Survey on Compositional Visual Reasoning

    Aug 24, 2025Fucai Ke, Joy Hsu, Zhixi Cai +10Visual ReasoningMultimodal Reasoning