Answer

Momentum

24 papers in the last four weeks, up 50% on the four weeks before. 0.3% of all new papers.

Jul 6Week of Sep 21

Latest papers 181

All topics
CardsList
  1. Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy

    Aug 2, 2026Kaike Ping, Buse Çarık, Caleb Wohn +3SycophancyConfabulation

  2. Sixteen models, fewer than two voices: measuring ensemble dispersion where no answer is uniquely correct

    Jul 31, 2026Mario Vega-Barbas, Lidia Mora-Valenciano, Iván Pau +2DiversityDispersion

  3. HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

    Jul 31, 2026Rongjian Gu, Wengang Zhou, Junyu Xiong +4Visual Document RetrievalAnswer

  4. AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction

    Jul 31, 2026Rui Zou, Yutao Zhu, Mengqi Wei +1LLM Reasoning StrategiesAnswer

  5. RLPF: Reinforcement Learning from Performance Feedback for Code Generation

    Jul 29, 2026Huihao Jing, Haozhe Cui, Wenbin Hu +9Code GenerationFeedback

  6. GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

    Jul 27, 2026Jiacheng Lu, Sinuo Wang, Wentao Zhao +12Finance BenchmarksGrading

  7. Bound-Founded Semantics for Answer Set Programming with Difference Constraints: Preliminary Report

    Jul 23, 2026Pedro Cabalar, Jorge Fandinno, Nicolas Rühling +3Answer Set ProgrammingInequality Constraints

  8. Semantically Similar, Yet Not Answerable: Diagnosing the Semantic-Answerability Gap in Table RAG

    Jul 20, 2026Jiaming Tian, Liyao Li, Wentao Ye +6Hievi-RagTabular Data

  9. DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments

    Jul 19, 2026Jun Nie, Zhiqin Yang, Zhenheng Tang +4Deep ResearchFalsehood

  10. DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

    Jul 15, 2026Brandon Michaels, Brendon JohnsonCitationsExplanation Faithfulness

  11. Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

    Jul 15, 2026Jan Betley, Johannes Treutlein, Jan Dubiński +5Data LeakageValue

  12. LLM Judges Can Be Too Generous When There Is No Reference Answer

    Jul 14, 2026Chalamalasetti Kranti, Sowmya VajjalaLarge Language Model JudgesHuman Judgment

  13. PRISM Edit: One Vector for All Temporal Answers

    Jul 13, 2026Chen Huang, Qi Zheng, Ruiqin Zheng +2Multimodal Knowledge EditingAnswer

  14. STEC: Evidence Compression for Deep Search in Open-domain Multi-Hop QA

    Jul 12, 2026Xinkang Li, Rong Jiang, Xin Song +3Multi-Hop ReasoningMultimodal Query

  15. From ambiguous utterances to governed reuse classes: canonicalization, quotient invariance, and conditional decidability

    Jul 11, 2026Cosimo Spera, Ray GarciaReuseTractability

  16. Two Axes of LLM Abstention: Answer Correctness and Question Answerability

    Jul 9, 2026Benedikt J. WagnerAnswerInstruction-Tuned Models

  17. Answer Set Programming Energised! End-to-End Neurosymbolic Reasoning and Learning with ASP and Energy Based Models

    Jul 9, 2026Jakob Suchan, Julius Monsen, Salim Baloch +1Answer Set ProgrammingNeuro-Symbolic Framework

  18. Final Checkpoints Are Not Enough: Analyzing Latent Reasoning Faithfulness Along Training Trajectories

    Jul 7, 2026Hengyu Jin, Shu Yang, Di WangEfficient Latent ReasoningExplanation Faithfulness

  19. ChatImage: Navigating Long-Form LLM Answers through Interactive Images

    Jul 6, 2026Wencan Jiang, Jiangning Zhang, Yong LiuLarge Language Model ResponsesAnswer

  20. Detecting Answer-Driven Reasoning in LLM-Based Educational Tutors via Truncated Chain-of-Thought Auditing

    Jul 6, 2026Bonan Shen, Dingyan Shang, Youting Wang +1TutorsLLM Reasoning Strategies

  21. Improving LLMs via Validator-to-Generator Alignment

    Jul 2, 2026Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk +1Large Language Model GenerationAnswer

  22. A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory

    Jul 2, 2026Zitong Shi, Yixuan Tang, Anthony Kum Hoe TungLong-Term Agent MemoryArtificial Intelligence Assistants

  23. Budget-Adaptive Routing: Skipping the Weak When the Strong Answers Anyway

    Jun 29, 2026Wei Geng, Nitinder Mohan, Jörg OttAnswer

  24. Travel-Oriented Reasoning Large Language Model via Domain-Specific Knowledge Graphs

    Jun 28, 2026Vignesh Ram Nithin Kappagantula, Shayan Hassantabar, Samuel Simpson +1LLM Reasoning StrategiesJourney

  25. When are likely answers right? On Sequence Probability and Correctness in LLMs

    Jun 25, 2026Johannes Zenn, Jonas GeipingCorrectnessSelf-Consistency

  26. ProvenAI: Provenance-Native Traces of Evidence in Generated Answers

    Jun 24, 2026Mohammad Faizan, Dalal AlharthiCitationsTraceability

  27. video-SALMONN-R3^3: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

    Jun 23, 2026Yixuan Li, Guangzhi Sun, Yudong Yang +1Video UnderstandingAnswer

  28. The Correct Answer Trap: Pedagogically-Grounded Detection and Feedback for Hidden Misconceptions

    Jun 22, 2026Moiz Imran, Sahan BulathwelaStudent MisconceptionsTutors

  29. Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts

    Jun 22, 2026Steven Young EuligArtificial Intelligence ScientistsCorrect

  30. Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME

    Jun 22, 2026Zhichao Fan, Yanhang Li, Zexin ZhuangLong Video Question AnsweringChain-of-Thought Reasoning

  31. Ranking-and-Selection with Multiple Correct Answers and Non-Answerable Estimates

    Jun 20, 2026Qiaoqiao Wang, Wei YouSelection BiasRanking

  32. Answer Engineering: Local Trajectory Editing for Protocol-Constrained Decision Making in Large Language Models

    Jun 19, 2026Victor Lavrenko, Anastasiia MolodnitskaiaAnswerEngineering

  33. Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

    Jun 17, 2026Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin +10Vision-Language Foundation ModelsTask Success Rate

  34. See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

    Jun 16, 2026Yilian Liu, Sicong Leng, Guoshun Nan +7Visual EvidenceMultimodal Large Language Models

  35. Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs

    Jun 14, 2026Nafiseh Nikeghbal, Amir Hossein Kargaran, Shaghayegh Kolli +1FlipsAnswer

  36. Beyond the Commitment Boundary: Probing Epiphenomenal Chain-of-Thought in Large Reasoning Models

    Jun 11, 2026Daniel Scalena, Sara Candussio, Luca Bortolussi +3Chain-of-Thought ReasoningInference-Time

  37. Semantic Grading of Written Answers in Low-Resource Language Bangla Using a Fine-Tuned Lightweight Language Model

    Jun 10, 2026Meherun Farzana, Aniket Joarder, Mahmudul Hasan +1BanglaGrading

  38. Towards Fully Automated Exam Grading: Fairness-Aware Recognition of Handwritten Answers with Foundation Models

    Jun 9, 2026Hartwig GrabowskiGradingHandwriting

  39. Answer Presence Drives RAG Rewriting Gains

    Jun 4, 2026Yuejie Li, Yueying Hua, Ke Yang +8RewriteAnswer

  40. Boosting Self-Consistency with Ranking

    Jun 3, 2026Maria Marina, Daniil Moskovskiy, Sergey Pletenev +3Self-ConsistencyQuestion-Answering Benchmarks