LLM Answer Verification

LLM: Large Language Model

Momentum

17 papers in the last four weeks, up 113% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 102

All topics
CardsList
  1. Halluscoring 2026: The first shared task on llms hallucination detection and answer verification

    Sep 29, 2026Aisha Alansari, Abdessalam Bouchekif, Ahmed Hasanaath +9LLM EvaluationLLM Answer Verification

  2. Locating Answer-Correctness Signals in Frozen Large Language Models

    Sep 29, 2026Yuansen Liu, Yixuan Tang, Anthony Kum Hoe TungLLM Answer VerificationLanguage Model Error Detection

  3. Test-Time Scaling via Budgeted Multi-Attribute Verification

    Sep 28, 2026Bo Xue, Ji Cheng, Shen-Huan Lyu +2Multi-Armed BanditsLLM Answer Verification

  4. Knowing Is Not Choosing: What Explicit Verification Adds Beyond Generative Preference

    Sep 27, 2026Yilong Li, Chengpo Yan, Aayan Arish +1LLM EvaluationLLM Answer Verification

  5. Return or Revise? Learning When Revision Helps Retrieval-Augmented QA

    Sep 24, 2026Nicholas Kashani Motlagh, Tim Anderson, Jeremy Gwinnup +1Retrieval-Augmented GenerationLLM Answer Verification

  6. Cross-Lingual Legal QA for Vietnamese Labour Law: Retrieval, Translation, and Verifier-Guided Correction

    Sep 23, 2026Nguyen Minh Chi, Mo El-Haj, Nguyen Ha Thanh +2LLM Answer VerificationLegal Citation Verification

  7. Human-LLM Deliberation as Interactive Proof: Conditions for Verifiability Without Transparency

    Sep 21, 2026Baotong Zhang, Dean Foster, João SedocLLM Answer VerificationAnytime-Valid Inference

  8. From Tables to Quantified Statements: Evaluating LLM Inference Generation through Executable Verification

    Sep 21, 2026Mai Mohamed Eida, Gunjan Anand, Ayush Singh +1Table QALLM Evaluation

  9. LLM-as-an-Improver: Turning Verification into Better Candidates

    Sep 17, 2026Akiyoshi Tomihari, Yuma IchikawaLLM Answer VerificationLLM Reranking

  10. Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering

    Sep 14, 2026Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah +1LLM GroundingLLM Answer Verification

  11. A decision-basis contract for auditable LLM-assisted medical billing verification: deterministic rules, verbatim evidence, and fail-closed abstention

    Sep 14, 2026Jan Hölter, Kevin Geis, Benjamin Raab +1LLM Answer VerificationLLM Auditing

  12. Can LLMs in Draft-Verify-Revise Pipelines Resolve Deictic Ambiguity?

    Sep 14, 2026Obinna I. EkekezieCoreference ResolutionLLM Answer Verification

  13. MedSNIP: Building and Benchmarking Snippet-Level Granularity for Medical Fact Verification

    Sep 14, 2026Hasan Iqbal, Sarfraz Ahmad, Hyunjae Kim +5LLM Answer VerificationAutomated Fact-Checking

  14. NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment

    Sep 12, 2026Guoqiang Zhang, Kexin Tan, Ming Zhang +12LLM EvaluationLLM Answer Verification

  15. GANDR: Claim Auditing for Verifiable Legal Answer Generation

    Sep 9, 2026Chen Qian, Yimeng Wang, Yu Chen +2LLM Answer VerificationLegal Citation Verification

  16. How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation

    Sep 1, 2026Elitsa Yotkova, Violeta Kastreva, Petar Velkov +4LLM Answer VerificationLanguage Model Generation Evaluation

  17. The Answer Is Not the Argument

    Aug 31, 2026Will Yeadon, Sergio Juárez, Paul Mackay +5LLM Answer VerificationCoT Monitoring

  18. HSRM: Hidden-State Reward Models for Test-Time Verification

    Aug 31, 2026Xianzhi Li, Xiaodan ZhuLLM Answer VerificationEfficient Language Model Reasoning

  19. CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA

    Aug 13, 2026Fatema Tuj Johora Faria, Mukaffi Bin Moin, Jubayer Al Mahmud +2LLM Answer VerificationLLM Hallucination Mitigation

  20. Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

    Aug 11, 2026Uma Ranjan, Kunal Tilaganji, Aditya Koul +9LLM GroundingLLM Answer Verification

  21. SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification

    Aug 9, 2026Wenyao Cui, Huaping Zhang, Yongyi Huang +6CoT FaithfulnessLLM Answer Verification

  22. Don't `Well, Actually' Me Unless You Know What You're Talking About: Weak Presupposition Verification Degrades General QA Performance

    Aug 6, 2026Shenran Wang, Vered Shwartz, Hila GonenLLM EvaluationLLM Answer Verification

  23. RepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists

    Aug 5, 2026Yuexi Yang, Alyssa Wu, Ji Luo +4Software EngineeringLLM Evaluation

  24. TriQua: Reconciling Granularity and Context in Factuality Evaluation

    Aug 5, 2026Jin Liu, Steffen Thoma, Achim RettingerLLM Answer VerificationFactual Consistency Evaluation