LLM Answer Verification

LLM: Large Language Model

Momentum

17 papers in the last four weeks, up 113% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 102

All topics
CardsList
  1. EvidenceLens: A Claim-Evidence Matrix for Auditing Financial Question Answering

    Jun 19, 2026Fengchen Gu, Xiaotian Ren, Zhengyong Jiang +6Data VisualizationLLM Answer Verification

  2. REVES: REvision and VErification--Augmented Training for Test-Time Scaling

    Jun 17, 2026Yuanxin Liu, Ruida Zhou, Xinyan Zhao +6LLM Self-CorrectionLLM Answer Verification

  3. ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents

    Jun 16, 2026Ander Alvarez, Santhiya Rajan, Samuel Mugel +1LLM Answer VerificationData Provenance

  4. Let LLMs Judge Each Other: Multi-Agent Peer-Reviewed Reasoning for Medical Question Answering

    Jun 13, 2026Zaifu Zhan, Shuang Zhou, Rui ZhangMulti-Agent LLM SystemsLLM Answer Verification

  5. MoCA-Agent: A Market-of-Claims Code Agent for Financial and Numerical Reasoning

    Jun 10, 2026Abdelrahman Abdallah, AbdelRahim A. Elmadany, Sameh Al Natour +3Table QALLM Answer Verification

  6. Deterministic Integrity Gates for LLM-Assisted Clinical Manuscript Preparation: An Auditable Biomedical Informatics Architecture

    Jun 8, 2026Yoojin Nam, Jinhoon Jeong, Namkug KimLLM Answer VerificationLLM Auditing

  7. Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification

    Jun 2, 2026Jiahui Li, Jianfeng Shan, Wenpei Chen +5Reinforcement LearningLLM Answer Verification

  8. Diagnosing LLM Arbitration Behavior over Pre-evidence Epistemic States in RAG-based Fact-Checking

    May 31, 2026Yuxi Sun, Wenbo Shang, Wei Gao +2Retrieval-Augmented GenerationLLM Evaluation

  9. Protocol for evaluating ChatGPT in biomedical association generation and verification using a RAG-enabled, cross-model majority voting workflow

    May 28, 2026Ahmed Abdeen Hamed, Luis M. RochaLLM EvaluationLLM Answer Verification

  10. Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning

    May 27, 2026Pauline Bourigault, Xiaotong Ji, Matthieu Zimmer +2LLM Answer VerificationSelective Prediction

  11. Neuro-Symbolic Verification of LLM Outputs for Data-Sensitive Domains (extended preprint)

    May 26, 2026Paul Sigloch, Christoph BenzmüllerLLM Answer VerificationLLM Hallucination Detection

  12. StepGap: A Hybrid NLI-LLM Checker for Step-Level Evidence-Gap Detectionin Multi-Hop Question Answering

    May 23, 2026Yuelyu Ji, Zhuochun Li, Hui Ji +1Multi-Hop QALLM Answer Verification

  13. Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning

    May 15, 2026Shireen Kudukkil Manchingal, Abhey Kalia, Fernanda Gonçalves +1LLM Answer VerificationEnergy-Based Models

  14. Grounded Continuation: A Linear-Time Runtime Verifier for LLM Conversations

    May 13, 2026Qisong He, Jinwei Hu, Xinmiao Huang +3Belief RevisionLLM Grounding

  15. Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

    May 11, 2026Ruinan Jin, Beidi Zhao, Myeongkyun Kang +2VLM EvaluationVision-Language Models

  16. DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

    May 9, 2026Xiang Feng, Jiawei Zhou, Zhangfeng Huang +6LLM GroundingLLM Answer Verification

  17. Logic-Regularized Verifier Elicits Reasoning from LLMs

    May 7, 2026Xinyu Wang, Changzhi Sun, Lian Cheng +4LLM EvaluationLLM Answer Verification

  18. SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation

    May 5, 2026Jingxi Qiu, Zeyu Han, Cheng HuangRetrieval-Augmented GenerationLLM Answer Verification

  19. FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification

    Apr 26, 2026Dongxin Guo, Jikun Wu, Siu Ming YiuLLM Answer VerificationFinancial QA

  20. Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity

    Apr 24, 2026Erez Yosef, Oron Anschel, Shunit Haviv Hakimi +4Mathematical Reasoning BenchmarksLLM Evaluation