LLM Answer Verification

LLM: Large Language Model

Momentum

17 papers in the last four weeks, up 113% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 102

All topics
CardsList
  1. Agreement Before Diversity: Verification-First Complementarity for Heterogeneous Language-Model Coordination

    Aug 5, 2026Ruitong Li, Binjie Guo, Aisheng Mo +3LLM EvaluationLLM Answer Verification

  2. VetScore: Risk-Weighted Fact Verification for Veterinary Long-Form QA with Citations

    Aug 4, 2026Ivan Kartáč, Jan Tovarys, Mateusz Lango +1LLM Answer VerificationFactual Consistency Evaluation

  3. AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction

    Jul 31, 2026Rui Zou, Yutao Zhu, Mengqi Wei +1LLM Self-CorrectionLLM Answer Verification

  4. Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets

    Jul 27, 2026Zongyou Yang, Yinghan HouLLM EvaluationLLM Answer Verification

  5. HalluTruthQA: A Fine-Grained Benchmark for Hallucination Detection, Localization, and Explanation in Arabic Question Answering

    Jul 22, 2026Abdessalam Bouchekif, Mohammed-En-Nadhir Zighem, Salah Eddine Bekhouche +9Arabic NLPLLM Answer Verification

  6. Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

    Jul 20, 2026Yitao Wu, Si Shen, Rui Yang +2AI Agent ReliabilityLLM Self-Correction

  7. Grounded verification of chemical and materials reasoning: detection is the bottleneck

    Jul 19, 2026Can Polat, Mustafa Kurban, Erchin Serpedin +1LLM Self-CorrectionLLM Grounding

  8. STEC: Evidence Compression for Deep Search in Open-domain Multi-Hop QA

    Jul 12, 2026Xinkang Li, Rong Jiang, Xin Song +3Multi-Hop QALLM Answer Verification

  9. One Token Is Enough: Fingerprinting and Verifying Large Language Models from Single-Token Output Distributions

    Jul 11, 2026Tomas BrucknerLLM Answer VerificationLLM Auditing

  10. From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b

    Jul 7, 2026Taeyun Roh, Eunha Lee, Wonjune Jang +3LLM Answer VerificationBiomedical QA

  11. LLM-as-a-Verifier: A General-Purpose Verification Framework

    Jul 6, 2026Jacky Kwok, Shulu Li, Pranav Atreya +6LLM Answer VerificationLLM Agent Evaluation

  12. Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

    Jul 6, 2026MY Pitsane, Hope MogaleLLM Answer VerificationLLM Inference

  13. Test-Time Verification for Text-to-SQL via Outcome Reward Models

    Jun 29, 2026Mattia Tritto, Giuseppe Farano, Dario Di Palma +4Reward ModelingLLM Answer Verification

  14. Structural Certification for Reliable Physical Design with Language Models

    Jun 29, 2026Nakul Vyas, Iliya D. StoevLLM Answer VerificationFormal Verification

  15. DEEPMED Search: An Open-Source Agentic Platform for Medical Deep Research with Introspective Verification

    Jun 29, 2026Maolin Liu, Fanyu Xu, Ruoqing Xu +3LLM Answer VerificationAgentic Search

  16. AB-RAG: Adaptive Budgeted Retrieval-Augmented Generation for Reliable Question Answering

    Jun 27, 2026Ansh KamthanRetrieval-Augmented GenerationLLM Answer Verification

  17. Not All Claims Are Equally Risky: FACTOR for Adaptive Verification in Factual Long-Form Generation

    Jun 21, 2026Areeba Hassan, Arooj Kausar, Syeda Kisaa Fatima +2LLM Answer VerificationLong-Form Document Generation