LLM Abstention

LLM: Large Language Model

Momentum

11 papers in the last four weeks, up 120% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 61

All topics
CardsList
  1. Arctic Questions, Missing Answers: A Dataset and Benchmark for LLM Abstention in Arctic Science

    Oct 7, 2026Benjamin Wilcox, Dawei Gao, Pradeeban Kathiravelu +3LLM AbstentionLLM Evaluation

  2. Knowing When Not to Answer: Cross-Domain and Multi-Turn Generalization of Latent Underspecification Signals

    Oct 6, 2026Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov +6Multi-Turn Dialogue EvaluationLanguage Model Probing

  3. Penalty-Framed No-Valid-Option MCQA: Analyzing LLM Abstention under Invalid Choices

    Oct 6, 2026Jinhyeok Kim, Hye-Young JungLLM EvaluationMultiple-Choice Question Answering

  4. Rethinking Faithfulness in LLMs: A Pairwise Context-Sensitive Perspective

    Oct 6, 2026Zizhuo Zhang, Xiong Peng, Jingwei Sun +3Contextual FaithfulnessLLM Evaluation

  5. Decide, Ask, or Defer: Clinical LLMs under Incomplete Evidence

    Oct 3, 2026Mingzhan Yang, Weili WuClinical Decision-MakingClinical Language Model Evaluation

  6. A Citation-Grounded Benchmark for Trustworthy Earnings Call Transcript Analysis with Large Language Models

    Oct 1, 2026Yingzhu Zhao, Vlad Pandelea, Han Yuan +4LLM EvaluationFinancial QA

  7. When the Right Answer Is Missing: An Arithmetic-Dependent Rejection Bottleneck in Jev

    Sep 30, 2026Jike Zhong, Ming Li, Yuxiang LaiNumerical Reasoning in Language ModelsSelective Prediction

  8. The Commit-Abstain Circuit: Why Language Models Hallucinate Instead of Abstaining

    Sep 26, 2026Vy Nguyen, Ziqi Xu, Jeffrey Chan +5Hallucination in Language ModelsCircuits in Language Models

  9. Meet, Compare, or Abstain: LatWeave for Deterministic Multi-Hop Question Answering on Knowledge Lattices

    Sep 23, 2026Yuze Ren, Shaoheng Fan, Tao Wang +2Multi-Hop QAQuestion Answering

  10. When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control

    Sep 15, 2026Ali ŞenolSelective PredictionLLM Prompting

  11. A decision-basis contract for auditable LLM-assisted medical billing verification: deterministic rules, verbatim evidence, and fail-closed abstention

    Sep 14, 2026Jan Hölter, Kevin Geis, Benjamin Raab +1LLM Answer VerificationLLM Auditing

  12. CHARM: Character Hallucination for Multicultural Role Play Benchmark

    Sep 1, 2026Sunkyung Han, Nahyeon Park, Gaeun Seo +2LLM EvaluationLarge Language Model-Based Role-Play Simulation

  13. Compression-Aware Abstention: Teaching LLMs to Refuse When KV-Compression Masks Remove Answer Evidence

    Aug 30, 2026Mohammadali Khodabandehlou, Bhaskar KrishnamachariLLM Hallucination MitigationKV Caching

  14. Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation

    Aug 30, 2026Nishant Balepur, Paiheng Xu, Wei Ai +3LLM EvaluationMultiple-Choice Question Answering

  15. When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information

    Aug 10, 2026Maryam Tahermazandarani, Adnan Mahmood, Fahmida Islam +1Hallucination in Language ModelsLLM Uncertainty Estimation

  16. REIN: Bridging the Gap between Reasoning and Reliability via Reflection and Abstention Alignment

    Aug 8, 2026Zhengze Huang, Luyang Yu, Di Hong +5LLM Hallucination MitigationLLM Reliability

  17. CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

    Aug 7, 2026Veronica Chatrath, Bryan Zhu, George Pu +16Evidence-Grounded ReasoningClinical Reasoning

  18. HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning

    Aug 2, 2026Jianan Xie, Xin Sun, Zhongqi Chen +3Multi-Hop QAAI Agent Benchmarks

  19. Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

    Jul 31, 2026Xujun Che, Yuchen Yuan, Weida Zhao +1Reinforcement LearningKL-Regularized RL

  20. The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling

    Jul 4, 2026Stefan Broecker, Mason del Rosario, Boris Selitser +1AI Agent ReliabilityLLM Agent Evaluation

  21. Agentic Abstention: Do Agents Know When to Stop Instead of Act?

    Jun 27, 2026Han Luo, Bingbing Wen, Lucy Lu WangLLM Agent EvaluationLLM Abstention