Self-Verification

Momentum

7 papers in the last four weeks, up 40% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 43

All topics
CardsList
  1. Agents Are Systems, Not Models: Rethinking Agentic Evaluation

    Oct 1, 2026Luis Wiedmann, Leander Girrbach, Cordelia Schmid +1Agentic EvaluationsSelf-Verification

  2. When the Right Answer Is Missing: An Arithmetic-Dependent Rejection Bottleneck in Jev

    Sep 30, 2026Jike Zhong, Ming Li, Yuxiang LaiRejectionAnswer

  3. Can Terminal Agents Trust Their Own Verification? Diagnosing and Improving Self-Verification

    Sep 30, 2026Yingfeng Luo, Shaowei Wei, Daixin Wang +7Self-VerificationIterative Self-Correction

  4. DScale: Scaling Block-Diffusion Speculative Decoding with Adaptive Verification

    Sep 29, 2026Rongjian Chen, Minxian Xu, Zhengxin Fang +2Speculative DecodingDiffusion Language Models

  5. Performance, Efficiency and Collapse -- Advantages and Challenges in Offline Post-training of Code LLMs

    Sep 14, 2026Abhinav Anand, Sanjana Reddy Pachika, Shweta Verma +1Reinforcement Learning Post-TrainingLarge Language Model Training

  6. Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward

    Sep 9, 2026Eshwar Reddy M, Sourav KarmakarReasoning BenchmarkSelf-Verification

  7. Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning

    Sep 7, 2026Vishwas Sathish, Viresh Ranjan, Xinliang Zhu +2Multimodal AgentsAgentic Reasoning

  8. Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs

    Aug 12, 2026Vu Duc Anh, Nhat M. Hoang, Do Xuan Long +3Iterative Self-CorrectionLLM Reasoning Strategies

  9. Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

    Aug 10, 2026Rohan Bhagra, Mahantesh Halapannavar, Uddhav BhattaraiLarge Language Model PlanningRobot Autonomy

  10. Detecting Clear Contact Lenses for Iris Recognition: A Two-Stage Mask-Guided Attention Approach

    Aug 10, 2026Parisa Farmanifard, Arun RossLensSelf-Verification

  11. EA-Graph: Artifact-Anchored Verification Memory for Coding Agents under Upstream Drift

    Aug 4, 2026Hwai-Jung Hsu, Cheng-Jan Chi, Hanna EverettVersionSelf-Verification

  12. Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

    Jul 20, 2026Yitao Wu, Si Shen, Rui Yang +2Verification FrameworkSelf-Verification

  13. DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments

    Jul 19, 2026Jun Nie, Zhiqin Yang, Zhenheng Tang +4Deep ResearchFalsehood

  14. Random Parameter Noise Does Not Make Exact ReLU Verification Easy

    Jul 15, 2026Mojtaba SoltanalianNeural Network VerificationRectified Linear Unit Networks

  15. SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning

    Jul 13, 2026Mingyuan Wu, Jingcheng Yang, Shengyi Qian +11Multimodal ReasoningSelf-Verification

  16. Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift

    Jul 10, 2026Dan C. Hsu, Luke LuLarge Language Model AgentsSelf-Verification

  17. FOI-O: An NZ-first ontology and verification methods package for Freedom of Information process modelling

    Jul 3, 2026Dylan A MordauntOntologySelf-Verification

  18. Not All Claims Are Equally Risky: FACTOR for Adaptive Verification in Factual Long-Form Generation

    Jun 21, 2026Areeba Hassan, Arooj Kausar, Syeda Kisaa Fatima +2FactsLong-Form Generation

  19. AutoACSL: Synthesizing ACSL Specifications by Integrating LLMs with CPG-Based Static Analysis

    Jun 18, 2026Han Zhou, Yu Luo, Dianxiang XuProgram AnalysisLlm-Driven Code Synthesis

  20. What Benchmarks Don't Measure: The Case for Evaluating Abstention Competence in Autonomous Agents

    Jun 1, 2026Victor Ojewale, Suresh VenkatasubramanianAgentic EvaluationsAutonomous Agents

  21. FABSVer: Faster Training and Better Self-Verification for LLM Mathematical Reasoning

    May 27, 2026Haihui Pan, Junwei Bao, Hongfei Jiang +1Mathematical ReasoningSelf-Verification

  22. FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration

    May 19, 2026Yaojie Zhang, Jianuo Huang, Junlong Ke +5Speculative DecodingBlock-Diffusion Drafter

  23. Stress-Testing Neural Network Verifiers with Provably Robust Instances

    May 16, 2026David Troxell, Yulia Alexandr, Sofia Hunt +2Neural Network VerificationVerification Framework

  24. Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

    May 11, 2026Ruinan Jin, Beidi Zhao, Myeongkyun Kang +2Medical Visual Question AnsweringSelf-Verification

  25. Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone

    May 6, 2026Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka +1Model EvaluationArtificial Intelligence Alignment

  26. Making Every Verified Token Count: Adaptive Verification for MoE Speculative Decoding

    May 1, 2026Lehan Pan, Ziyang Tao, Ruoyu Pang +3Speculative DecodingAutoregressive Decoding

  27. SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete Execution

    Apr 20, 2026Woojin Lee, Jin-Xia HuangLlm-Driven Code SynthesisCode Optimization

  28. Reasoning on the Manifold: Bidirectional Consistency for Self-Verification in Diffusion Language Models

    Apr 17, 2026Jiaoyang Ruan, Xin Gao, Yinda Chen +5Diffusion Language ModelsLLM Reasoning Strategies

  29. Reasoning Shift: How Context Silently Shortens LLM Reasoning

    Apr 1, 2026Gleb Rodionov, Roman Garipov, George YakushevLLM Reasoning StrategiesLarge Reasoning Models

  30. Can Coding Agents Migrate to Post-Quantum Cryptography?

    Dec 15, 2025Abdulmalik AlquwayfiliPost-Quantum CryptographyCoding Agents

  31. Hybrid Sequence Modeling and Reinforced Verification for Controllable Target-Conditioned Decision Making

    Aug 22, 2025Yue Pei, Hongming Zhang, Chao Gao +7Goal-Conditioned Value FunctionGoal-Conditioned Reinforcement Learning

  32. Few shot chain-of-thought driven reasoning to prompt LLMs for open ended medical question answering

    Mar 7, 2024Saeel Sandeep Nachane, Ojas Gramopadhye, Prateek Chanda +5Clinical Reasoning TrainingClinical