Correctness

Momentum

6 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 64

All topics
CardsList
  1. Locating Answer-Correctness Signals in Frozen Large Language Models

    Sep 29, 2026Yuansen Liu, Yixuan Tang, Anthony Kum Hoe TungFrozen Language ModelCorrectness

  2. Semantic Prefix Oracles for LLM Decoding: Contracts and Differential Validation

    Sep 28, 2026Paul Kronlund-DrouaultContext-Free GrammarsProgram Analysis

  3. Beyond Correctness: Evaluating Semantic Knowledge in Cross-Table Transfer

    Sep 28, 2026Seokyong Sheem, Hochang Lee, Suyeong Lee +1Tabular LearningAblation

  4. Rethinking Correctness for Uncertainty Estimation in Clinical Prediction with Vision-Language Models

    Sep 14, 2026Mingcheng Zhu, Jinning Liang, Tingting ZhuClinical PredictionCorrectness

  5. CodeTD: Topology of Attention Detects Hallucinations in Code LLMs

    Sep 7, 2026Daria Voronkova, Ilya Trofimov, Anton Dmitriev +3Code GenerationCorrectness

  6. Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

    Aug 13, 2026Xinming Wang, Weinong Wang, Hongming Yang +13Multimodal Large Language ModelsResponses

  7. AI Evaluation Should Measure Verification Cost, Not Correctness Alone

    Aug 9, 2026Viviana Crescitelli, Generoso Immediato, Fabio Persia +1Artificial Intelligence EvaluationCorrectness

  8. On the Robustness of LLMs' Internal Representation of Code Correctness

    Aug 8, 2026Francisco Ribeiro, Sohaila Abdulsattar, Renata Gonzalez +2CorrectnessDyads

  9. pAI-Econ-claude: A Gated Human-in-the-Loop Multi-Agent Architecture for AI-Assisted Economic Theory Development

    Jul 23, 2026Chen Zhu, Xiaolu Wang, Weilong ZhangEconomiesHuman-In-The-Loop

  10. Decode-Time Grammars: Constrained LLM Generation over a Refinement Order of Grammar Fragments

    Jul 20, 2026Shuoming Zhang, Ruiyuan Xu, Haofeng Li +7Context-Free GrammarsCode Generation

  11. Diagnosing Correctness Probes under Self-Judgement Confounding

    Jul 18, 2026Yi-Long LuCorrectnessInstruction-Tuned Models

  12. Line-Anchored Feedback Cuts Token Costs and Improves Correctness in AI Code Editing

    Jul 14, 2026William Franz LambertiCorrectnessFeedback

  13. Persona Non Grata: LLM Persona-Driven Generations in MCQA are Unstable in Distinct Dimensions

    Jul 1, 2026César Guerra-Solano, Xiang Lorraine LiArtificial Intelligence PersonasMultiple-Choice Questions

  14. Calibration, Not Compilation: Detecting and Repairing Misspecified Probabilistic Programs Written by Language Models

    Jun 30, 2026Jian Xu, Delu Zeng, John Paisley +1CorrectnessFeedback

  15. Entity Binding Failures in Tool-Augmented Agents

    Jun 29, 2026Rahul Suresh Babu, Shashank IndukuriAgentic Workflow DesignCorrectness

  16. Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving

    Jun 28, 2026Pawan Sasanka Ammanamanchi, Siddharth Bhat, Stella BidermanTheorem ProvingDefect

  17. Correct codes for the wrong reasons? validating LLMs as measurement instruments for theoretical constructs

    Jun 26, 2026Manuel PitaCorrectnessInter-Annotator Agreement

  18. The Signal-Coverage Matrix: Stratifying Type and Semantic Errors in Statement Autoformalization

    Jun 26, 2026Chengxiao Dai, Zhaokun Yan, Zhanhui LinAutoformalizationFormalization

  19. When are likely answers right? On Sequence Probability and Correctness in LLMs

    Jun 25, 2026Johannes Zenn, Jonas GeipingCorrectnessSelf-Consistency

  20. Peeking Inside LLMs: Leveraging Internal Artifacts of LLMs for Enhancing Reliability in Legal Classification

    Jun 18, 2026Sudipta Santra, Debtanu Datta, Saptarshi GhoshLegal Reasoning TasksLegal Domain

  21. Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

    Jun 12, 2026Kirill Vasilevski, Ximing Dong, Benjamin Rombaut +8Code QualityLlm-As-A-Judge

  22. From Correctness to Utility: Gain-Based Prefix Evaluation for LLM Reasoning

    Jun 5, 2026Yuhang Zhou, Yixin Cao, Guangnan YeLLM Reasoning StrategiesProcess Reward Model

  23. TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory

    Jun 4, 2026Ziming WangContradictionConversational Memory

  24. CASS-RTL: Correctness-Aware Subspace Steering for RTL Generation with LLMs

    Jun 4, 2026Mohammad Akyash, Nowfel Mashnoor, Kimia Azar +1Hierarchical Register Transfer Level GenerationRegister Transfer Level

  25. Data Flow Control: Data Safety Policies for AI Agents

    Jun 4, 2026Charlie Summers, Eugene WuTaxonomy-Driven Dataflow ModelData Science Agents

  26. EST-PRM: Stress-Testing Process Reward Models Before They Become Load-Bearing

    May 30, 2026Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter +1Process Reward ModelCorrectness

  27. Inferring Code Correctness from Specification

    May 28, 2026Tambon Florian, Papadakis MikeCode GenerationCorrectness

  28. Spiking the training data to correct for test set contamination

    May 24, 2026Johnny Tian-Zheng Wei, Jerry Li, Ameya Godbole +1Training DataTwo-Sample Testing

  29. From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

    May 22, 2026Ranxu zhang, zeyang li, Jiacheng Huang +5Agentic Reinforcement LearningReward-Only Policy Optimization Variants

  30. Stdlib or Third-Party? Empirical Performance and Correctness of LLM-Assisted Zero-Dependency Python Libraries

    May 20, 2026Peng Ding, Rick StevensPythonCorrectness

  31. What Does It Mean for a Medical AI System to Be Right?

    May 12, 2026Antony GitauCorrectnessInterpretability

  32. Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness

    May 11, 2026Ivo Petrov, Jasper Dekoninck, Dimitar I. Dimitrov +1Research-Level MathematicsProof

  33. SMT-Based Active Learning of Weighted Automata

    May 8, 2026Tiago Ferreira, Kevin Batz, Alexandra SilvaActive LearningAutomata

  34. Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions

    May 7, 2026Chengjie Wang, Jingzheng Wu, Xiang Ling +2Vulnerable CodeCode Quality

  35. Spatiotemporal Hidden-State Dynamics as a Signature of Internal Reasoning in Large Language Models

    May 3, 2026Kotaro Furuya, Takahito TanimuraHidden StatesReasoning Skills

  36. Faithful Autoformalization via Roundtrip Verification and Repair

    Apr 27, 2026Daneshvar Amrollahi, Jerry Lopez, Clark BarrettAutoformalizationLarge Language Model Reliability

  37. Benchmarking Testing in Automated Theorem Proving

    Apr 26, 2026Jongyoon Kim, Hojae Han, Seung-won HwangTheorem ProvingProof

  38. Characterizing Paraphrase-Induced Failures in Lean 4 Autoformalization

    Apr 25, 2026William Feng, Ethan Lou, Aryan SharmaAutoformalizationParaphrasing

  39. You Don't Need Public Tests to Generate Correct Code

    Apr 23, 2026Kaushitha Silva, Srinath PereraTest GenerationCode Generation

  40. Generalizing Numerical Reasoning in Table Data through Operation Sketches and Self-Supervised Learning

    Apr 23, 2026Hanjun Cho, Gahyun Yoo, Hanseong Kim +1Table Reasoning DatasetsSupervised Finetuning

  41. Doubly Saturated Ramsey Graphs: A Case Study in Computer-Assisted Mathematical Discovery

    Apr 23, 2026Benjamin Przybocki, John Mackey, Marijn J. H. Heule +1Theorem ProvingAcyclic Graphs

  42. Are LLM Uncertainty and Correctness Encoded by the Same Features? A Functional Dissociation via Sparse Autoencoders

    Apr 21, 2026Het Patel, Tiejin Chen, Hua Wei +2Large Language Model UncertaintyCorrectness