LLM Mathematical Reasoning

LLM: Large Language Model

Momentum

19 papers in the last four weeks, up 375% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 194

All topics
CardsList
  1. Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve

    Aug 4, 2026Denys Pushkin, Albert Q. Jiang, Aryo Lotfi +2LLM PromptingCoT Reasoning

  2. A Human Audit of OpenAIs AI-Generated Mathematical Proofs

    Aug 3, 2026Mikołaj Sienicki, Krzysztof SienickiLLM AuditingHuman Oversight of AI

  3. Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning

    Aug 3, 2026Xuyang Zhao, Liting Zhang, Zichen Xu +4On-Policy Self-DistillationKnowledge Representation

  4. Cloud-ScPO: Hidden-State Geometry for Semi-Supervised Preference Optimization in LLM Reasoning

    Aug 2, 2026Yuzhou Liu, Xiyang HuPreference OptimizationSemi-Supervised Learning

  5. Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs

    Aug 1, 2026Zhenhong Sun, Hanqing Zhao, Yatao Bian +7Test-Time ScalingDiffusion Language Model Decoding

  6. AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction

    Jul 31, 2026Rui Zou, Yutao Zhu, Mengqi Wei +1LLM Self-CorrectionLLM Answer Verification

  7. Albilich: Steerable Proof-State Orchestration for LLM-Based Mathematical Research with CAS Integration

    Jul 30, 2026Ting Gong, Michael Ruofan Zeng, Yong YangAutomated Theorem ProvingAI-Assisted Scientific Research

  8. ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

    Jul 30, 2026Zhenrong Zhang, Fei Wu, Jun Du +2RL for Language Model ReasoningCredit Assignment in RL

  9. A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models

    Jul 28, 2026Vivek Shukla, Varun Shukla, Atul +2CoT FaithfulnessMathematical Reasoning Benchmarks

  10. Case study: proving sqrt(2) irrational with LPTP and an LLM

    Jul 23, 2026Fred Mesnard, Étienne Payet, Wim VanhoofAutomated Theorem ProvingLLM Mathematical Reasoning

  11. Explaining and Tuning Transformer-based LLMs in Arithmetic Tasks with Human Strategies

    Jul 19, 2026Luyu Qiu, Jianing Li, Hwanhee Kim +4Transformer InterpretabilityLanguage Modeling

  12. Trace-Based On-Policy Distillation for Masked Diffusion Language Models

    Jul 18, 2026Haolin Ren, Ziyang Huang, Chenhao Yuan +2Masked Diffusion ModelsDiffusion Model Distillation

  13. Are Arithmetic Heuristic Neurons Form-Invariant? A Mechanistic Analysis of Symbols, Text, and Code in LLMs

    Jul 18, 2026Sharath Naganna, Tanvir Ahmed Sijan, Uddipta KalitaLLM InterpretabilityCircuits in Language Models

  14. CoTu at EXACT 2026: Neuro-Symbolic Reasoning for Transparent Educational QA

    Jul 16, 2026Quoc-Khang Tran, Minh-Thien Nguyen, Phu-An Thai +3Explainable Artificial IntelligenceLLM-Based Program Synthesis

  15. MathCoPilot: An Interactive System for Human-AI Symbiotic Paradigm of Mathematical Research

    Jul 16, 2026Junjie Zhang, Jiayu Liu, Wenbin Liu +11Multi-Agent LLM SystemsAutomated Theorem Proving

  16. GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models

    Jul 14, 2026Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim +2Mathematical Reasoning BenchmarksMultilingual Language Model Evaluation

  17. AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

    Jul 13, 2026Lingkai Kong, Zijian Wu, Yuzhe Gu +11Mathematical Reasoning BenchmarksAutomated Theorem Proving

  18. TreeThink: A Modular Tree Search Library for Mathematical Reasoning with LLMs

    Jul 13, 2026Burak S. Akbudak, Zeynel A. Uluşan, Can S. Erer +1Automated Theorem ProvingTree Search

  19. ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

    Jul 10, 2026Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck +4LLM AgentsMulti-Agent LLMs

  20. From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier

    Jul 8, 2026Eric Jiang, Xiao Liang, Yikai Zhang +16Automated Theorem ProvingInteractive Theorem Proving

  21. MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning

    Jul 8, 2026Charbel Al Bateh, Samer SaabMathematical Reasoning BenchmarksSynthetic Benchmark Generation

  22. Multiplication Beyond Groups: Stratified Fourier Mechanisms in Transformer Circuits

    Jul 8, 2026Zitong Andrew Chen, Junaid Hasan, Akhil Srinivasan +2Transformer InterpretabilityTransformer Attention

  23. Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics

    Jul 7, 2026Pavel Snopov, German MagaiMathematical Reasoning BenchmarksKnowledge Augmentation for Language Models

  24. Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory

    Jul 7, 2026Jihao Liu, Guoxiong Gao, Zeming Sun +8Agent MemoryMulti-Agent Orchestration

  25. PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

    Jul 7, 2026Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl +14Mathematical Reasoning BenchmarksMultilingual Language Model Evaluation

  26. Knowledge Knows, Verbalization Tells: Disentangling Latent Directions for Mathematical Solvability in LLMs

    Jul 6, 2026Nikolaos Xiros, Maria-Eleni Zoumpoulidi, Georgios ParaskevopoulosHallucination in Language ModelsRepresentation Geometry in Language Models

  27. Detecting Answer-Driven Reasoning in LLM-Based Educational Tutors via Truncated Chain-of-Thought Auditing

    Jul 6, 2026Bonan Shen, Dingyan Shang, Youting Wang +1CoT FaithfulnessIntelligent Tutoring Systems

  28. MechMath Agent Team: LLM Driven Agents for Mathematical Research

    Jul 5, 2026Yichuan Cao, Ruichen Qiu, Junqi Liu +5Automated Theorem ProvingMulti-Agent Reasoning