LLM Mathematical Reasoning

LLM: Large Language Model

Momentum

19 papers in the last four weeks, up 375% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 194

All topics
CardsList
  1. RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning

    Jun 5, 2026Yongliang Miao, Fengyuan Liu, Wei Shi +4Supervised Fine-TuningLLM Mathematical Reasoning

  2. Benchmarks in Leipzig

    Jun 4, 2026Andrei Balakin, Miklós Bóna, Marie-Charlotte Brandenburg +45Mathematical Reasoning BenchmarksLLM Evaluation

  3. Critic-Guided Heterogeneous Multi-Agent Reasoning for Reliable Mathematical Problem Solving

    Jun 4, 2026Muhammad Talha Sharif, Abdul RehmanLLM Self-CorrectionMulti-Agent Reasoning

  4. Evaluation of LLMs for Mathematical Formalization in Lean

    Jun 4, 2026Tyson Klingner, Drew Bladek, Escher Crawford +6LLM EvaluationLean Theorem Proving

  5. Arithmetic Pedagogy for Language Models

    Jun 3, 2026Andhika Bernard Lumbantobing, Hokky SitungkirNumerical Reasoning in Language ModelsLanguage Model Pretraining

  6. CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions

    Jun 2, 2026Sherin Muckatira, Jesse Geneson, Slava Gerovitch +3Mathematical Reasoning BenchmarksLLM Mathematical Reasoning

  7. PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models

    Jun 2, 2026Zetian Ouyang, Linlin Wang, Gerard de Melo +1Numerical Reasoning in Language ModelsMathematical Reasoning Benchmarks

  8. Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks

    Jun 2, 2026Malia Barker, Bishal Lakha, Edoardo Serra +1Numerical Reasoning in Language ModelsMathematical Reasoning Benchmarks

  9. Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning

    Jun 2, 2026Ziyue Wang, Aomufei Yuan, Yongfu Zhu +10LLM AlignmentRL for Language Model Reasoning

  10. GTBench: A Curriculum-Grounded Benchmark for Evaluating LLMs as Mathematical Research Assistants in Graph Theory

    Jun 2, 2026Noujoud Nader, Ibrahem Aljabea, Patrick Diehl +1Mathematical Reasoning BenchmarksLLM Reasoning with Graphs

  11. eMoT: evolving Memory-of-Thought via Symbolic Anchoring and Memory Corrosion

    Jun 1, 2026Xiang Li, Jiwei Wei, Ke Liu +5Memory-Augmented Language ModelsLLM Mathematical Reasoning

  12. KACE: Knowledge-Adaptive Context Engineering for Mathematical Reasoning

    May 30, 2026Jayant Parashar, Suchendra M. BhandarkarMemory-Augmented Language ModelsSelf-Consistency Decoding

  13. The Shape of Addition: Geometric Structures of Arithmetic in Large Language Models

    May 29, 2026Liuyuan Wen, Xun Zhu, Lihao Huang +2Neural Representation GeometryLLM Interpretability

  14. Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning

    May 28, 2026Shaojie Wang, Liang ZhangLLM PlanningStructured Reasoning

  15. DenseSteer: Steering Small Language Models towards Dense Math Reasoning

    May 28, 2026Yang Ouyang, Shuhang Lin, Jung-Eun KimSmall Language ModelsActivation Steering

  16. When RL Suppresses Its Own Vocabulary: Recovering Reasoning Diversity in Puzzle-to-Math Transfer

    May 28, 2026Mayug Maniparambil, Arjun Karuvally, Terrence Sejnowski +1RL for Language ModelsRL for Language Model Reasoning

  17. Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning

    May 27, 2026Pauline Bourigault, Xiaotong Ji, Matthieu Zimmer +2LLM Answer VerificationSelective Prediction

  18. ResearchMath-14K: Scaling Research-Level Mathematics via Agents

    May 27, 2026Guijin Son, Seungyeop Yi, Minju Gwak +3Supervised Fine-TuningLLM Mathematical Reasoning

  19. ReverseMath: Answer Inversion for Scalable and Verifiable Mathematical Problem Generation

    May 26, 2026Raoyuan Zhao, Yihong Liu, Yupei Du +2Mathematical Reasoning BenchmarksSynthetic Benchmark Generation

  20. Advancing Mathematics Research with AI-Driven Formal Proof Search

    May 21, 2026George Tsoukalas, Anton Kovsharov, Sergey Shirobokov +18Automated Theorem ProvingAI Agent Evaluation