Mathematical Reasoning

Momentum

17 papers in the last four weeks, against 2 the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 113

All topics
CardsList
  1. PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models

    Jun 2, 2026Zetian Ouyang, Linlin Wang, Gerard de Melo +1Numerical Reasoning in Language ModelsMathematical Reasoning Benchmarks

  2. Iteris: Agentic Research Loops for Computational Mathematics

    Jun 1, 2026Leheng Chen, Zihao Liu, Wanyi He +1Mathematical ReasoningLarge Language Model-Guided Scientific Discovery

  3. Fighting Numerical Hallucinations via Data-centric Compilation for Online Financial QA

    May 29, 2026Hao Chen, Xing Tang, Qirui Liu +6Retrieval-Augmented GenerationHallucination in Language Models

  4. Distilling LLM Feedback for Lean Theorem Proving

    May 29, 2026Gaetan Narozniak, Gérard Biau, Rémi Munos +2RL for Language Model ReasoningMathematical Reasoning

  5. The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion Models

    May 27, 2026Dueun Kim, Albert NoMasked Diffusion ModelsLanguage Model Decoding

  6. Skill-Conditioned Gated Self-Distillation for LLM Reasoning

    May 27, 2026Jiazhen Huang, Xiao Chen, Xiao Luo +3Mathematical ReasoningSelf-Distillation

  7. GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

    May 25, 2026Yingji Zhang, Yong Dai, André FreitasLatent Visual ReasoningMathematical Reasoning

  8. Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning

    May 21, 2026Hongbin Zhang, Chaozheng Wang, Kehai Chen +4On-Policy Self-DistillationMathematical Reasoning

  9. When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning

    May 20, 2026Xiaogeng Liu, Xinyan Wang, Yingzi Ma +2CoT DistillationOn-Policy Self-Distillation

  10. Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction

    May 20, 2026Juncheng Hu, Jiawei Du, Xin Zhang +1Mathematical ReasoningLLM Mathematical Reasoning

  11. LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning

    May 15, 2026Shradha Agarwal, Deepak Rajbhar, Tariq JMathematical Reasoning BenchmarksLLM Evaluation

  12. From LLM-Generated Conjectures to Lean Formalizations: Automated Polynomial Inequality Proving via Sum-of-Squares Certificates

    May 14, 2026Ruobing Zuo, Hanrui Zhao, Gaolei He +2Mathematical ReasoningNeuro-Symbolic Reasoning

  13. Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

    May 12, 2026Chi Zhang, Haibo Qiu, Qiming Zhang +3RL for Language Model ReasoningAdversarial Attacks on LLMs

  14. Hilbert-Geo: Solving Solid Geometric Problems by Neural-Symbolic Reasoning

    May 11, 2026Ruoran Xu, Haoyu Cheng, Bin Dong +1Symbolic ReasoningMultimodal Reasoning

  15. On-Policy Distillation with Best-of-N Teacher Rollout Selection

    May 10, 2026Ke Zhang, Yunjie Tian, Dongdi Zhao +4CoT DistillationBest-of-N Sampling

  16. Crosslingual On-Policy Self-Distillation for Multilingual Reasoning

    May 10, 2026Yihong Liu, Raoyuan Zhao, Michael A. Hedderich +1On-Policy Self-DistillationCross-Lingual Reasoning in Language Models

  17. Memorize Theorems, Not Instances: Probing SFT Generalization through Mathematical Reasoning

    May 10, 2026Ruiying Peng, Mengyu Yang, Jing Lei +3Supervised Fine-TuningMemorization in Language Models

  18. Re2^2Math: Benchmarking Theorem Retrieval in Research-Level Mathematics

    May 9, 2026Zicheng Lyu, Wenjie Yang, Shengzhong Zhang +1Mathematical Reasoning BenchmarksLLM Evaluation

  19. MathConstraint: Automated Generation of Verified Combinatorial Reasoning Instances for LLMs

    May 8, 2026Viresh Pati, Zhengyu Li, Piyush Jha +3Mathematical Reasoning BenchmarksSynthetic Benchmark Generation

  20. Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR

    May 8, 2026Yash Ingle, Jaival Chauhan, Ankit Yadav +1Reinforcement LearningRL for Language Model Reasoning

  21. AGPO: Asymmetric Group Policy Optimization for Verifiable Reasoning and Search Ads Relevance at JD

    May 7, 2026Yang Xu, Kun Yao, Yiming Deng +3RL for Language Model ReasoningPolicy Optimization

  22. JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR

    Apr 28, 2026Xinjie Chen, Biao Fu, Jing Wu +4RL for Language Model ReasoningMathematical Reasoning