Mathematical Reasoning Benchmarks

Momentum

13 papers in the last four weeks, up 117% on the four weeks before. 0.2% of all new papers.

Jul 6Week of Sep 21

Latest papers 101

All topics
CardsList
  1. Improving Math Reasoning through Value-guided Informative Search

    Oct 1, 2026Shaohuai Liu, Yuning Wu, Haoran Liu +3Mathematical Reasoning BenchmarksReinforcement Learning With Verifiable Reward

  2. Reason in Style: Discovering and Controlling Style in Language Models

    Sep 30, 2026Ioana Marinescu, Eric Karl Oermann, Kyunghyun ChoStylistic FidelityStyle

  3. Exploring More, Reasoning Better: Stepwise Risk-Sensitive GRPO for Diffusion Language Models

    Sep 30, 2026Yue YU, Bowen Zuo, David Crandall +2Diffusion Language ModelsLarge Language Model Reinforcement Learning

  4. Correct Answers, Invalid Traces: What Verifiable Grade-School Math Reveals About Chain-of-Thought Traces

    Sep 29, 2026Ratish Puduppully, Pranabendu Misra, Paarth Iyer +3Reasoning TracesChain-of-Thought Reasoning

  5. From Dissonance to Orchestration: Teacher Intervention in On-Policy Distillation

    Sep 29, 2026Yuhao Wang, Ruiyang Ren, Yinan Zhang +3TeacherMathematical Reasoning Benchmarks

  6. Selecting Diverse SFT Traces Improves Post-RL Generalization

    Sep 27, 2026Dylan Zhang, Mingyuan Wu, Jinning LiSupervised FinetuningReasoning Paths

  7. Multimodal Thinking with Renderable Programs

    Sep 24, 2026Sunli Chen, Ding Zhong, Ziqiao Ma +6Scalable Vector GraphicMathematical Reasoning Benchmarks

  8. Planned Test-Time Scaling with Coordinated Reasoning Paths

    Sep 23, 2026Xueqing Wu, Langxing Bai, Hritik Bansal +5Test-Time ScalingTest Time

  9. Giving Credit Where It's Due: Redundancy-Aware Learning for Efficient Reasoning

    Sep 22, 2026Yuqing Zhou, Hong Wang, Manqing Mao +8Reasoning TracesMathematical Reasoning Benchmarks

  10. Math Reasoning in LLMs is Organized by Approach, Not Topic

    Sep 22, 2026Sajad Goudarzi, Samaneh Zamanifard, Moloud Nasiri +1Mathematical Reasoning BenchmarksLarge Language Model Tool Use

  11. iSDFT: Information-Proximal Self-Distillation for Continual Learning in LLMs

    Sep 21, 2026Ahmed Khaled Khamis, Xiaotong Ji, Hassan Jaber +4Self-Distillation FrameworkSelf-Teacher

  12. Voice of Reason: Reinforcement Learning for Spoken Math

    Sep 16, 2026Timothée Weisselberger, Edouard Graves, Alexandre DéfossezSpeech Language ModelsMathematical Reasoning Benchmarks

  13. Which Tokens Should SFT Actually Learn? A Token-Trimming Perspective on Mathematical Reasoning

    Sep 9, 2026Yaning Jia, Chunhui Zhang, Wenxuan Xu +3Supervised FinetuningMathematical Reasoning Benchmarks

  14. Learning What to Practice: Diagnosis-Guided Self-Evolution for Language Models

    Sep 1, 2026Xincheng Wei, Yifan Ding, Fucheng Xiong +6Self-EvolutionMathematical Reasoning Benchmarks

  15. Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement

    Aug 13, 2026Aoxin NiMathematical Reasoning BenchmarksFundamental Limits

  16. Mismatch Matters: On-Policy Distillation Beyond Token Agreement

    Aug 10, 2026Zichao Yu, Chengzhi Yu, Shengze Xu +4TeacherMismatch

  17. Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation

    Aug 10, 2026Yuki Ichihara, Naoto Iwase, Mohammad Atif Quamar +1TeacherPrivileged Context

  18. PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation

    Aug 9, 2026Yangyang Feng, Zhuoyan Feng, Junlan ChenSingle TrajectoryMathematical Reasoning Benchmarks

  19. RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer

    Aug 6, 2026Xinye Wang, Junxiao Liu, Shujian HuangLLM Reasoning StrategiesUnsupervised On-Policy Self-Distillation

  20. Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning

    Aug 3, 2026Xuyang Zhao, Liting Zhang, Zichen Xu +4Mathematical Reasoning BenchmarksPrivileged Context

  21. TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs

    Aug 1, 2026Dahai Yu, Lin Jiang, Rongchao Xu +1Large Language Model UncertaintyLLM Reasoning Strategies

  22. SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute

    Jul 30, 2026Hongyu Chen, Liang Lin, Guangrun WangReinforcement Learning With Verifiable RewardTest Time

  23. ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

    Jul 30, 2026Zhenrong Zhang, Fei Wu, Jun Du +2Mathematical Reasoning BenchmarksMathematical Reasoning

  24. Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

    Jul 30, 2026Haodong Zhu, Yangyang Ren, Yanjing Li +4Automatic Prompt OptimizationMathematical Reasoning Benchmarks

  25. ReCo: Reweighting GRPO Against Distributional Concentration

    Jul 29, 2026Junoh Park, Junseo Hwang, Wonguk Cho +1ReweightingMathematical Reasoning Benchmarks

  26. Pass the Baton: Trajectory-Relayed On-Policy Distillation

    Jul 28, 2026Haolei Xu, Xiaowen Xu, Haiwen Hong +5TeacherMathematical Reasoning Benchmarks

  27. AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

    Jul 13, 2026Lingkai Kong, Zijian Wu, Yuzhe Gu +11Research-Level MathematicsMathematical Reasoning Benchmarks

  28. MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning

    Jul 8, 2026Charbel Al Bateh, Samer SaabMathematical ReasoningMathematical Reasoning Benchmarks

  29. LLM-as-a-Verifier: A General-Purpose Verification Framework

    Jul 6, 2026Jacky Kwok, Shulu Li, Pranav Atreya +6Large Language Models(LlmsFeedback

  30. SABER-Math: Automated Benchmark for Information Retrieval Evaluation in Mathematics

    Jun 29, 2026Nikolay Georgiev, Maria Drencheva, Kseniia Ibragimova +3Mathematical Reasoning BenchmarksMathematics

  31. ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation

    Jun 22, 2026Chen Lin, Kedi Chen, Wei ZhangMathematical Reasoning BenchmarksNegative Results

  32. Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

    Jun 10, 2026Kai Liu, Peijie Dong, Xinchen Xie +5Mathematical Reasoning BenchmarksLarge Language Model Reinforcement Learning

  33. SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling

    Jun 8, 2026Haoran Xu, Hongyu Wang, Yifei Gao +3Efficient On-Policy DistillationTeacher

  34. A Regret Minimization Framework on Preference Learning in Large Language Models

    Jun 8, 2026Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim +4Reinforcement Learning From Human FeedbackSequential Preference Optimization

  35. Diverse Thinking Schemata Elicit Better Reasoning in Large Language Models

    Jun 8, 2026Xinyue Liang, Yizhe Yang, Yu Bai +3Large Reasoning ModelsMathematical Reasoning Benchmarks

  36. Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models

    Jun 3, 2026Chirag Chawla, Rohan Charudatt Salvi, Madhav S. BaidyaPolicy GradientOffline Reinforcement Learning

  37. LoRi: Low-Rank Distillation for Implicit Reasoning

    Jun 3, 2026Ryan Solgi, Jiayi Tian, Zheng ZhangChain-of-Thought ReasoningReasoning Skills

  38. Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks

    Jun 2, 2026Malia Barker, Bishal Lakha, Edoardo Serra +1Mathematical Reasoning BenchmarksLLM Reasoning Strategies

  39. Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning

    Jun 2, 2026Ziyue Wang, Aomufei Yuan, Yongfu Zhu +10Reinforcement Learning With Verifiable RewardMathematical Reasoning Benchmarks

  40. FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks

    May 27, 2026Nishal Thomas, Noel ThomasMathematical Reasoning BenchmarksTheorem Proving

  41. Skill-Conditioned Gated Self-Distillation for LLM Reasoning

    May 27, 2026Jiazhen Huang, Xiao Chen, Xiao Luo +3Unsupervised On-Policy Self-DistillationLLM Reasoning Strategies

  42. Interpretability-Guided Layer Selection over Subspace Projection: SAEs as Stethoscopes, Not Scalpels, for Raw Task Vector Model Editing

    May 27, 2026Li Lei, Madalina Ciobanu, Qingqing Mao +1Mathematical Reasoning BenchmarksSubspace

  43. Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration

    May 27, 2026Zili Wang, Jiajun Chai, Lin Chen +3Reinforcement Learning With Verifiable RewardMulti-Token Prediction

  44. ReverseMath: Answer Inversion for Scalable and Verifiable Mathematical Problem Generation

    May 26, 2026Raoyuan Zhao, Yihong Liu, Yupei Du +2Mathematical Reasoning BenchmarksReverse

  45. Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning

    May 21, 2026Hongbin Zhang, Chaozheng Wang, Kehai Chen +4Unsupervised On-Policy Self-DistillationSelf-Teacher

  46. Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation

    May 20, 2026Xixiang He, Qiyao Sun, Ao Cheng +5Reinforcement Learning With Verifiable RewardCollapse

  47. Beyond Fixed Budgets: Characterizing the Inelasticity and Limitations of Tree-of-Thought Reasoning Strategies

    May 19, 2026Atkia Mahila, Avinash Maurya, M. Mustafa Rafique +1LLM Reasoning StrategiesMonte Carlo Tree Search