Mathematical Reasoning Benchmarks

Momentum

13 papers in the last four weeks, up 117% on the four weeks before. 0.2% of all new papers.

Jul 6Week of Sep 21

Latest papers 101

All topics
CardsList
  1. CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

    May 19, 2026Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed +4Reinforcement Learning With Verifiable RewardMathematical Reasoning Benchmarks

  2. CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean

    May 17, 2026Wentao Long, Yunfei Zhang, Chenyi Li +3Theorem ProvingMathematical Reasoning Benchmarks

  3. Distribution Corrected Offline Data Distillation for Large Language Models

    May 13, 2026Yumeng Zhang, Zhengbang Yang, Yevin Nikhel Goonatilake +1Probe-Logit DistillationMathematical Reasoning Benchmarks

  4. From Noise to Diversity: Random Embedding Injection in LLM Reasoning

    May 12, 2026Heejun Kim, Seungpil Lee, Jewon Yeom +5LLM Reasoning StrategiesAutomatic Prompt Optimization

  5. Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

    May 12, 2026Chi Zhang, Haibo Qiu, Qiming Zhang +3LLM Reasoning StrategiesRecursive Reasoner

  6. Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization

    May 12, 2026Huimin Xu, Shuai Zhao, Xiaobao Wu +1Reinforcement Learning With Verifiable RewardToken-Level Entropy

  7. Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward

    May 11, 2026Xuexiang Wen, Hang Yu, Linchao Zhu +1Reinforcement Learning With Verifiable RewardReward Gradients

  8. LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models

    May 10, 2026Songtao Wei, Yi Li, Zhikai Li +7Large Reasoning ModelsLarge Language Model Reinforcement Learning

  9. Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning

    May 10, 2026Xia Yang, Xuanyi Zhang, Hao Hu +1Mathematical ReasoningMathematical Reasoning Benchmarks

  10. Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

    May 8, 2026Yunho Choi, Jongwon Lim, Woojin Ahn +3Reinforcement Learning With Verifiable RewardVerifiable Rewards

  11. Teaching Language Models to Think in Code

    May 8, 2026Hyeon Hwang, Jiwoo Lee, Jaewoo KangMathematical Reasoning BenchmarksLanguage Modeling

  12. Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs

    May 1, 2026Jasper Dekoninck, Nikola Jovanović, Tim Gehrunger +4Mathematical Reasoning BenchmarksMathematical Reasoning

  13. Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors

    May 1, 2026Chaohao Yuan, Chenghao Xiao, Yu Rong +2Supervised FinetuningReinforcement Learning With Verifiable Reward

  14. Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity

    Apr 24, 2026Erez Yosef, Oron Anschel, Shunit Haviv Hakimi +4Mathematical ReasoningMathematical Reasoning Benchmarks

  15. TRACES: Tagging Reasoning Steps for Adaptive Cost-Efficient Early-Stopping

    Apr 22, 2026Yannis Belkhiter, Seshu Tirupathi, Giulio Zizzo +1Large Reasoning ModelsProgressive Reasoning

  16. Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

    Apr 20, 2026Samuel G. Balter, Ethan Jerzak, Connor T. JerzakMultimodal Large Language ModelsModalities

  17. Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play

    Apr 20, 2026Xiachong Feng, Deyi Yin, Xiaocheng Feng +9Mathematical Reasoning BenchmarksImperfect-Information Games

  18. Peer-Predictive Self-Training for Language Model Reasoning

    Apr 14, 2026Shi Feng, Hanlin Zhang, Fan Nie +2Mathematical Reasoning Benchmarks

  19. What Makes Good Multilingual Reasoning? Disentangling Traces with Measurable Features

    Apr 6, 2026Dayeon Ki, Kevin Duh, Marine CarpuatMultilingual BenchmarkReasoning Traces

  20. RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning

    Apr 1, 2026Shaopeng Fu, Xingxing Zhang, Li Dong +1Large Language Model Reinforcement LearningLLM Reasoning Strategies

  21. Can LLMs Prove Robotic Path Planning Optimality? A Benchmark for Research-Level Algorithm Verification

    Mar 19, 2026Zhengbang Yang, Md. Tasin Tazwar, Minghan Wei +1Robot PlanningLarge Language Model Planning

  22. TTSR: Test-Time Self-Evolving via Reflection

    Feb 6, 2026Haoyang He, Zihua Rong, Yunjia Zhao +3Test-Time TrainingTest Time

  23. Not All Preferences Deserve Gradients: Understanding Gradient Utility in Offline Reasoning Alignment

    Feb 1, 2026Hui Wu, Hengyi Cai, Jinman Zhao +6GradientPreference Alignment Learning

  24. ScalePRM: Training Process Reward Models by Scaling Verification Compute Without Ground Truth

    Dec 2, 2025Salman Rahman, Sruthi Gorantla, Arpit Gupta +3Process Reward ModelMathematical Reasoning Benchmarks

  25. A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning

    Oct 21, 2025Mengqi Li, Lei Zhao, Anthony Man-Cho So +2LLM Reasoning StrategiesMathematical Reasoning Benchmarks

  26. Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts

    Aug 13, 2025Maxime Heuillet, Yufei Cui, Boxing Chen +2Mathematical Reasoning BenchmarksLarge Language Model Fine-Tuning

  27. SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning

    Jul 22, 2025Xiuwei Chen, Wentao Hu, Hanhui Li +9Multimodal Reasoning BenchmarksMathematical Reasoning Benchmarks