LLM Reasoning

LLM: Large Language Model

Momentum

68 papers in the last four weeks, up 143% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 650

All topics
CardsList
  1. Learning from Teacher Continuations at Student States

    Sep 28, 2026Haojin Wang, Dylan Zhang, Huaibo Chen +8Language Model DistillationOn-Policy Distillation

  2. When Confidence Rises Too Early: Detecting Shortcut Reasoning via Premature Answer Commitment

    Sep 28, 2026Zhaohan Zhang, Junjie Liu, Chengzhengxu Li +6Faithfulness of Language Model ExplanationsConfidence Estimation in Language Models

  3. Teach to Learn: Hint Annealing for Self-improving LLM Reasoning

    Sep 28, 2026Zile Wang, Zijian Li, Haodong Wang +5Reinforcement LearningSelf-Training for Language Models

  4. Rewarding Novel Deductions: Solver-guided Process Supervision for Logical Reasoning

    Sep 28, 2026Muhammad Asif Ali, Wenqing Wang, Huan Wang +1RL for Language Model ReasoningProcess Supervision

  5. Direct Self-Evolving Optimization: Evolving LLMs without Challenger Training

    Sep 28, 2026Yuyang Deng, Yu Wang, Jiayun WangSelf-Training for Language ModelsLarge Language Model-Guided Optimization

  6. Investigating Human--AI Discrepancies via Multiple-Solution Problems

    Sep 28, 2026Zihao Wang, Francesco Insulla, Andrea MontanariGenerative AI EvaluationLLM Reasoning

  7. How code helps different tasks? A decompositional lens on LLM post-training

    Sep 27, 2026Zheng Yu, Yiwei Li, Yishen Chen +4LLM Fine-TuningInstruction-Tuning Data Selection

  8. Selecting Diverse SFT Traces Improves Post-RL Generalization

    Sep 27, 2026Dylan Zhang, Mingyuan Wu, Jinning LiReasoning DiversityRL for Language Model Reasoning

  9. Rethinking Token Reweighting for SFT: Suppress, Reverse, and Extrapolate Learned Features

    Sep 27, 2026Cunchun Li, Haonan He, Yifan Gao +4Supervised Fine-TuningAdaptive Loss Weighting

  10. No More Free Lunch: Corpus Task Complexity Matters as Corpora Grow

    Sep 24, 2026Prasann Singhal, Amanda Bertsch, Jacob Steinhardt +1Long-Context Language Model EvaluationLLM Reasoning

  11. ELF-REG: Scaling Continuous Diffusion Language Models to Reasoning Tasks

    Sep 24, 2026Zeyu Michael Li, William Xingxu Chen, Bingshuo Qian +2Code GenerationDiffusion Language Models

  12. Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark

    Sep 23, 2026Hamed Taherkhani, Mohammad Abdollahi, Melika Sepidband +3LLM EvaluationSoftware Engineering Benchmarks

  13. Planned Test-Time Scaling with Coordinated Reasoning Paths

    Sep 23, 2026Xueqing Wu, Langxing Bai, Hritik Bansal +5RL for Language Model ReasoningTest-Time Scaling

  14. Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning

    Sep 22, 2026Ismail Labiad, Matthieu Kowalski, Marc Schoenauer +2RL for Language Model ReasoningLLM Reasoning

  15. Ladders of Thought: A Self-Evolving Curriculum of Progressively Simplified Reasoning Traces

    Sep 22, 2026Minghui Liu, Thomas Magelinski, Dehao Yuan +2Numerical Reasoning in Language ModelsCurriculum Learning

  16. Efficient Reasoning Exploration via State-Conditioned Latent Steering with Progress Guidance

    Sep 21, 2026Hengyuan Zhang, Chenming Shang, Zunhai Su +10Best-of-N SamplingInference-Time Guidance

  17. LLM-as-an-Improver: Turning Verification into Better Candidates

    Sep 17, 2026Akiyoshi Tomihari, Yuma IchikawaLLM Answer VerificationLLM Reranking

  18. Clueing up LLMs with Tool-Augmented Deductive Reasoning

    Sep 16, 2026Rebecca Ansell, Autumn Toney-WailsMulti-Agent LLM SystemsAI Agent Benchmarks

  19. What Counts as Strategic Reasoning? A Systematic Mapping of Chess Research on Humans, Engines, and Language Models

    Sep 16, 2026Paolo Ciancarini, Remo PareschiChessHuman-AI Decision Making

  20. Bellman Policy Optimization

    Sep 14, 2026Zhuoqing Song, Haotian Xu, Xikun Zhang +1Reinforcement LearningRL for Language Model Reasoning

  21. Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science

    Sep 14, 2026Honghao Lin, David P. Woodruff, Yuan Deng +3Inference-Time SearchAutomated Theorem Proving

  22. Discrete Beckmann Transport Models for One-Step Language Modeling and Reasoning

    Sep 14, 2026Sophia Tang, Shiyi WangOne-Step Generative ModelingFlow-Based Generative Modeling

  23. CWM: Controllable White-Box Meta-Prompting for Adaptive Retrieval-Augmented Generation and Reasoning Ability

    Sep 14, 2026Keuntae Kim, Eunhye Jeong, Yong Suk ChoiLLM PromptingAdaptive RAG