LLM Reasoning

LLM: Large Language Model

Momentum

68 papers in the last four weeks, up 143% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 640

All topics
CardsList
  1. SynCo: Data Synthesis Co-Training for Self-Evolving LLMs via Multi-Agent Reinforcement Learning

    Oct 8, 2026Wei Yang, Shawn Li, Yuehan Qin +8Self-Evolving AgentsSynthetic Data Generation for Language Models

  2. Balancing Reference Guidance and Free Generation in Trajectory Rollouts for Reasoning RL

    Oct 8, 2026Hanyu Wang, Nakul Agarwal, Hossein Nourkhiz Mahjoub +4LLM ReasoningRL for Language Model Reasoning

  3. SAPD: Step-Aligned Privileged Distillation

    Oct 7, 2026Tianle Wang, Jiayu Liu, Ruizhi Zhao +1LLM Post-TrainingLanguage Model Distillation

  4. Which Language Should a Skeleton Speak? Language Choices in Multilingual Reasoning

    Oct 7, 2026HyeonSeok Lim, SeungWoo Song, Inho Won +3LLM ReasoningCross-Lingual Reasoning in Language Models

  5. The Dichotomy Between Pattern Recognition and Step-by-Step Reasoning

    Oct 6, 2026Amrut Nadgir, Pratik Chaudhari, Vijay BalasubramanianLLM ReasoningEfficient Language Model Reasoning

  6. ThinkFuse: Trajectory-Aware Test-Time Fusion for Small Reasoning Models

    Oct 6, 2026Myunghoon Kang, Jungseob Lee, Jaehyung Seo +1Efficient Language Model ReasoningLLM Reasoning

  7. Can Language Models Learn to Reject Their Own Bad Reasoning Steps?

    Oct 5, 2026Siheng Xiong, Xiaoze Liu, Yiqiao Jin +2LLM Self-CorrectionLanguage Model Decoding

  8. Expanding LLM Reasoning

    Oct 4, 2026Rian Atri, Evan LuoLLM Inference EfficiencyInference-Time Scaling

  9. ReHoPER: Receding-Horizon Planning for Enhanced Reasoning

    Oct 1, 2026Saeed Ahmadnia, Cornelia CarageaCompositional ReasoningSequential Decision Making

  10. Reason in Style: Discovering and Controlling Style in Language Models

    Sep 30, 2026Ioana Marinescu, Eric Karl Oermann, Kyunghyun ChoUnsupervised LearningLanguage Model Steering

  11. Exploring More, Reasoning Better: Stepwise Risk-Sensitive GRPO for Diffusion Language Models

    Sep 30, 2026Yue YU, Bowen Zuo, David Crandall +2RL for Language Model ReasoningGroup Relative Policy Optimization

  12. Random Recursive Models

    Sep 30, 2026Jama Hussein Mohamud, Mirco RavanelliEfficient Neural Network InferenceLLM Reasoning

  13. Semifactual Credit-Augmented Policy Optimization

    Sep 30, 2026Junshu Pan, Zhizhang Fu, Shulin Huang +5Prompt SensitivityRL for Language Model Reasoning

  14. When a Kindergartener Solves Calculus: Measuring Capability Leakage in Role-Prompted Reasoning Models

    Sep 30, 2026Pakhapoom Sarapat, Saksorn Ruangtanusak, Kunat Pipatanakul +1Large Language Model-Based Role-Play SimulationLLM Security

  15. OverForge: Reasoning Through Strategies and Tactics Helps Cooperative Lifelong Adaptation

    Sep 30, 2026Oana Madalina Fron, Ojas Shirekar, Chirag RamanContinual Learning for LLM AgentsMulti-Agent LLM Systems

  16. Can Computation from Earlier Problems Help LLMs Solve New Ones?

    Sep 30, 2026Jipei He, Wenhui Tan, Xiaoyi Yu +4Memory-Augmented Language ModelsLLM Inference

  17. Privy to the Foil: Recasting Value Estimation with a Self-Privileged Critic for RLVR

    Sep 29, 2026Kun Liang, Chenming Tang, Clive Bai +5Value Function EstimationRL for Language Model Reasoning

  18. Solving Without Stopping: On-Policy Distillation at Small Scale

    Sep 29, 2026Hongyang Li, Yiming Zhu, Xiao Li +3Reasoning DistillationSmall Language Models

  19. What Does Post-Training Change in Multilingual Reasoning?

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +2Multilingual Language Model EvaluationCross-Lingual Reasoning in Language Models

  20. Beam Search as Test-Time Self-Distillation via Counterfactual Contexts

    Sep 29, 2026Su Ee Tan, Xiaotong Ji, Rasul Tutunov +2Language Model DistillationSelf-Distillation

  21. SRJudge: Empowering Large Language Models with Selective Reasoning for Fine-Grained Knowledge Concept Tagging

    Sep 29, 2026Zhiwei Yang, Jiahua Yang, Huiru Lin +2RL for Language Model ReasoningAI in Education

  22. Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

    Sep 29, 2026Zehao Jin, Ruixuan Deng, Junran WangTransformerLLM Fine-Tuning

  23. ThinkingGuard: Decoding Implicit Hazards via Step-by-Step Risk Attribution in Multimodal Large Language Models

    Sep 29, 2026Ruochen Zhang, Yao Huang, Yitong Sun +5Multimodal ReasoningLLM Safety

  24. Rethinking Reasoning Paths as Phase-Structured Trajectories

    Sep 29, 2026Zhenghao He, Guangzhi Xiong, Sanchit Sinha +3Structured ReasoningLanguage Model Probing

  25. Learning from Teacher Continuations at Student States

    Sep 28, 2026Haojin Wang, Dylan Zhang, Huaibo Chen +8Language Model DistillationOn-Policy Distillation

  26. When Confidence Rises Too Early: Detecting Shortcut Reasoning via Premature Answer Commitment

    Sep 28, 2026Zhaohan Zhang, Junjie Liu, Chengzhengxu Li +6Faithfulness of Language Model ExplanationsConfidence Estimation in Language Models

  27. Teach to Learn: Hint Annealing for Self-improving LLM Reasoning

    Sep 28, 2026Zile Wang, Zijian Li, Haodong Wang +5Reinforcement LearningSelf-Training for Language Models

  28. Rewarding Novel Deductions: Solver-guided Process Supervision for Logical Reasoning

    Sep 28, 2026Muhammad Asif Ali, Wenqing Wang, Huan Wang +1RL for Language Model ReasoningProcess Supervision

  29. Direct Self-Evolving Optimization: Evolving LLMs without Challenger Training

    Sep 28, 2026Yuyang Deng, Yu Wang, Jiayun WangSelf-Training for Language ModelsLarge Language Model-Guided Optimization

  30. Investigating Human--AI Discrepancies via Multiple-Solution Problems

    Sep 28, 2026Zihao Wang, Francesco Insulla, Andrea MontanariGenerative AI EvaluationLLM Reasoning

  31. How code helps different tasks? A decompositional lens on LLM post-training

    Sep 27, 2026Zheng Yu, Yiwei Li, Yishen Chen +4LLM Fine-TuningInstruction-Tuning Data Selection

  32. Selecting Diverse SFT Traces Improves Post-RL Generalization

    Sep 27, 2026Dylan Zhang, Mingyuan Wu, Jinning LiReasoning DiversityRL for Language Model Reasoning

  33. Rethinking Token Reweighting for SFT: Suppress, Reverse, and Extrapolate Learned Features

    Sep 27, 2026Cunchun Li, Haonan He, Yifan Gao +4Supervised Fine-TuningAdaptive Loss Weighting

  34. No More Free Lunch: Corpus Task Complexity Matters as Corpora Grow

    Sep 24, 2026Prasann Singhal, Amanda Bertsch, Jacob Steinhardt +1Long-Context Language Model EvaluationLLM Reasoning

  35. ELF-REG: Scaling Continuous Diffusion Language Models to Reasoning Tasks

    Sep 24, 2026Zeyu Michael Li, William Xingxu Chen, Bingshuo Qian +2Code GenerationDiffusion Language Models

  36. Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark

    Sep 23, 2026Hamed Taherkhani, Mohammad Abdollahi, Melika Sepidband +3LLM EvaluationSoftware Engineering Benchmarks

  37. Planned Test-Time Scaling with Coordinated Reasoning Paths

    Sep 23, 2026Xueqing Wu, Langxing Bai, Hritik Bansal +5RL for Language Model ReasoningTest-Time Scaling

  38. Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning

    Sep 22, 2026Ismail Labiad, Matthieu Kowalski, Marc Schoenauer +2RL for Language Model ReasoningLLM Reasoning

  39. Ladders of Thought: A Self-Evolving Curriculum of Progressively Simplified Reasoning Traces

    Sep 22, 2026Minghui Liu, Thomas Magelinski, Dehao Yuan +2Numerical Reasoning in Language ModelsCurriculum Learning

  40. Efficient Reasoning Exploration via State-Conditioned Latent Steering with Progress Guidance

    Sep 21, 2026Hengyuan Zhang, Chenming Shang, Zunhai Su +10Best-of-N SamplingInference-Time Guidance

  41. LLM-as-an-Improver: Turning Verification into Better Candidates

    Sep 17, 2026Akiyoshi Tomihari, Yuma IchikawaLLM Answer VerificationLLM Reranking

  42. Clueing up LLMs with Tool-Augmented Deductive Reasoning

    Sep 16, 2026Rebecca Ansell, Autumn Toney-WailsMulti-Agent LLM SystemsAI Agent Benchmarks

  43. What Counts as Strategic Reasoning? A Systematic Mapping of Chess Research on Humans, Engines, and Language Models

    Sep 16, 2026Paolo Ciancarini, Remo PareschiChessHuman-AI Decision Making

  44. Bellman Policy Optimization

    Sep 14, 2026Zhuoqing Song, Haotian Xu, Xikun Zhang +1Reinforcement LearningRL for Language Model Reasoning

  45. Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science

    Sep 14, 2026Honghao Lin, David P. Woodruff, Yuan Deng +3Inference-Time SearchAutomated Theorem Proving

  46. Discrete Beckmann Transport Models for One-Step Language Modeling and Reasoning

    Sep 14, 2026Sophia Tang, Shiyi WangOne-Step Generative ModelingFlow-Based Generative Modeling

  47. CWM: Controllable White-Box Meta-Prompting for Adaptive Retrieval-Augmented Generation and Reasoning Ability

    Sep 14, 2026Keuntae Kim, Eunhye Jeong, Yong Suk ChoiLLM PromptingAdaptive RAG