LLM Reasoning

LLM: Large Language Model

Momentum

68 papers in the last four weeks, up 143% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 650

All topics
CardsList
  1. SynCo: Data Synthesis Co-Training for Self-Evolving LLMs via Multi-Agent Reinforcement Learning

    Oct 8, 2026Wei Yang, Shawn Li, Yuehan Qin +8Self-Evolving AgentsSynthetic Data Generation for Language Models

  2. Balancing Reference Guidance and Free Generation in Trajectory Rollouts for Reasoning RL

    Oct 8, 2026Hanyu Wang, Nakul Agarwal, Hossein Nourkhiz Mahjoub +4LLM ReasoningRL for Language Model Reasoning

  3. SAPD: Step-Aligned Privileged Distillation

    Oct 7, 2026Tianle Wang, Jiayu Liu, Ruizhi Zhao +1LLM Post-TrainingLanguage Model Distillation

  4. Which Language Should a Skeleton Speak? Language Choices in Multilingual Reasoning

    Oct 7, 2026HyeonSeok Lim, SeungWoo Song, Inho Won +3LLM ReasoningCross-Lingual Reasoning in Language Models

  5. The Dichotomy Between Pattern Recognition and Step-by-Step Reasoning

    Oct 6, 2026Amrut Nadgir, Pratik Chaudhari, Vijay BalasubramanianLLM ReasoningEfficient Language Model Reasoning

  6. ThinkFuse: Trajectory-Aware Test-Time Fusion for Small Reasoning Models

    Oct 6, 2026Myunghoon Kang, Jungseob Lee, Jaehyung Seo +1Efficient Language Model ReasoningLLM Reasoning

  7. Can Language Models Learn to Reject Their Own Bad Reasoning Steps?

    Oct 5, 2026Siheng Xiong, Xiaoze Liu, Yiqiao Jin +2LLM Self-CorrectionLanguage Model Decoding

  8. Expanding LLM Reasoning

    Oct 4, 2026Rian Atri, Evan LuoLLM Inference EfficiencyInference-Time Scaling

  9. ReHoPER: Receding-Horizon Planning for Enhanced Reasoning

    Oct 1, 2026Saeed Ahmadnia, Cornelia CarageaCompositional ReasoningSequential Decision Making

  10. Reason in Style: Discovering and Controlling Style in Language Models

    Sep 30, 2026Ioana Marinescu, Eric Karl Oermann, Kyunghyun ChoUnsupervised LearningLanguage Model Steering

  11. Exploring More, Reasoning Better: Stepwise Risk-Sensitive GRPO for Diffusion Language Models

    Sep 30, 2026Yue YU, Bowen Zuo, David Crandall +2RL for Language Model ReasoningGroup Relative Policy Optimization

  12. Random Recursive Models

    Sep 30, 2026Jama Hussein Mohamud, Mirco RavanelliEfficient Neural Network InferenceLLM Reasoning

  13. Semifactual Credit-Augmented Policy Optimization

    Sep 30, 2026Junshu Pan, Zhizhang Fu, Shulin Huang +5Prompt SensitivityRL for Language Model Reasoning

  14. When a Kindergartener Solves Calculus: Measuring Capability Leakage in Role-Prompted Reasoning Models

    Sep 30, 2026Pakhapoom Sarapat, Saksorn Ruangtanusak, Kunat Pipatanakul +1Large Language Model-Based Role-Play SimulationLLM Security

  15. OverForge: Reasoning Through Strategies and Tactics Helps Cooperative Lifelong Adaptation

    Sep 30, 2026Oana Madalina Fron, Ojas Shirekar, Chirag RamanContinual Learning for LLM AgentsMulti-Agent LLM Systems

  16. Can Computation from Earlier Problems Help LLMs Solve New Ones?

    Sep 30, 2026Jipei He, Wenhui Tan, Xiaoyi Yu +4Memory-Augmented Language ModelsLLM Inference

  17. Privy to the Foil: Recasting Value Estimation with a Self-Privileged Critic for RLVR

    Sep 29, 2026Kun Liang, Chenming Tang, Clive Bai +5Value Function EstimationRL for Language Model Reasoning

  18. Solving Without Stopping: On-Policy Distillation at Small Scale

    Sep 29, 2026Hongyang Li, Yiming Zhu, Xiao Li +3Reasoning DistillationSmall Language Models

  19. What Does Post-Training Change in Multilingual Reasoning?

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +2Multilingual Language Model EvaluationCross-Lingual Reasoning in Language Models

  20. Beam Search as Test-Time Self-Distillation via Counterfactual Contexts

    Sep 29, 2026Su Ee Tan, Xiaotong Ji, Rasul Tutunov +2Language Model DistillationSelf-Distillation

  21. SRJudge: Empowering Large Language Models with Selective Reasoning for Fine-Grained Knowledge Concept Tagging

    Sep 29, 2026Zhiwei Yang, Jiahua Yang, Huiru Lin +2RL for Language Model ReasoningAI in Education

  22. Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

    Sep 29, 2026Zehao Jin, Ruixuan Deng, Junran WangTransformerLLM Fine-Tuning

  23. ThinkingGuard: Decoding Implicit Hazards via Step-by-Step Risk Attribution in Multimodal Large Language Models

    Sep 29, 2026Ruochen Zhang, Yao Huang, Yitong Sun +5Multimodal ReasoningLLM Safety

  24. Rethinking Reasoning Paths as Phase-Structured Trajectories

    Sep 29, 2026Zhenghao He, Guangzhi Xiong, Sanchit Sinha +3Structured ReasoningLanguage Model Probing