RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Distilling LLM Feedback for Lean Theorem Proving

    May 29, 2026Gaetan Narozniak, Gérard Biau, Rémi Munos +2RL for Language Model ReasoningMathematical Reasoning

  2. SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning

    May 29, 2026Jian Yao, Xiongcai Luo, Ran Cheng +1RL for Language Model ReasoningEfficient Language Model Inference

  3. Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO

    May 29, 2026Yiming Ren, Yiran Xu, Zicheng Lin +8Reinforcement LearningRL for Language Model Reasoning

  4. VeriGate: Verifier-Gated Step-Level Supervision for GRPO

    May 28, 2026Aakriti Agrawal, Minghui Liu, Furong HuangProcess Reward ModelsRL for Language Model Reasoning

  5. ESPO: Early-Stopping Proximal Policy Optimization

    May 28, 2026Zihang Li, Rui Zhou, Yingcheng Shi +8Early StoppingReinforcement Learning

  6. DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning

    May 28, 2026Yang He, Xiao Ding, Bibo Cai +5Reinforcement LearningRL for Language Model Reasoning

  7. Rubric-Guided Process Reward for Stepwise Model Routing

    May 28, 2026Shenghao Ye, Yu Guo, Zhengheng Li +2Process Reward ModelsRL for Language Model Reasoning

  8. Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization

    May 28, 2026Shufan Li, Konstantinos Kallidromitis, Akash Gokul +2Token-Level Credit AssignmentRL for Language Model Reasoning

  9. When RL Suppresses Its Own Vocabulary: Recovering Reasoning Diversity in Puzzle-to-Math Transfer

    May 28, 2026Mayug Maniparambil, Arjun Karuvally, Terrence Sejnowski +1RL for Language ModelsRL for Language Model Reasoning

  10. OISD: On-Policy Internal Self-Distillation of Language Models

    May 27, 2026Xinyu Liu, Darryl Cherian Jacob, Yang Zhou +2RL for Language Model ReasoningSelf-Distillation

  11. DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

    May 27, 2026Caijun Xu, Changyi Xiao, Zhongyuan Peng +1LLM Self-CorrectionRL for Language Model Reasoning

  12. Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs

    May 27, 2026Yue Cheng, Jiajun Zhang, Xiaohui Gao +3Reinforcement LearningRL for Language Model Reasoning

  13. Plan Before Search: Search Agents Need Plan

    May 27, 2026Zhipeng Qian, Zihan Liang, Yufei Ma +7Multi-Hop QATool-Augmented Language Model Agents

  14. Diversifying RLVR Rollouts via First-Token Exploration

    May 27, 2026Soeun Kim, Albert NoRL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  15. IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage

    May 27, 2026Yuhan Li, Mingxu Zhang, Dazhong Shen +1Reinforcement LearningRL for Language Model Reasoning

  16. Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration

    May 27, 2026Zili Wang, Jiajun Chai, Lin Chen +3Multi-Token PredictionRL for Language Model Reasoning

  17. Off-Policy Learning to Reason Works Because It Is More Pessimistic Than You Think

    May 27, 2026Otmane Sakhi, Aleksei Arzhantsev, Imad Aouali +1Reinforcement LearningRL for Language Model Reasoning

  18. Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning

    May 27, 2026Yi Wang, Haojie Lu, Zhaofan Zhang +2Hierarchical PlanningRL for Language Model Reasoning

  19. DecomposeRL: Learning to Ask Useful, Informative, and Diverse Questions for Semi-Supervised, Traceable Claim Verification

    May 27, 2026Shubhashis Roy Dipta, Ankur Padia, Francis FerraroClaim VerificationRL for Language Model Reasoning

  20. Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning

    May 26, 2026Zehao Liu, Yuanpu Cao, Jinghui Chen +1Reinforcement LearningOn-Policy Self-Distillation