RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. How Does Reasoning Flow? Tracing Attention-Induced Information Flow for Targeted RL in LLMs

    Jun 9, 2026Zhichen Dong, Yang Li, Yuhan Sun +9Token-Level Credit AssignmentRL for Language Model Reasoning

  2. Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning

    Jun 9, 2026Jiangnan Xia, Yucheng Shi, Yu Yang +3Memorization in Language ModelsRL for Language Model Reasoning

  3. Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

    Jun 8, 2026Han Zhou, Adam X. Yang, Laurence Aitchison +2Pairwise Preference LearningReward Modeling

  4. From Shortcuts to Reasoning: Robust Post-Training of Theory of Mind with Reinforcement Learning

    Jun 8, 2026Jike Zhong, Yuxiang Lai, Ming Li +5Theory of MindRL for Language Model Reasoning

  5. The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning

    Jun 8, 2026Aakriti Agrawal, Souradip Chakraborty, Armin Saghafian +6Process Reward ModelsRL for Language Model Reasoning

  6. INFUSER: Influence-Guided Self-Evolution Improves Reasoning

    Jun 8, 2026Siyu Chen, Miao Lu, Beining Wu +7RL for Language Model ReasoningGroup Relative Policy Optimization

  7. Diverse Thinking Schemata Elicit Better Reasoning in Large Language Models

    Jun 8, 2026Xinyue Liang, Yizhe Yang, Yu Bai +3Reasoning DiversityRL for Language Model Reasoning

  8. Knowledge Graphs and Reasoning LLMs for Finding Simple Yet Effective Transcriptomic Perturbation Predictors

    Jun 7, 2026Jake Fawkes, Liam Hodgson, Jason HartfordRL for Language Model ReasoningSingle-Cell Perturbation Modeling

  9. Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

    Jun 7, 2026Hao Chen, Zhanming Shen, Liyao Li +8Intrinsic Reward MethodsReinforcement Learning

  10. PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR

    Jun 7, 2026Shumeng Yang, Yisu Liu, Jiayi Zheng +2RL for Language Model ReasoningMaximum Entropy RL

  11. Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

    Jun 7, 2026Yawen Shao, Jie Xiao, Kai Zhu +6RL for Language Model ReasoningCredit Assignment in RL

  12. Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models

    Jun 7, 2026Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun +7RL for Language Model ReasoningSparse Attention

  13. CATPO: Critique-Augmented Tree Policy Optimization

    Jun 6, 2026Ayush Singh, Umang Goyal, Ankur DahiyaRL for Language ModelsReinforcement Learning

  14. ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning

    Jun 6, 2026Qing Miao, Yiming Zhao, Jing Yang +5Reward ShapingRL for Language Model Reasoning

  15. The Easy, the Hard, and the Learnable: Confidence and Difficulty-Adaptive Policy Optimization for LLM Reasoning

    Jun 6, 2026Zhanke Zhou, Xiangyu Lu, Chentao Cao +4RL for Language Model ReasoningPolicy Optimization

  16. From Correctness to Utility: Gain-Based Prefix Evaluation for LLM Reasoning

    Jun 5, 2026Yuhang Zhou, Yixin Cao, Guangnan YeProcess Reward ModelsRL for Language Model Reasoning

  17. RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

    Jun 4, 2026Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger +1Reinforcement LearningRL for Language Model Reasoning

  18. TARPO: Token-Wise Latent-Explicit Reasoning via Action-Routing Policy Optimization

    Jun 4, 2026Liting Zhang, Shiwan Zhao, Xuyang Zhao +3RL for Language Model ReasoningRL Fine-Tuning

  19. Cross-Epoch Adaptive Rollout Optimization for RL Post-Training

    Jun 4, 2026Yiming Zong, Yige Wang, Jiashuo JiangSequential Decision MakingRL for Language Model Reasoning

  20. Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models

    Jun 3, 2026Chirag Chawla, Rohan Charudatt Salvi, Madhav S. BaidyaReinforcement LearningRL for Language Model Reasoning

  21. Reinforcement Learning from Rich Feedback with Distributional DAgger

    Jun 3, 2026Rishabh Agrawal, Jacob Fein-Ashley, Paria RashidinejadDistributional RLRL for Language Model Reasoning

  22. GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards

    Jun 3, 2026Tej Deep Pala, Vernon Toh, Soujanya PoriaRL for Language Model ReasoningCredit Assignment in RL

  23. SocraticPO: Policy Optimization via Interactive Guidance

    Jun 3, 2026Zirui Liu, Jie Ouyang, Qi Liu +8RL for Language Model ReasoningLLM-Guided RL

  24. Rollout-Level Advantage-Prioritized Experience Replay for GRPO

    Jun 3, 2026Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang +2RL for Language Model ReasoningGroup Relative Policy Optimization

  25. TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition

    Jun 3, 2026Ningyuan Xi, Hao Xu, Hongsheng Xin +1RL for Language Model ReasoningMathematical Reasoning