RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. MiniOpt: Reasoning to Model and Solve General Optimization Problems with Limited Resources

    Jun 24, 2026Ke Zhao, Zixiang Di, Hong Qian +9Large Language Model-Guided OptimizationRL for Language Model Reasoning

  2. OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

    Jun 24, 2026Wenxuan Jiang, Zining Fan, Zijian Zhang +6Open-Ended GenerationIntrinsic Reward Methods

  3. Learning with a Single Rollout via Monte Carlo Pass@k Critic

    Jun 24, 2026Fengdi Che, Yang Liu, Lei Yu +4RL for Language Model ReasoningCredit Assignment in RL

  4. Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

    Jun 24, 2026Yutong Yin, Mingyu Jin, Jin Pan +12RL for Language Model ReasoningTest-Time Scaling

  5. Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR

    Jun 23, 2026Yongjin Yang, Jiarui Liu, Yinghui He +3RL for Language Model ReasoningCurriculum RL

  6. ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

    Jun 23, 2026Wenyang Hu, Junxiang Jia, Zhen Shu +3RL for Language ModelsRL for Language Model Reasoning

  7. Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning

    Jun 23, 2026Tianyuan Shi, Canbin Huang, Bei Li +4RL for Language Model ReasoningLanguage Model Distillation

  8. SPIRAL: Learning to Search and Aggregate

    Jun 22, 2026Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li +5Reinforcement LearningRL for Language Model Reasoning

  9. What are Key Factors for Updates in RL for LLM Reasoning?

    Jun 21, 2026Peidong Wang, Demi Wang, Xufang Luo +5Reinforcement LearningRL for Language Model Reasoning

  10. Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model

    Jun 21, 2026Pengxiang Cai, Tianchen Fang, Xiaohan Li +3RL for Language Model ReasoningCurriculum RL

  11. Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning

    Jun 21, 2026Zicheng Xu, Ruixuan Zhang, Yu-Neng Chuang +7Reinforcement LearningRL for Language Model Reasoning

  12. Fine-Tuning Large Language Models for Quantum Reasoning

    Jun 20, 2026Katherine Ip, Casey R. Myers, Udaya Parampalli +2LLM Fine-TuningRL for Language Model Reasoning

  13. Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

    Jun 20, 2026Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin ParkCompositional ReasoningRL for Language Model Reasoning

  14. CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

    Jun 18, 2026Yifan Shen, Pei Tian, Xinzhuo Li +8RL for Language Model ReasoningMixture-of-Experts Inference

  15. VIMPO: Value-Implicit Policy Optimization for LLMs

    Jun 18, 2026Zhewei Kang, Aosong Feng, Sergey Levine +2RL for Language Model ReasoningPolicy Optimization

  16. ADaPT: Token-Level Decoupling for Efficient Large Reasoning Models

    Jun 18, 2026Tingyun Li, Zishang Jiang, Jinyi Han +8Inference-Time OptimizationRL for Language Model Reasoning

  17. Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning

    Jun 18, 2026Xuanzhi Feng, Zhengyang Li, Zeyu Liu +6Reinforcement LearningRL for Language Model Reasoning

  18. STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability

    Jun 17, 2026Haipeng Luo, Qingfeng Sun, Songli Wu +4RL for Language Model ReasoningMaximum Entropy RL

  19. GraphPO: Graph-based Policy Optimization for Reasoning Models

    Jun 17, 2026Yuliang Zhan, Xinyu Tang, Jian Li +7Reinforcement LearningLLM Reasoning with Graphs

  20. REVES: REvision and VErification--Augmented Training for Test-Time Scaling

    Jun 17, 2026Yuanxin Liu, Ruida Zhou, Xinyan Zhao +6LLM Self-CorrectionLLM Answer Verification

  21. Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

    Jun 17, 2026Zhilin Huang, Hang Gao, Ziqiang Dong +6LLM Self-CorrectionCoT Distillation

  22. Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards

    Jun 17, 2026Yingyu Shan, Yuhang Guo, Zihao Cheng +7Token-Level Credit AssignmentRL for Language Model Reasoning

  23. From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning

    Jun 16, 2026Lingjing Kong, Xin Liu, Guangyi Chen +9LLM Fine-TuningRL for Language Model Reasoning

  24. Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models

    Jun 16, 2026Zihao Wei, Wenjie Shi, Liang Pang +8Overthinking in Language ModelsRL for Language Model Reasoning