RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning

    Jun 3, 2026Chongyang He, Rui Zhang, Zixuan Wang +1Supervised Fine-TuningRL for Language Model Reasoning

  2. QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards

    Jun 2, 2026Rongzhi Zhang, Rui Feng, Zhihan Zhang +8Reinforcement LearningRL for Language Model Reasoning

  3. PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models

    Jun 2, 2026Zetian Ouyang, Linlin Wang, Gerard de Melo +1Numerical Reasoning in Language ModelsMathematical Reasoning Benchmarks

  4. Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning

    Jun 2, 2026Hongye Cao, Nuo Yan, Haoyuan Deng +5Agentic RLRL for Language Model Reasoning

  5. Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification

    Jun 2, 2026Jiahui Li, Jianfeng Shan, Wenpei Chen +5Reinforcement LearningLLM Answer Verification

  6. CAPER: Clause-Aligned Process Supervision for Text-to-SQL

    Jun 2, 2026Lujie Ban, Jiasheng Shi, Jinyang Li +3Process Reward ModelsRL for Language Model Reasoning

  7. Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning

    Jun 2, 2026Ziyue Wang, Aomufei Yuan, Yongfu Zhu +10LLM AlignmentRL for Language Model Reasoning

  8. FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data

    Jun 2, 2026Pengyu Chen, Shaowei Li, Kai Wang +4Federated Learning AggregationFederated RL

  9. Hint-Guided Diversified Policy Optimization for LLM Reasoning

    Jun 2, 2026Zhiyu Cao, Kaixin Wu, Mingjie Zhong +4Reasoning DiversityRL for Language Model Reasoning

  10. Learning When to Translate for Multilingual Reasoning

    Jun 1, 2026Deokhyung Kang, Hyounghun Kim, Gary Geunbae LeeMultilingual Language ModelsCross-Lingual Reasoning in Language Models

  11. Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning

    Jun 1, 2026Liuji Chen, Dianxing Tang, Xing Shi +4Agentic RLRL for Language Model Reasoning

  12. Cross-lingual Self-Consistency for Multilingual Reasoning with Language Models

    May 31, 2026Ahmed Elhady, Eneko Agirre, Mikel ArtetxeMultilingual Language ModelsCross-Lingual Reasoning in Language Models

  13. Deep Research as Rubric for Reinforcement Learning

    May 31, 2026Wangyi Mei, Zhouhong Gu, Zhenhan Bai +9Open-Ended GenerationReinforcement Learning

  14. Enhancing LLM Metacognition via Cognitive Pairwise Training

    May 30, 2026Weitao Li, Hao Zhou, Xuanyu Lei +11Pairwise Preference LearningRL for Language Model Reasoning

  15. The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs

    May 30, 2026Zihan Chen, Yiming Zhang, Wenxiang Geng +2Process Reward ModelsRL for Language Model Reasoning

  16. PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning

    May 29, 2026Daize Dong, Junlin Chen, Haolong Jia +9RL for Language Model ReasoningExpert Routing

  17. Are Full Rollouts Necessary for On-Policy Distillation?

    May 29, 2026Yaocheng Zhang, Jiajun Chai, Yuqian Fu +7RL for Language Model ReasoningLanguage Model Distillation

  18. CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO

    May 29, 2026Yang Li, Gongle Xue, Yijia Guo +3RL for Language Model ReasoningGroup Relative Policy Optimization

  19. EchoRL: Reinforcement Learning via Rollout Echoing

    May 29, 2026Jinhe Bi, Aniri, Minglai Yang +9Reinforcement LearningRL for Language Model Reasoning

  20. AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering

    May 29, 2026Yuxin Wang, Jiahao Lu, Qifeng Wu +5Multi-Hop QARL for Language Model Reasoning

  21. Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

    May 29, 2026Yuhuan Yuan, Zhouliang Yu, Minghao Liu +2Physical ReasoningVisual Spatial Reasoning