RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. QUATRO: Query-Adaptive Trust Region Policy Optimization for LLM Fine-tuning

    Feb 4, 2026Doyeon Lee, Eunyi Lyou, Hyunsoo Cho +3RL for Language Model ReasoningPolicy Optimization

  2. Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning

    Feb 1, 2026Yu Li, Mingyang Yi, Xiuyu Li +6RL for Language Model ReasoningGradient Interference

  3. Why GRPO Needs Normalization: A Local-Curvature Perspective on Adaptive Gradients

    Jan 30, 2026Cheng Ge, Caitlyn Heqi Yin, Hao Liang +1RL for Language Model ReasoningGroup Relative Policy Optimization

  4. Divide-and-Conquer CoT: RL for Reducing Latency via Parallel Reasoning

    Jan 30, 2026Arvind Mahankali, Kaiyue Wen, Tengyu MaMulti-Agent LLM SystemsCoT Reasoning

  5. HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning

    Jan 30, 2026Weiqi Wang, Xin Liu, Binxuan Huang +13RL for Language ModelsRL for Language Model Reasoning

  6. Thinking Seeds: Leveraging Historical Diversity for Position-Aware RL in LLMs

    Jan 29, 2026Lei Yang, Wei Bi, Chenxi Sun +2RL for Language Model ReasoningRL Exploration

  7. Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution

    Jan 28, 2026Zhengbo Jiao, Hongyu Xian, Qinglong Wang +5RL for Language Model ReasoningTest-Time Training

  8. Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability

    Jan 26, 2026Shobhita Sundaram, John Quan, Ariel Kwiatkowski +3Self-Play RLRL for Language Model Reasoning

  9. CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning

    Jan 21, 2026Tianshi Xu, Yuteng Chen, Meng LiAgentic RLReinforcement Learning

  10. R2^2PO: Decoupling Rollout and Inference Policies for LLM Reasoning

    Jan 17, 2026Jingchu Wang, Bingbing Xu, Yige Yuan +4RL for Language Model ReasoningPolicy Optimization

  11. Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs

    Jan 16, 2026Lecheng Yan, Ruizhe Li, Guanhua Chen +5Reward HackingMemorization in Language Models

  12. SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models

    Jan 7, 2026Yuxuan Jiang, Francis FerraroProcess Reward ModelsRL for Language Model Reasoning

  13. KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering

    Dec 10, 2025Xin Sun, Zhongqi Chen, Xing Zheng +6LLM GroundingRL for Language Model Reasoning

  14. Training Language Models to Use Prolog as a Tool

    Dec 8, 2025Niklas Mellgren, Peter Schneider-Kamp, Lukas Galke PoechReward HackingLogical Reasoning

  15. Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization

    Nov 25, 2025Chenliang Li, Adel Elmahdy, Alex Boyd +7RL for Language Model ReasoningImportance Sampling

  16. ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models

    Nov 24, 2025Long Lian, Sida Wang, Felix Juefei-Xu +7RL for Language Model ReasoningInference-Time Scaling

  17. Reinforcement Learning Improves Traversal of Parametric Knowledge in LLMs

    Nov 8, 2025Renfei Zhang, Manasa Kaniselvan, Rylan Schaeffer abd Niloofar MireshghallahRL for Language Model ReasoningFactual Knowledge in Language Models

  18. OpenSIR: Open-Ended Self-Improving Reasoner

    Nov 1, 2025Wai-Chung Kwan, Joshua Ong Jun Leang, Pavlos Vougiouklis +3Self-Play RLRL for Language Model Reasoning

  19. Learning to Reason Efficiently with Discounted Reinforcement Learning

    Oct 27, 2025Alex Ayoub, Kavosh Asadi, Dale Schuurmans +2Reinforcement LearningRL for Language Model Reasoning

  20. Representation-Based Exploration for Language Models: From Test-Time to Post-Training

    Oct 13, 2025Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy +1RL for Language Model ReasoningTest-Time Scaling

  21. Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts

    Oct 10, 2025Xinyi Wang, Jinyi Han, Zishang Jiang +7Reinforcement LearningRL for Language Model Reasoning

  22. CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts

    Oct 10, 2025Jiuheng Lin, Cong Jiang, Zirui Wu +2RL for Language ModelsRL for Language Model Reasoning

  23. Base Models Know How to Reason, Thinking Models Learn When

    Oct 8, 2025Constantin Venhoff, Iván Arcuschin, Philip Torr +2LLM InterpretabilityRL for Language Model Reasoning

  24. Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs

    Oct 5, 2025Zishang Jiang, Jinyi Han, Tingyun Li +7RL for Language Model ReasoningLLM-Guided RL

  25. Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression

    Oct 2, 2025Joykirat Singh, Justin Chih-Yao Chen, Archiki Prasad +3RL for Language Model ReasoningLLM Inference Acceleration

  26. Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers

    Oct 1, 2025Xin-Qiang Cai, Wei Wang, Feng Liu +3Reinforcement LearningRL for Language Model Reasoning

  27. Interactive Learning for LLM Reasoning

    Sep 30, 2025Hehai Lin, Shilei Cao, Sudong Wang +5RL for Language Model ReasoningLLM Agent Training

  28. TagPR: Tag-Guided Process Supervision for Personalization Reasoning in Large Language Models

    Sep 27, 2025Song Jin, Juntian Zhang, Ruyu Lyu +7LLM AlignmentLLM Personalization