RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Information-Time Proximal Policy Optimization

    Sep 21, 2026Yongcheng Zeng, Xinyu Cui, Yan Song +9Reinforcement LearningRL for Language Model Reasoning

  2. When2Think: Learning When and How Much to Reason

    Sep 17, 2026Jaejun Shim, HyunJin Kim, Young Jin Kim +1Overthinking in Language ModelsRL for Language Model Reasoning

  3. Voice of Reason: Reinforcement Learning for Spoken Math

    Sep 16, 2026Timothée Weisselberger, Edouard Graves, Alexandre DéfossezNumerical Reasoning in Language ModelsRL for Language Model Reasoning

  4. STRETCH the Boundaries: A Unified Self-Taught Framework for Progressive LLM Evolution

    Sep 16, 2026Yajie Yu, Mark Lee, Yue FengSelf-Training for Language ModelsRL for Language Model Reasoning

  5. Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces

    Sep 16, 2026Naveen Vakada, Mingyuan Li, Shaoxiong JiFine-TuningTest-Time Adaptation of VLMs

  6. Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation

    Sep 15, 2026Shiqi Liu, Zeyu He, Letian Tao +9RL for Language Model ReasoningTemporal Credit Assignment

  7. Rewarding Reasoning, Not Answers: Fixing and Bounding Test-Time Reinforcement Learning on Medical QA

    Sep 15, 2026Kailong Fan, Anqi Pu, Yichen Wu +7Process Reward ModelsRL for Language Model Reasoning

  8. Bellman Policy Optimization

    Sep 14, 2026Zhuoqing Song, Haotian Xu, Xikun Zhang +1Reinforcement LearningRL for Language Model Reasoning

  9. Learning to Coach for Experiential Learning

    Sep 14, 2026Guanheng Chen, Tianzhu Ye, Li Dong +3RL for Language ModelsRL for Language Model Reasoning

  10. Reason What Matters: Retrieval-Grounded Reasoning for Universal Multimodal Embeddings

    Sep 14, 2026Mingzhou Jiang, Peixi Wu, Hang Cheng +7Multimodal IREfficient Multimodal Inference

  11. Why Sample What You Can Enumerate? Exact Policy Optimization for Genomic Tool Selection

    Sep 9, 2026Haoyue Liu, Xiaoyu Ma, Ye Chen +2RL for Language Model ReasoningGroup Relative Policy Optimization

  12. ThinkPrior: Zero-Rollout Difficulty Priors for Cold-Start Prompt Selection in RLVR

    Sep 8, 2026Tommy Sha, Skylar Zhai, Siqi ZhaoRL for Language Model ReasoningGroup Relative Policy Optimization

  13. Difficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR

    Sep 8, 2026Youngjun Yu, Sanghwan Jang, Hwanjo YuRL for Language Model ReasoningRL Exploration

  14. Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching

    Sep 7, 2026Preston Fu, Kevin Frans, Oleh Rybkin +2Reinforcement LearningReward Shaping

  15. VERPO: Verified Evidence Regularized Policy Optimization

    Sep 5, 2026Haijiang Li, Chengyu Lv, Yi Zhang +8RL for Language Model ReasoningCredit Assignment in RL

  16. First Things First: Teaching LLM-Based Agents to Prioritize Must-Haves before Nice-to-Haves

    Sep 4, 2026Tianjie Ju, Xinyue Xu, Wanxuan Sun +4RL for Language Model ReasoningAI Agent Benchmarks

  17. Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR

    Sep 3, 2026Boyan Li, Bingsen Chen, Chenghao Yang +3RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  18. Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO

    Sep 3, 2026Hyun Bin Park, Du-Seong ChangRL for Language Model ReasoningGroup Relative Policy Optimization

  19. Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards

    Sep 3, 2026Leqi Zheng, Jinbo Su, Fang Niu +8Numerical Reasoning in Language ModelsReward Shaping

  20. DE-Venus: A Data-Efficient RLVR Framework for Large Language Models

    Sep 3, 2026Shenzhi Yang, Guangcheng Zhu, Kai Tang +11RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  21. FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

    Sep 3, 2026Zixun Huang, Kishan Panaganti, Haitao Mi +1RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards