RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Hierarchical Latent Reasoning for LLM-based Recommendation

    Jul 30, 2026Peiyu Hu, Siying Gu, Weihai Lu +8Sequential RecommendationRL for Language Model Reasoning

  2. ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

    Jul 30, 2026Zhenrong Zhang, Fei Wu, Jun Du +2RL for Language Model ReasoningCredit Assignment in RL

  3. Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

    Jul 30, 2026Haodong Zhu, Yangyang Ren, Yanjing Li +4RL for Language Model ReasoningCurriculum RL

  4. ReCo: Reweighting GRPO Against Distributional Concentration

    Jul 29, 2026Junoh Park, Junseo Hwang, Wonguk Cho +1Reasoning DiversityRL for Language Model Reasoning

  5. Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

    Jul 28, 2026Pixel Nomand, Elena Voss, Marcus Hale +1Reinforcement LearningRL for Language Model Reasoning

  6. Training Language Models to Cooperate with Inference-Time Controllers

    Jul 26, 2026Moumita Choudhury, Vanshaj Khattar, Jing Liu +4RL for Language Model ReasoningLLM Post-Training

  7. Offline-Online Curriculum RL for Multimodal Reasoning

    Jul 26, 2026Wendi Deng, Hang Du, Guoshun Nan +11Reinforcement LearningRL for Language Model Reasoning

  8. Traceable LLM Reasoning for Fake-Order Fraud Detection

    Jul 25, 2026Siqi You, Bingsong Xu, Zhixian Zheng +4RL for Language Model ReasoningFinancial Fraud Detection

  9. Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

    Jul 24, 2026Siyuan Huang, Pengyu Cheng, Haotian Liu +10RL for Language Model ReasoningLLM Agent Skill Learning

  10. Deconstructing Off-Policy Ratios: Entropy-Normalized Trust Regions for Asynchronous Reinforcement Learning

    Jul 24, 2026Guanqun Zhao, Zijun Xie, Binbin Zheng +5Asynchronous RLRL for Language Model Reasoning

  11. QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization

    Jul 23, 2026Siwei Chen, Siqi Chen, Xupeng Miao +1Overthinking in Language ModelsRL for Language Model Reasoning

  12. AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning

    Jul 23, 2026Zibin Meng, Zhenyu Zhao, Chunqiang RunKnowledge Augmentation for Language ModelsRL for Language Model Reasoning

  13. Training Large Language Models for Self-Explanation Faithfulness

    Jul 23, 2026Yeoktatt Cheah, María Pérez-Ortiz, Noah Y. Siegel +1Faithfulness of Language Model ExplanationsLLM Interpretability

  14. SLPO: Scaling Latent Reasoning via a Surrogate Policy

    Jul 22, 2026Runyang You, Zhiyuan Liu, Yongqi Li +1Reinforcement LearningRL for Language Model Reasoning

  15. Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

    Jul 21, 2026Lizhe Fang, Weizhou Shen, Tianyi Tang +1LLM GroundingReward Shaping

  16. Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

    Jul 21, 2026Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou +4Reinforcement LearningRL for Language Model Reasoning

  17. The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation

    Jul 21, 2026Michael Jungo, Aixiu AnRL for Language ModelsRL for Language Model Reasoning

  18. REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning

    Jul 21, 2026Yunjie Chen, Xiaoxin Chen, Fang WangRL for Language ModelsRL for Language Model Reasoning

  19. Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

    Jul 21, 2026Wentao Zhang, Haoyu Zhang, Xinke Jiang +7RL for Language Model ReasoningShapley Value Attribution

  20. H2^2SD: Hybrid Hindsight Self-Distillation

    Jul 21, 2026Qiye Cai, Yichuan Ma, Peiji Li +6RL for Language Model ReasoningLanguage Model Distillation

  21. Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

    Jul 20, 2026Jia Ao Sun, Hao Yu, Fengran Mo +4LLM Reasoning with GraphsRL for Language Model Reasoning

  22. RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts

    Jul 20, 2026Yuxin Xiong, Xunyi Jiang, Rohan Surana +8Reinforcement LearningRL for Language Model Reasoning

  23. MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

    Jul 20, 2026Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov +3RL for Language Model ReasoningMulti-Agent Debate

  24. DeLIVeR: Decomposed Learning for Information-grounded Veracity Recognition via Reinforced Knowledge Graph Exploration

    Jul 20, 2026Cong Hoan Nguyen, Thomas Hoang, Hieu Minh Duong +1LLM GroundingRL for Language Model Reasoning