RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Spectral Rewiring for Exploration, Purification, and Model Merging

    Jul 3, 2026Zhilong Zhang, Hongli Yu, Huan-ang Gao +5RL for Language Model ReasoningRL Post-Training

  2. Reinforcement Learning for Evidence-Seeking Diagnostic Reasoning with Large Language Models

    Jul 3, 2026Shengyi Hua, Kangzhe Hu, Conghui He +2Medical DiagnosisRL for Language Model Reasoning

  3. DemoPSD: Disagreement-Modulated Policy Self-Distillation

    Jul 2, 2026Yunhe Li, Hao Shi, Wenhao Liu +5On-Policy Self-DistillationRL for Language Model Reasoning

  4. Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL

    Jul 1, 2026Juliette Decugis, Sean O'Brien, Francis Bach +2Policy GradientRL for Language Model Reasoning

  5. FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning

    Jul 1, 2026Zhiyun Zhang, Liwen Sun, Xiang Qian +1RL for Language Model ReasoningProcess Supervision

  6. Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination

    Jul 1, 2026Subhadeep Pal, Shashwat Sourav, Tirthankar Ghosal +1LLM Reasoning with GraphsRL for Language Model Reasoning

  7. Linguistic Relative Policy Optimization for Video Anomaly Reasoning

    Jul 1, 2026Jiaxu Leng, Jiankang Zheng, Mengjingcheng Mo +4VLM AdaptationRL for Language Model Reasoning

  8. SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing

    Jun 30, 2026Ruikang Zhao, Zhenting Wang, Han Gao +1Reinforcement LearningRL for Language Model Reasoning

  9. RareDxR1: Autonomous Medical Reasoning for Rare Disease Diagnosis Beyond Human Annotation

    Jun 30, 2026Deyang Jiang, Haoran Wu, Ziyi Wang +4Rare Disease DiagnosisRL for Language Model Reasoning

  10. Addressing Over-Refusal in LLMs with Competing Rewards

    Jun 30, 2026Taeyoun Kim, Aviral KumarRL for Language Model ReasoningLLM Safety

  11. Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index

    Jun 30, 2026Outongyi Lv, Yanzhao Zheng, Yuanwei Zhang +5Reinforcement LearningRL for Language Model Reasoning

  12. Experience Augmented Policy Optimization for LLM Reasoning

    Jun 29, 2026Jinda Lu, Kexin Huang, Junkang Wu +7Reinforcement LearningRL for Language Model Reasoning

  13. DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

    Jun 29, 2026Haisen Luo, Yiwei Liu, Haoning Wang +13Self-Training for Language ModelsRL for Language Model Reasoning

  14. LatentRevise: Learning from Zero-Hit Reasoning

    Jun 29, 2026Yiqiu Guo, Xueting Han, Qi Jia +2RL for Language Model ReasoningMathematical Reasoning

  15. PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

    Jun 29, 2026Doo Hwan Hwang, Kee-Eung KimReinforcement LearningRL for Language Model Reasoning

  16. To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation

    Jun 28, 2026Jiuheng Lin, Chen Zhang, Yansong FengCoT FaithfulnessReward Modeling

  17. Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

    Jun 28, 2026Chao Wang, Hongtao Tian, Tao Yang +3Reinforcement LearningProcess Reward Models

  18. BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

    Jun 27, 2026Yupeng Chang, Yuan Wu, Yi ChangReinforcement LearningRL for Language Model Reasoning

  19. Tandem Reinforcement Learning with Verifiable Rewards

    Jun 26, 2026Difan Jiao, Raghav Singhal, Robert West +1Reinforcement LearningRL for Language Model Reasoning

  20. MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy

    Jun 26, 2026Zhiyuan Han, Beier Zhu, Wenwen Tong +8RL for Language Model ReasoningMultimodal Large Language Models

  21. RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning

    Jun 25, 2026Rongjian Chen, Jianmin Hu, Kejiang Ye +1Reinforcement LearningRL for Language Model Reasoning