RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. From Rollouts to Recipes: Self-Contained Post-Training for LLMs

    Sep 1, 2026Yifei Li, Lingling Zhang, Muye Huang +3Self-Training for Language ModelsRL for Language Model Reasoning

  2. From Base Rollouts to RL Reasoning: A Budgeted Search Perspective

    Sep 1, 2026Wenhe Sun, Cunxiang Wang, Zijun Yao +1Inference-Time SearchRL for Language Model Reasoning

  3. CRAFT: Fine-Tuning Pre-hoc Explainability in AI-native 6G RAN

    Sep 1, 2026Pranshav Gajjar, Vijay K Shah6G NetworksLLM Interpretability

  4. Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

    Aug 31, 2026Zhiqin Yang, Jingwen Fu, Yuhan Liu +16Reinforcement LearningRL for Language Model Reasoning

  5. GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning

    Aug 31, 2026Outongyi Lv, Yuanwei Zhang, Xiaoqun ZhangRL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  6. Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

    Aug 31, 2026Jiani Guo, Junjie Wang, Jie Wu +5RL for Language Model ReasoningCredit Assignment in RL

  7. COGTRL: Training LLMs for Scientific Discovery Assistance using Cognitive Traces via Reinforcement Learning

    Aug 31, 2026Shrinidhi Kumbhar Santosh Mashetty Divij Handa Kevin Coutinho, Siddharth Sambhaji Ghule, Chitta BaralRL for Language Model ReasoningLLM Post-Training

  8. Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula

    Aug 30, 2026Vinoth Selvendran, Zhanming ZhangReward ModelingRL for Language Model Reasoning

  9. ManGo: Manga Active Narrative Grounding Optimization

    Aug 30, 2026Hao Qiu, Junyan Wang, Zheyuan Liu +4Visual Question AnsweringRL for Language Model Reasoning

  10. JPO: Juris Policy Optimization for Structured Legal Reasoning in Criminal Judgment Prediction

    Aug 30, 2026Zhaolu Kang, Yantao Liu, Tailong Luo +14Legal NLPLegal Judgment Prediction

  11. ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning

    Aug 28, 2026Xin Jiang, Minhao Wang, Wen Wu +4Reward ShapingRL for Language Model Reasoning

  12. SPEAR: Distilling Domain-Adaptive Reasoning Skeletons via Sequential Symbolic Alignment in Reinforcement Learning

    Aug 27, 2026Zhuochun Li, Yuelyu Ji, Yiming Zeng +1Process Reward ModelsRL for Language Model Reasoning

  13. On-policy Distillation with Verifiable Reward

    Aug 25, 2026Wenze Lin, Jiale Zhao, Xitai Jiang +5RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  14. Beyond Forgetting: Diagnosing and Harnessing Shared Reasoning in Continual RLVR

    Aug 19, 2026Lirui Luo, Guoxi Zhang, Hongming Xu +3RL for Language Model ReasoningReplay-Based Continual Learning

  15. GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

    Aug 12, 2026Kai Yang, Jingwei Xu, Wanyu Wang +4RL for Language Model ReasoningConstrained RL

  16. Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs

    Aug 12, 2026Vu Duc Anh, Nhat M. Hoang, Do Xuan Long +3LLM Self-CorrectionDirect Preference Optimization

  17. PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR

    Aug 11, 2026Pixel Nomand, Elena Voss, Marcus Hale +1Inverse Probability WeightingReinforcement Learning

  18. Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation

    Aug 10, 2026Yubo Jiang, Fengying Xie, Zhiguo Jiang +1On-Policy Self-DistillationRL for Language Model Reasoning

  19. Parameter Exploration for RLVR via Variational Learning

    Aug 10, 2026Vatsal Venkatkrishna, Nico Daheim, Iryna GurevychRL for Language Model ReasoningRL Exploration

  20. CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning

    Aug 10, 2026Ambuj Mehrish, Sebastiano VasconReward ModelingRL for Language Models

  21. Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

    Aug 10, 2026Ting Zhou, Zhenqing Ling, Daoyuan Chen +4Reinforcement LearningRL for Language Model Reasoning

  22. Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training

    Aug 8, 2026Binwen Tan, Jingchao Wang, Dengzhe Hou +6RL for Language Model ReasoningMulti-Task RL

  23. DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

    Aug 6, 2026ZhiYan Hou, Xinyu Tang, Hongyan An +9On-Policy Self-DistillationRL for Language Model Reasoning

  24. Contextual Information Policy Optimization for Search Agents

    Aug 6, 2026Xingyu Guo, Wei Chen, Linlin Yang +1Evidence-Grounded ReasoningRL for Language Model Reasoning

  25. Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

    Aug 5, 2026Yinghui He, Ling Yang, Jiarui Liu +6LLM EvaluationReasoning Evaluation