RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning

    Apr 23, 2026Yongcan Yu, Lingxiao He, Jian Liang +5Reinforcement LearningRL for Language Model Reasoning

  2. GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning

    Apr 22, 2026Jingyi Wang, Lei Zhu, Tengjin Weng +8RL for Language Model ReasoningGroup Relative Policy Optimization

  3. Where Reasoning Breaks: Logic-Aware Path Selection by Controlling Logical Connectives in LLMs Reasoning Chains

    Apr 22, 2026Seunghyun Park, Yuanyuan LeiInference-Time SearchRL for Language Model Reasoning

  4. Reinforcing privacy reasoning in LLMs via normative simulacra from fiction

    Apr 21, 2026Matt Franchi, Madiha Zahrah Choksi, Harold Triedman +1Contextual IntegrityPrivacy-Preserving Language Models

  5. Pause or Fabricate? Training Language Models for Grounded Reasoning

    Apr 21, 2026Yiwen Qiu, Linjuan Wu, Yizhou Liu +9LLM GroundingRL for Language Model Reasoning

  6. TEMPO: Scaling Test-time Training for Large Reasoning Models

    Apr 21, 2026Qingyang Zhang, Xinke Kong, Haitao Wu +7Reinforcement LearningInference-Time Optimization

  7. DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents

    Apr 21, 2026Shengqin Wang, Wentao Yan, Huichi Zhou +4Reward ShapingRL for Language Model Reasoning

  8. How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning

    Apr 21, 2026Zhiyuan Zhai, Xinkai You, Wenjing Yan +1LLM Inference EfficiencyRL for Language Model Reasoning

  9. OLLM: Options-based Large Language Models

    Apr 21, 2026Shashank Sharma, Janina Hoffmann, Vinay NamboodiriLLM AlignmentRL for Language Model Reasoning

  10. TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only

    Apr 21, 2026Yilun Liu, Ruihong Qiu, Zi HuangZero-Shot LearningLLM Reasoning with Graphs

  11. Fine-Tuning Small Reasoning Models for Quantum Field Theory

    Apr 21, 2026Nathaniel S. Woodward, Zhiqi Gao, Yurii Kvasiuk +3Physical ReasoningLLM Fine-Tuning

  12. Discrete Tilt Matching

    Apr 20, 2026Yuyuan Chen, Shiyi Wang, Peter Potaptchik +2Masked Diffusion ModelsRL for Language Model Reasoning

  13. When Can LLMs Learn to Reason with Weak Supervision?

    Apr 20, 2026Salman Rahman, Jingyan Shen, Anna Mordvina +3Supervised Fine-TuningRL for Language Model Reasoning

  14. OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning

    Apr 20, 2026Xinyu Ma, Mingzhou Xu, Xuebo Liu +4Reward ShapingRL for Language Model Reasoning

  15. Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data

    Apr 20, 2026Zhenwen Liang, Yujun Zhou, Sidi Lu +3Reinforcement LearningRL for Language Model Reasoning

  16. Knowing When to Quit: A Principled Framework for Dynamic Abstention in LLM Reasoning

    Apr 20, 2026Hen Davidov, Nachshon Cohen, Oren Kalinsky +4RL for Language Model ReasoningLLM Abstention

  17. Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes

    Apr 20, 2026Justin Bauer, Thomas Walshe, Derek Pham +4RL for Language Model ReasoningSmall Language Models

  18. Reducing Credit Assignment Variance via Counterfactual Reasoning Paths

    Apr 20, 2026Fei Ding, Yongkang Zhang, Youwei Wang +1RL for Language Model ReasoningCredit Assignment in RL

  19. Negative Advantages Is a Double-Edged Sword: Calibrating advantages in GRPO for Search Agents

    Apr 20, 2026Jiayi Wu, Ruobing Xie, Zeqian Huang +6Reinforcement LearningRL for Language Model Reasoning

  20. Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

    Apr 20, 2026Xiang He, Chenxing Li, Jinting Wang +5RL for Language Model ReasoningAudio Reasoning

  21. Neural Garbage Collection: Learning to Forget while Learning to Reason

    Apr 20, 2026Michael Y. Li, Jubayer Ibn Hamid, Emily B. Fox +1LLM CompressionMemory-Efficient Optimization

  22. HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment

    Apr 20, 2026Zhanyu Liu, Qingguo Hu, Ante Wang +5RL for Language Model ReasoningFew-Shot Learning

  23. Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought

    Apr 20, 2026Muhammed Emrullah Ildiz, Halil Alperen Gozeten, Ege Onur Taga +1CoT ReasoningRL for Language Model Reasoning

  24. LEPO: Latent Reasoning Policy Optimization for Large Language Models

    Apr 20, 2026Yuyan Zhou, Jiarui Yu, Hande Dong +4Reinforcement LearningRL for Language Model Reasoning

  25. Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play

    Apr 20, 2026Xiachong Feng, Deyi Yin, Xiaocheng Feng +9Self-Play RLRL for Language Model Reasoning

  26. Poly-EPO: Training Exploratory Reasoning Models

    Apr 19, 2026Ifdita Hasan Orney, Jubayer Ibn Hamid, Shreya S Ramanujam +5Reinforcement LearningRL for Language Model Reasoning

  27. Easy Samples Are All You Need: Self-Evolving LLMs via Data-Efficient Reinforcement Learning

    Apr 19, 2026Zhiyin Yu, Bo Zhang, Qibin Hou +3Self-Training for Language ModelsRL for Language Model Reasoning