RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning

    May 26, 2026Shijin Gong, Erhan Xu, Kai Ye +3RL for Language Model ReasoningCritic-Free RL

  2. Learning When to Think While Listening in Large Audio-Language Models

    May 26, 2026Zhiyuan Song, Weici Zhao, Yang Xiao +3Audio QARL for Language Model Reasoning

  3. GeoFaith: A Spatio-Temporal Dual View of Faithful Chain-of-Thought

    May 26, 2026Weijiang Lv, Wentong Zhao, Jiayu Wang +3CoT FaithfulnessRL for Language Model Reasoning

  4. Ratio-Variance Regularized Policy Optimization

    May 26, 2026Yu Luo, Shuo Han, Yihan Hu +5RL for Language Model ReasoningPolicy Optimization

  5. RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

    May 25, 2026Mingchen Li, Hansi Zeng, Zhuo Qian +3RL for Language Model ReasoningCredit Assignment in RL

  6. LECTOR: Joint Optimization of Scientific Reasoning Graphs and Introduction Generation

    May 25, 2026Jiabei Xiao, Yizhou Wang, Chen Tang +3RL for Language Model ReasoningAI-Assisted Scientific Research

  7. When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards

    May 25, 2026Li Wang, Xiaodong Lu, Xiaohan Wang +5Reinforcement LearningRL for Language Model Reasoning

  8. Reinforcement Learning from Denoising Feedback

    May 25, 2026Qi He, Huan Chen, Ya Guo +3RL for Language Model ReasoningRL for Diffusion Models

  9. Extreme Region Policy Distillation

    May 25, 2026Changyu Chen, Xiting Wang, Rui YanKL-Regularized RLRL for Language Model Reasoning

  10. AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution

    May 25, 2026Zehao Wang, Yihan Zeng, Zidong Gong +5RL for Language Model ReasoningMultimodal Large Language Models

  11. Credit Assignment with Resets in Language Model Reasoning

    May 25, 2026Ankur Samanta, Akshayaa Magesh, Ayush Jain +7RL for Language Model ReasoningCredit Assignment in RL

  12. Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models

    May 25, 2026Zongji Yu, Wenshui Luo, Yiliu Sun +5Reinforcement LearningRL for Language Model Reasoning

  13. Not only where, But when: Temporal Scheduling for RLVR

    May 25, 2026Jinghao Zhang, Ruilin Li, Feng Zhao +1RL for Language Model ReasoningCredit Assignment in RL

  14. Quantifying Empirical Compute-Supervision Tradeoffs in RLVR

    May 24, 2026Ryo Mitsuhashi, Patrick Chen, Isabelle Tseng +2Reinforcement LearningRL for Language Model Reasoning

  15. Hide to Guide: Learning via Semantic Masking

    May 24, 2026Ruitao Liu, Qinghao Hu, Alex Hu +6Reward HackingRL for Language Model Reasoning

  16. Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models

    May 24, 2026Wenlong Deng, Jiaji Huang, Kaan Ozkara +4Reward HackingRL for Language Models

  17. Better, Faster: Harnessing Self-Improvement in Large Reasoning Models

    May 24, 2026Qihuang Zhong, Liang Ding, Juhua Liu +3Overthinking in Language ModelsRL for Language Model Reasoning

  18. Test-Time Deep Thinking to Explore Implicit Rules

    May 24, 2026Wentong Chen, Xin Cong, Zhong Zhang +8RL for Language Model ReasoningLLM Agents

  19. HiMed: Incentivizing Hindi Reasoning in Medical LLMs

    May 23, 2026Dingfeng Jiang, Han Yan, Chenze Ma +12Multilingual Language ModelsHealthcare

  20. Learning to Reason Efficiently with A* Post-Training

    May 23, 2026Andreas Opedal, Francesco Ignazio Re, Abulhair Saparov +3Process Reward ModelsRL for Language Model Reasoning

  21. RL with Learnable Textual Feedback: A Bilevel Approach

    May 23, 2026Utsav Singh, Sidhaarth Sredharan, Souradip Chakraborty +1Reinforcement LearningRL for Language Model Reasoning

  22. Understanding and Mitigating Premature Confidence for Better LLM Reasoning

    May 23, 2026Jingchu Gai, Guanning Zeng, Christina Baek +4Confidence Estimation in Language ModelsRL for Language Model Reasoning

  23. State commitment learning: training language models to distinguish computation from memory

    May 22, 2026Fei Ding, Yongkang Zhang, Runhao Liu +3RL for Language Model Reasoning

  24. Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals

    May 22, 2026Sirui Chen, Lei Xu, Yuying Zhao +6Process Reward ModelsRL for Language Model Reasoning

  25. Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework

    May 21, 2026Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash +2Multi-Objective Reinforcement LearningIntrinsic Reward Methods