RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Continual Self-Improvement with Lightweight Experiential Latent Memories

    Jun 16, 2026Vaggelis Dorovatas, Nancy Kalaj, Rahaf AljundiContinual Learning for LLMsMemory-Augmented Language Models

  2. Rethinking Groups in Critic-Free RLVR

    Jun 15, 2026Yihong Wu, Liheng Ma, Lingfeng Xiao +4Reinforcement LearningRL for Language Model Reasoning

  3. GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

    Jun 15, 2026Maram Hasan, Aman Verma, Savitra Roy +5Disaster Damage AssessmentRL for Language Model Reasoning

  4. ExpRL: Exploratory RL for LLM Mid-Training

    Jun 15, 2026Violet Xiang, Amrith Setlur, Chase Blagden +2Reinforcement LearningRL for Language Model Reasoning

  5. Latent Thought Flow: Efficient Latent Reasoning in Large Language Models

    Jun 15, 2026Xiandong Zou, Jing Huang, Jianshu Li +1RL for Language Model ReasoningEfficient Language Model Reasoning

  6. STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning

    Jun 14, 2026Qinjian Zhao, Zhihao Dou, Dinggen Zhang +10RL for Language Model ReasoningCredit Assignment in RL

  7. Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

    Jun 14, 2026Yu Li, Shu Hong, Tian LanRL for Language Model ReasoningCredit Assignment in RL

  8. Understanding Diversity Collapse in RLVR via the Lens of Overtraining

    Jun 13, 2026Suqin Yuan, Jinkun Chen, Jiyang Zheng +6Reinforcement LearningReasoning Diversity

  9. CoRA: Confidence-Rationale Alignment for Reliable Chain-of-Thought Reasoning

    Jun 12, 2026Juming Xiong, Weixin Liu, Kevin Guo +9CoT ReasoningRL for Language Model Reasoning

  10. AdaSR: Adaptive Streaming Reasoning with Hierarchical Relative Policy Optimization

    Jun 12, 2026Junlong Tong, Wenqi Xu, Yingqi Fan +4Adaptive InferenceRL for Language Model Reasoning

  11. Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning

    Jun 11, 2026Zilin Xiao, Qi Ma, Chun-cheng Jason Chen +4Analogical ReasoningRL for Language Model Reasoning

  12. ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages

    Jun 11, 2026Tanmoy Kanti Halder, Akash Ghosh, Subhadip Baidya +2Multilingual Language ModelsRL for Language Model Reasoning

  13. ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning

    Jun 11, 2026Xucong Wang, Ziyu Ma, Yong Wang +5RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  14. Mental-R1: Aligning LLM Reasoning for Mental Health Assessment

    Jun 11, 2026Xin Wang, Boyan Gao, Yibo Yang +1Cognitive ModelingMedical Diagnosis

  15. Select and Improve: Understanding the Mechanics of Post-Training for Reasoning

    Jun 11, 2026Akshay Krishnamurthy, Audrey Huang, Nived RajaramanRL for Language Model ReasoningRL Post-Training

  16. Verifiable Environments Are LEGO Bricks: Recursive Composition for Reasoning Generalization

    Jun 10, 2026Hao Xiang, Qiaoyu Tang, Le Yu +8RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  17. The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning

    Jun 10, 2026Theo Uscidda, Marta Tintore Gazulla, Maks Ovsjanikov +2Reinforcement Learning3D Spatial Reasoning

  18. RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation

    Jun 10, 2026Leyi Pan, Shuchang Tao, Yunpeng Zhai +5RL for Language Model ReasoningLanguage Model Distillation

  19. Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

    Jun 10, 2026Kai Liu, Peijie Dong, Xinchen Xie +5RL for Language Model ReasoningLLM Inference Acceleration

  20. The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes

    Jun 9, 2026Avinash Anand, Mahisha Ramesh, Avni Mittal +7CoT ReasoningRL for Language Model Reasoning