Reward Design for RL

RL: Reinforcement Learning

Momentum

23 papers in the last four weeks, up 64% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 167

All topics
CardsList
  1. Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula

    Aug 30, 2026Vinoth Selvendran, Zhanming ZhangReward ModelingRL for Language Model Reasoning

  2. Towards Socially Compliant Navigation in Deep Reinforcement Learning via Proxemics-Based Reward Modeling

    Aug 13, 2026Takieddine Soualhi, Jacques Saraydaryan, Laetitia MatignonRL for RoboticsSocial Robot Navigation

  3. Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

    Aug 12, 2026Minglai Yang, Xinyu Guo, Utkarsh Tyagi +6Reward HackingRubric-Based RL

  4. CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning

    Aug 10, 2026Ambuj Mehrish, Sebastiano VasconReward ModelingRL for Language Models

  5. RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning

    Aug 10, 2026Jinkun Hou, Zhuo Liu, Huimin Ren +3Open-Ended GenerationRL for Language Models

  6. Multi-Agent Reinforcement Learning via Agent-Specific Preference

    Aug 9, 2026Ni Mu, Yao Luan, Yiqin Yang +1Decentralized MARLCooperative MARL

  7. A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning

    Aug 8, 2026Fouad BahrpeymaReward ShapingReward Design for RL

  8. RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

    Aug 6, 2026Chenglong Wang, Ziming Zhu, Yifu Huo +9Reward ModelingRL for Language Models

  9. Training a Conditioned Video Game Agent on a VLM Annotated Dataset

    Aug 6, 2026Katrin Schmid, Iuri FrosioReinforcement LearningReward Design for RL

  10. Reward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement Learning

    Aug 5, 2026Jai Malegaonkar, Rohan Patil, Henrik I. ChristensenReinforcement LearningPartially Observable RL

  11. GORDON: Graph-based Object-centric Rewards for Decomposition of Long-Horizon Manipulation

    Aug 4, 2026Andrea Protopapa, Davide Buoso, Francesca Pistilli +2Long-Horizon Robotic ManipulationLearning from Demonstration

  12. DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards

    Aug 1, 2026Yunhao Wang, Binghong Wu, Zhenyu Huang +4Reward ShapingDocument Parsing

  13. LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

    Jul 31, 2026Manith Adikari, Bei Peng, Samuele Vinanzi +1Multi-Objective Reinforcement LearningReinforcement Learning

  14. Beyond Binary Rewards: A Comparative Study of Reward Design for Reinforcement Unlearning

    Jul 30, 2026Efstratios Zaradoukas, Davide Gabrielli, Bardh Prenkaj +1Reinforcement Learning with Verifiable RewardsMachine Unlearning

  15. Reinforcement Learning for Code Optimization

    Jul 28, 2026Pierre Chambon, Kunhao Zheng, Juliette Decugis +2RL for Code GenerationReinforcement Learning

  16. Optimal Reward Shaping: Autonomous Car Parking Case Study

    Jul 26, 2026Emre Özkaya, Nicolas R. GaugerDeep Q-LearningAutonomous Parking

  17. Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

    Jul 24, 2026Cheng Ruoxi, Ma Haoxuan, Zhang Hongyi +7Retrieval-Augmented GenerationLLM Grounding

  18. Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

    Jul 23, 2026Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali JannesariRL for Code GenerationGPU Kernel Optimization

  19. CriPO: Enhancing Rubric-based RL via Self-Distillation

    Jul 20, 2026Mingxuan Xia, Yuhang Yang, Chao Ye +7Credit Assignment in RLRubric-Based RL

  20. CORAL: Learning Amyloid Fibril Ligand Docking with Cooperative Binding Rewards

    Jul 19, 2026Yasheng Sun, Bohan Li, Youqi Tao +1Reward Design for RLDrug Discovery

  21. Principled Direction-Free Intrinsic Motivation through Model-Free Epistemic Free-Energy Estimators

    Jul 18, 2026Alireza Furutanpey, Schahram DustdarFree Energy CalculationIntrinsic Reward Methods

  22. CLaC@FinMMEval 2026 Task 3: Sentiment-Augmented Deep Reinforcement Learning for Active Trading -- An Alpha-Reward Approach

    Jul 17, 2026Andrei Neagu, Eeham Khan, Leila KosseimReinforcement LearningDeep Q-Learning