LLM-Guided RL

RL: Reinforcement Learning

Momentum

8 papers in the last four weeks, up 60% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 76

All topics
CardsList
  1. From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning

    Jun 16, 2026Chao Chen, Chengzu Li, Zhiwei Li +2Reinforcement LearningLLM-Guided RL

  2. When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning

    Jun 15, 2026Nathan Gavenski, Juarez Monteiro, Francisco Galuppo +2LLM PlanningLLM-Guided RL

  3. Phase-Aware Guidance Injection for Recurrent MAPPO in Assembly-Line Disruption Recovery

    Jun 15, 2026Xin Huang, Yongcai Wang, Fengyi Zhang +3Combinatorial OptimizationLLM-Guided RL

  4. ReflectiChain: Epistemic Grounding in LLM-Driven World Models for Supply Chain Resilience

    Jun 9, 2026Jia LuoConstrained RLLLM-Guided RL

  5. GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning

    Jun 7, 2026Yanyan Wu, Boyi Zhang, Yanlin Liu +10Reinforcement LearningReward Shaping

  6. ROSUM-MCTS: Monte Carlo Tree Search-Inspired HDL Code Summarization with Structural Rewards

    Jun 6, 2026Prashanth Vijayaraghavan, Charles Mackin, Luyao Shi +6Electronic Design AutomationLLM-Guided RL

  7. Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning

    Jun 4, 2026Ujjwal Bhatta, Utsabi Dangol, Sumaly Bajracharya +2Reinforcement LearningLLM-Guided RL

  8. SocraticPO: Policy Optimization via Interactive Guidance

    Jun 3, 2026Zirui Liu, Jie Ouyang, Qi Liu +8RL for Language Model ReasoningLLM-Guided RL

  9. When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

    May 29, 2026Stephane Hatgis-Kessell, Emma BrunskillLanguage Model-Based ControlPolicy Optimization

  10. LLM-ALSO: LLM-Driven Adaptive Learning-Signal Optimization for Multi-Agent Reinforcement Learning

    May 28, 2026Xiaoguang Wu, Zhi Zheng, Hui XiongReward ShapingLLM-Guided RL

  11. SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving

    May 27, 2026Kangyu Wu, Peng Cui, Guoxi Chen +1Autonomous DrivingTraffic Accident Anticipation

  12. Hide to Guide: Learning via Semantic Masking

    May 24, 2026Ruitao Liu, Qinghao Hu, Alex Hu +6Reward HackingRL for Language Model Reasoning

  13. LLM-Guided Communication for Cooperative Multi-Agent Reinforcement Learning

    May 18, 2026Sangjun Bae, Yisak Park, Sanghyeon Lee +1LLM-Guided RLMulti-Agent Systems

  14. PriorZero: Bridging Language Priors and World Models for Decision Making

    May 12, 2026Junyu Xiong, Yuan Pu, Jia Tang +1LLM-Guided RLLatent World Models

  15. Learning Agentic Policy from Action Guidance

    May 12, 2026Yuxiang Ji, Zengbin Wang, Yong Wang +6Agentic RLReinforcement Learning

  16. EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models

    May 12, 2026Zhikai Zhao, Chuanbo Hua, Federico Berto +4Evolutionary OptimizationRobot Navigation

  17. From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay

    May 10, 2026Yanan Xiao, Yixiang Tang, Zechen Feng +3Reinforcement LearningExperience Replay

  18. AIPO: Learning to Reason from Active Interaction

    May 8, 2026Junnan Liu, Linhao Luo, Thuy-Trang Vu +1RL for Language Model ReasoningLLM-Guided RL

  19. Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias

    May 8, 2026Rahaf Abu Hara, Vaibbhav Murarri, Claudio ZitoPolicy OptimizationLLM-Guided RL

  20. Reward Shaping and Action Masking for Compositional Tasks using Behavior Trees and LLMs

    May 7, 2026Nicholas Potteiger, Ankita Samaddar, Taylor T. Johnson +1Reinforcement LearningReward Shaping

  21. Closing the Loop: Unified 3D Scene Generation and Immersive Interaction via LLM-RL Coupling

    May 7, 2026Anh H. Vo, Sungyo Lee, Phil-Joong Kim +2Virtual RealityLLM-Guided RL

  22. LANTERN: LLM-Augmented Neurosymbolic Transfer with Experience-Gated Reasoning Networks

    May 6, 2026Mahyar Alinejad, Yue Wang, Amrit Singh Bedi +1Reinforcement LearningLLM-Guided RL

  23. ARGUS: Policy-Adaptive Ad Governance via Evolving Reinforcement with Adversarial Umpiring

    May 4, 2026Deyi Ji, Junyu Lu, Xuanyi Liu +7Non-Stationary RLOnline Advertising

  24. Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data

    May 2, 2026Ruiqi Xue, Lei Yuan, Kainuo Cheng +2LLM-Guided RLOffline RL

  25. PPO guided Agentic Pipeline for Adaptive Prompt Selection and Test Case Generation

    May 1, 2026Gourisetty Venkata Sai Koushik, Dama Aditya, Mahankali Harish Sai +3Automated Software TestingLLM-Guided RL