LLM-Guided RL

RL: Reinforcement Learning

Momentum

8 papers in the last four weeks, up 60% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 75

All topics
CardsList
  1. An LLM-in-the-loop RL Framework for Bioinformatics Feature Selection

    Oct 4, 2026Xinyuan Wang, Deepti Agrawal, Yanjie FuReinforcement LearningLLM-Guided RL

  2. Iterative Policy Refinement through Semantic Rollout Analysis

    Oct 1, 2026Feiyu Gavin Zhu, Qi Xu, Zhifei Deng +4Policy OptimizationLLM-Guided RL

  3. Guide, Then Let Go: Gap-Adaptive Teacher Scheduling for Sparse-Reward Agentic RL

    Sep 29, 2026Youling Huang, Tiankuo Xu, Jiaji Liu +10Agentic RLLLM-Guided RL

  4. Agentic AI Networking for Heterogeneous Unmanned Aerial Systems in Low-Altitude Wireless Networks

    Sep 17, 2026Nguyen Duc Minh Quang, Chang Liu, Shuangyang Li +1LLM-Guided RLWireless Communications

  5. Specifying Reward Functions for RL Without Environment Sampling

    Sep 14, 2026Stephane Hatgis-Kessell, W. Bradley Knox, Emma BrunskillLLM-Guided RLReward Design for RL

  6. Smart Adaptive Computing Across the Continuum: LLMs in IoT-Edge-Cloud Resource Management

    Sep 10, 2026Antonino Vaccarella, Lanpei Li, Vincenzo Lomonaco +1Language Model-Based ControlLLM-Guided RL

  7. Reinforcement Learning Enhanced LLM Agents for Complex Vehicle Routing Problems

    Sep 1, 2026Yi Chen, Zikang Yu, Jiahai Wang +3Multi-Agent System OptimizationLLM-Guided RL

  8. From Solver Feedback to Faithful Plans: Multi-Role Reinforcement Learning for Symbolic Planning

    Aug 22, 2026Chenghao Zhang, Yikai Mao, Haoyu Gao +4LLM PlanningSymbolic Planning

  9. LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

    Aug 12, 2026Zhixin Zhang, Xinke Jiang, Zhibang Yang +5LLM-Guided RLLLM Agents

  10. Mitigating Bus Bunching with Reinforcement Learning Enhanced by Semantic Stop Embedding

    Aug 10, 2026Xin Dong, Vikash V. GayahRL ControlLLM-Guided RL

  11. ProDVI: Programmatic Dynamics Priors for Value Network Initialization

    Aug 6, 2026Xinwei Liu, Junyuan Liang, Jianting Zhang +1Reinforcement LearningLLM-Guided RL

  12. Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

    Aug 4, 2026Christophe D. Hounwanou, John Emeka Eze, Yaé Ulrich GabaLLM-Guided RLLong-Horizon LLM Agents

  13. PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent

    Aug 2, 2026Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni +4Reward ShapingLLM-Guided RL

  14. Distilling Knowledge from Large Language Models into Lightweight Reinforcement Learning Agents for Autonomous Cyber Operations

    Jul 30, 2026Konur Tholl, François Rivest, Mariam El Mezouar +2Autonomous Cyber DefenseLLM-Guided RL

  15. LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

    Jul 26, 2026Faraz Heravi, James Ouyang, Zifan Xu +3LLM-Guided RLRobotic Manipulation

  16. Prompt-Driven Exploration

    Jul 9, 2026Sunshine Jiang, John Marangola, David Zhang +6LLM-Guided RLRL Exploration

  17. Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs

    Jul 9, 2026Lorenzo Pantè, Andrea Fanti, Roberto CapobiancoGame-Playing AgentsCurriculum RL

  18. TREK: Distill to Explore, Reinforce to Refine

    Jul 6, 2026Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10RL for Language Model ReasoningLLM-Guided RL

  19. Regime-Conditional Stabilisation of LLM-Augmented Cooperative Multi-Agent Reinforcement Learning

    Jul 5, 2026Faid Keddouri, Sohaib Houhou, Aissa Boulmerka +1Reward ShapingLLM-Guided RL

  20. ASK in the Dark: Uncertainty-Gated LLM Assistance under Partial Observability

    Jul 2, 2026Juarez Monteiro, Nathan Gavenski, Guilherme Lima +3Partially Observable RLLLM Prompting

  21. Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model

    Jul 2, 2026Junyan Tan, Haoran Lin, Siyuan Guo +4LLM-Based Program SynthesisLLM-Guided RL

  22. Calibrating the Evaluator: Does Probability Calibration Mitigate Preference Coupling in LLM Agent Feedback Loops?

    Jun 30, 2026Zewen LiuLLM-as-a-JudgePairwise Preference Evaluation

  23. LaGO: Latent Action Guidance for Online Reinforcement Learning

    Jun 23, 2026Kuan-Yen Liu, Ren-Jyun Huang, Ti-Rong WuLatent Action LearningLLM-Guided RL

  24. Causal Reward World Models: Zero-shot Reward Design for Automated Skill Generation

    Jun 22, 2026Yang Yang, Yuchuang Tong, Zhengtao Zhang +6RL for RoboticsRobot Skill Learning

  25. Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model

    Jun 21, 2026Pengxiang Cai, Tianchen Fang, Xiaohan Li +3RL for Language Model ReasoningCurriculum RL

  26. Hierarchical Control in Multi-Agent Games: LLM-based Planning and RL Execution

    Jun 18, 2026Jannik Hösch, Alessandro Sestini, Florian Fuchs +6Sequential MARLMulti-Agent Coordination

  27. From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning

    Jun 16, 2026Chao Chen, Chengzu Li, Zhiwei Li +2Reinforcement LearningLLM-Guided RL

  28. When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning

    Jun 15, 2026Nathan Gavenski, Juarez Monteiro, Francisco Galuppo +2LLM PlanningLLM-Guided RL

  29. Phase-Aware Guidance Injection for Recurrent MAPPO in Assembly-Line Disruption Recovery

    Jun 15, 2026Xin Huang, Yongcai Wang, Fengyi Zhang +3Combinatorial OptimizationLLM-Guided RL

  30. ReflectiChain: Epistemic Grounding in LLM-Driven World Models for Supply Chain Resilience

    Jun 9, 2026Jia LuoConstrained RLLLM-Guided RL

  31. GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning

    Jun 7, 2026Yanyan Wu, Boyi Zhang, Yanlin Liu +10Reinforcement LearningReward Shaping

  32. ROSUM-MCTS: Monte Carlo Tree Search-Inspired HDL Code Summarization with Structural Rewards

    Jun 6, 2026Prashanth Vijayaraghavan, Charles Mackin, Luyao Shi +6Electronic Design AutomationLLM-Guided RL

  33. Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning

    Jun 4, 2026Ujjwal Bhatta, Utsabi Dangol, Sumaly Bajracharya +2Reinforcement LearningLLM-Guided RL

  34. SocraticPO: Policy Optimization via Interactive Guidance

    Jun 3, 2026Zirui Liu, Jie Ouyang, Qi Liu +8RL for Language Model ReasoningLLM-Guided RL

  35. When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

    May 29, 2026Stephane Hatgis-Kessell, Emma BrunskillLanguage Model-Based ControlPolicy Optimization

  36. LLM-ALSO: LLM-Driven Adaptive Learning-Signal Optimization for Multi-Agent Reinforcement Learning

    May 28, 2026Xiaoguang Wu, Zhi Zheng, Hui XiongReward ShapingLLM-Guided RL

  37. SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving

    May 27, 2026Kangyu Wu, Peng Cui, Guoxi Chen +1Autonomous DrivingTraffic Accident Anticipation

  38. Hide to Guide: Learning via Semantic Masking

    May 24, 2026Ruitao Liu, Qinghao Hu, Alex Hu +6Reward HackingRL for Language Model Reasoning

  39. LLM-Guided Communication for Cooperative Multi-Agent Reinforcement Learning

    May 18, 2026Sangjun Bae, Yisak Park, Sanghyeon Lee +1LLM-Guided RLMulti-Agent Systems

  40. PriorZero: Bridging Language Priors and World Models for Decision Making

    May 12, 2026Junyu Xiong, Yuan Pu, Jia Tang +1LLM-Guided RLLatent World Models

  41. Learning Agentic Policy from Action Guidance

    May 12, 2026Yuxiang Ji, Zengbin Wang, Yong Wang +6Agentic RLReinforcement Learning

  42. EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models

    May 12, 2026Zhikai Zhao, Chuanbo Hua, Federico Berto +4Evolutionary OptimizationRobot Navigation

  43. From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay

    May 10, 2026Yanan Xiao, Yixiang Tang, Zechen Feng +3Reinforcement LearningExperience Replay

  44. AIPO: Learning to Reason from Active Interaction

    May 8, 2026Junnan Liu, Linhao Luo, Thuy-Trang Vu +1RL for Language Model ReasoningLLM-Guided RL

  45. Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias

    May 8, 2026Rahaf Abu Hara, Vaibbhav Murarri, Claudio ZitoPolicy OptimizationLLM-Guided RL

  46. Reward Shaping and Action Masking for Compositional Tasks using Behavior Trees and LLMs

    May 7, 2026Nicholas Potteiger, Ankita Samaddar, Taylor T. Johnson +1Reinforcement LearningReward Shaping

  47. Closing the Loop: Unified 3D Scene Generation and Immersive Interaction via LLM-RL Coupling

    May 7, 2026Anh H. Vo, Sungyo Lee, Phil-Joong Kim +2Virtual RealityLLM-Guided RL

  48. LANTERN: LLM-Augmented Neurosymbolic Transfer with Experience-Gated Reasoning Networks

    May 6, 2026Mahyar Alinejad, Yue Wang, Amrit Singh Bedi +1Reinforcement LearningLLM-Guided RL

  49. ARGUS: Policy-Adaptive Ad Governance via Evolving Reinforcement with Adversarial Umpiring

    May 4, 2026Deyi Ji, Junyu Lu, Xuanyi Liu +7Non-Stationary RLOnline Advertising

  50. Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data

    May 2, 2026Ruiqi Xue, Lei Yuan, Kainuo Cheng +2LLM-Guided RLOffline RL

  51. PPO guided Agentic Pipeline for Adaptive Prompt Selection and Test Case Generation

    May 1, 2026Gourisetty Venkata Sai Koushik, Dama Aditya, Mahankali Harish Sai +3Automated Software TestingLLM-Guided RL

  52. RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses

    Apr 30, 2026Feiyu Wu, Xu Zheng, Zhuocheng Wang +2Reinforcement LearningLLM-Guided RL