Proximal Policy Optimization

Latest papers 68

All topics
CardsList
  1. Reinforcement Learning to Accelerate Primal-Dual Hybrid Gradient for Linear Programming

    Oct 1, 2026Jinhwan Sul, Alex Oshin, Evangelos A. TheodorouLinear ProgrammingPrimal-Dual Methods

  2. Reusing Past Samples in Proximal Policy Optimization: When and How Does It Help?

    Oct 1, 2026Alessandro Montenegro, Riccardo Venturelli, Marco Mussi +2Proximal Policy OptimizationOff-Policy Learning

  3. PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading

    Oct 1, 2026Duong Hien Chi Kien, Thanh Trung HuynhProximal Policy OptimizationTrading

  4. Action Chunking Proximal Policy Optimization with Feedback Correction

    Sep 28, 2026Sanghyun Hahn, Jonghyun ChoiAction ChunksProximal Policy Optimization

  5. Spiking Neural Network Actor-Critic Proximal Policy Optimization Control for Autonomous UAV Navigation Through Constrained Openings in Civil Infrastructure and Buildings

    Sep 20, 2026Francis Noah Walugembe, Maciej Wielgosz, Tomaž Goričan +1Unmanned Aerial VehiclesAutonomous Navigation

  6. Cost-Aware Reinforcement Learning with Action Masking and Projection for Battery Energy Storage Dispatch under Suppressed-Spread Market Shifts

    Sep 20, 2026Kuanlin Chen, Chen-Wei Kuo, Cheng-En OuBattery Energy Storage SystemsProximal Policy Optimization

  7. Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

    Sep 16, 2026Yizhuo Li, Jianhao Yan, Yun Luo +9Proximal Policy OptimizationCritic Learning

  8. Fast-Convergent Meta-RL via Gradient-Clustered BS Sampling for Edge Caching

    Sep 14, 2026Farnaz Niknia, Ping WangProximal Policy OptimizationOffline Reinforcement Learning

  9. Learning to Exploit Passive Dynamics for Energy-Efficient Target Hopping of a Spring-Legged Quadcopter

    Sep 14, 2026Ruigang Chen, Qi Zhang, Zhicheng Zhong +3QuadrotorBidirectional Thrust

  10. EF1-Constrained Nash Social Welfare with Identical Additive Valuations: Complexity, Guarantees, and Experiments

    Sep 3, 2026Zih-Sian Yang, Yi-Hao Chen, Yu-Te Kuan +3WelfareNash Equilibrium

  11. Multi-step Proximal Policy Improvement in Offline Reinforcement Learning

    Sep 3, 2026Soohyun Choi, Seonvin Cho, Songnam HongProximal Policy OptimizationOffline Reinforcement Learning

  12. PPO-STGNN: A Proximal Policy Optimization Approach with Spatio-Temporal Graph Neural Networks for DAG Task Scheduling in Cloud-Edge-End Computing

    Sep 3, 2026Yangshuo Qi, Chenwei Wang, Zihan Shen +1SchedulersEdge Platforms

  13. ProxPI: Proximal Prior Injection for Sampling-Based MPC under Learned-Prior Mismatch

    Sep 1, 2026Euncheol Im, Myotaeg Lim, Yisoo LeeModel Predictive Path IntegralProximal Policy Optimization

  14. A Closed-Loop Evaluation of Capability Loss and Recovery in Compressed Driving Policies

    Sep 1, 2026Ahmad Alfan Alfian Irfan, Nur Ahmad Khatim, Mansur AriefProximal Policy OptimizationClosed Loop

  15. Satellite Trajectory Optimization via Proximal Policy Optimization for Space Debris Avoidance

    Aug 10, 2026Logan Luna, Juan Ortiz Couder, Raul Alejandro Vargas-AcostaCollision AvoidanceIntent-Aligned Autonomous Spacecraft Guidance

  16. Start Classifying: Categorical Critics for LLM Reinforcement Learning

    Aug 3, 2026Zhijian Zhou, Long Li, Xuan Zhang +7Large Language Model Reinforcement LearningCritic-Free Reinforcement Learning

  17. P3: Probabilistic Policy Propagation for Stable VAE-Based Robot Learning

    Jul 28, 2026Liyun Yan, Jianming Ma, Yang Zhang +5Proximal Policy OptimizationRobot Policies

  18. Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

    Jul 27, 2026Md Rezwanul Haque, Md. Milon Islam, Fakhri KarrayLarge Language Model Reinforcement LearningSmall Large Language Models

  19. Approximate Quantum State Preparation Through Proximal Policy Optimization

    Jul 23, 2026Marco Mordacci, Michele AmorettiQubitProximal Policy Optimization

  20. Safe and Scalable Multi-Drone Payload Transport via CBF-based Reinforcement Learning with Zero-Shot Sim-to-Real Transfer

    Jul 22, 2026Jaeyoun Choi, Oswin So, Songyuan Zhang +2Multi-Drone CoordinationMulti-Robot Systems

  21. SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions

    Jul 9, 2026Elham Daneshmand, Majid Khadiv, Glen Berseth +1Proximal Policy OptimizationPolicy Gradient

  22. MPFlow: Learning Budgeted Max-Flow Optimization on the Lightning Network with Deep Graph Reinforcement Learning

    Jul 9, 2026Harrison Rush, Vincent Davis, Simone Antonelli +3Bringing Network CodingFlow Policies

  23. Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

    Jul 8, 2026Eric Zhu, Abhinav Shrivastava, Soumik MukhopadhyayDiffusion-Based Reinforcement Learning MethodsReinforcement Learning From Human Feedback

  24. Anticipatory Reinforcement Learning for Trajectory Tracking

    Jul 3, 2026Georg Schäfer, Jakob Rehrl, Stefan Huber +1Reinforcement Learning ControlOffline Reinforcement Learning

  25. Integrating Physics-Informed Neural Networks for Safe Reinforcement Learning in a 1-DoF Helicopter System

    Jul 3, 2026Georg Schäfer, Jakob Rehrl, Stefan HuberSafety ConstraintsProximal Policy Optimization

  26. PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

    Jun 29, 2026Doo Hwan Hwang, Kee-Eung KimReinforcement Learning From Human FeedbackCritic-Free Reinforcement Learning

  27. PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control

    Jun 26, 2026Jiatao Ding, Songqun Gao, Andrea Del Prete +1Safety ConstraintsProximal Policy Optimization

  28. KLip-PPO: A per-sample KL perspective on PPO-Clip

    Jun 22, 2026Riccardo Colletti, Robin HolzingerProximal Policy OptimizationKullback-Leibler Divergence

  29. Proximal Policy Optimization for Amortized Discrete Sampling

    Jun 14, 2026Anna Zykova-Myzina, Timofei Gritsaev, Daniil Tiapkin +1Generative Flow NetworksProximal Policy Optimization

  30. Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

    Jun 9, 2026Bowen Ping, Xiangxin Zhou, Penghui Qi +3Proximal Policy OptimizationOffline Reinforcement Learning

  31. A Unified Multi-Modal Framework for Intelligent Financial Systems: Integrating Reinforcement Learning, High-Frequency Trading, and Game-Theoretic Approaches with Cross-Modal Sentiment Analysis

    Jun 9, 2026Fanrong Liu, Zhang Yuwei, Mingni LuoFinancial Sentiment AnalysisMultimodal Sentiment Analysis

  32. Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions

    Jun 2, 2026Bingxu Liu, Jiashun Liu, Johan Obando-Ceron +5Proximal Policy OptimizationTrust Region

  33. Interpretable Policy Distillation for Power Grid Topology Control

    May 30, 2026Aleksandra Dmitruka, Karlis FreivaldsProximal Policy OptimizationPower Systems

  34. ESPO: Early-Stopping Proximal Policy Optimization

    May 28, 2026Zihang Li, Rui Zhou, Yingcheng Shi +8Large Language Model Reinforcement LearningProximal Policy Optimization

  35. Concept Drift Adaptation Using Self-Supervised and Reinforcement Learning In Android Malware Detection

    May 22, 2026Ahmed Sabbah, Mohammad Kharma, Mohammad Alkhanafseh +3MalwareParameter-Efficient Adaptation

  36. Deep Reinforcement Learning for Flexible Job Shop Scheduling with Random Job Arrivals

    May 21, 2026Yu Tang, Muhammad Zakwan, Efe Balta +2Job Shop SchedulingQueue Control

  37. Proximal State Nudging: Reducing Skill Atrophy from AI Assistance

    May 19, 2026Megha Srivastava, Jonathan Ouyang, Eric Zhou +6Unsupervised Skill DiscoveryProximal Policy Optimization

  38. Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation

    May 13, 2026Asim Osman, Sasha Abramowitz, Mark Bergh +13Proximal Policy OptimizationGoal-Conditioned Value Function

  39. ERPPO: Entropy Regularization-based Proximal Policy Optimization

    May 13, 2026Changha Lee, Gyusang ChoProximal Policy OptimizationMulti-Agent Reinforcement Learning

  40. TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing

    May 12, 2026Yuanpeng Li, Gefei Lin, Annie Qu +1Multi-Turn Reinforcement LearningProximal Policy Optimization

  41. PISTO: Proximal Inference for Stochastic Trajectory Optimization

    May 8, 2026Hongzhe Yu, Zinuo Chang, Yongxin ChenRobust TrajectoryStochastic Optimization

  42. Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex

    May 7, 2026Yun Qu, Qi Wang, Yixiu Mao +11Reinforcement Learning With Verifiable RewardProximal Policy Optimization

  43. ANO: Robust Policy Optimization via Bounded, Redescending Gain Fields

    May 4, 2026Yiheng Zhang, Yiming Wang, Kaiyan Zhao +3Proximal Policy OptimizationCollapse

  44. PPO guided Agentic Pipeline for Adaptive Prompt Selection and Test Case Generation

    May 1, 2026Gourisetty Venkata Sai Koushik, Dama Aditya, Mahankali Harish Sai +3Test GenerationAutomatic Prompt Optimization

  45. Sample-efficient Neuro-symbolic Proximal Policy Optimization

    Apr 28, 2026Simone Murari, Celeste Veronese, Daniele MeliProximal Policy OptimizationNeuro-Symbolic Framework

  46. Bounded Ratio Reinforcement Learning

    Apr 20, 2026Yunke Ao, Le Chen, Bruce D. Lee +5Proximal Policy OptimizationOffline Reinforcement Learning

  47. CycleRL: Sim-to-Real Deep Reinforcement Learning for Robust Autonomous Bicycle Control

    Mar 16, 2026Gelu Liu, Teng Wang, Zhijie Wu +3Autonomous Driving SimulationSim-To-Real Reinforcement Learning