Soft Actor-Critic

Latest papers 106

All topics
CardsList
  1. Trust the Critic More

    Sep 30, 2026Kaiyue Wen, Luke Bailey, Arvind Mahankali +1Critic-Free Reinforcement LearningLarge Language Model Reinforcement Learning

  2. Privy to the Foil: Recasting Value Estimation with a Self-Privileged Critic for RLVR

    Sep 29, 2026Kun Liang, Chenming Tang, Clive Bai +5Reinforcement Learning With Verifiable RewardSoft Actor-Critic

  3. Action Chunking Proximal Policy Optimization with Feedback Correction

    Sep 28, 2026Sanghyun Hahn, Jonghyun ChoiAction ChunksProximal Policy Optimization

  4. An analysis of Mirror-Descent Soft Actor-Critic

    Sep 28, 2026Denis Zorba, Michal ValkoMirror DescentSoft Actor-Critic

  5. Verifying Neural Networks with Reinforcement Learning

    Sep 28, 2026Hai Duong, Thanh Le, ThanhVu NguyenNeural Network VerificationReinforcement Learning With Verifiable Reward

  6. A Concentration Bound for Two-Timescale Actor-Critic Algorithm

    Sep 24, 2026Prashansa Panda, Shalabh BhatnagarSoft Actor-CriticFinite Time Analysis

  7. CARE-VI: Conservative Adaptive Reliability Estimation for Value Improvement in Off-Policy Actor-Critic Learning

    Sep 17, 2026Xiang Zou, Shengzhu Shi, Junqi Gao +1Soft Actor-CriticTemporal Difference

  8. GR2PO: Group Relative Return Policy Optimization for Continuous Robot Control

    Sep 17, 2026Pengqin Wang, Qiming Zhang, Shaojie Shen +1Robot PoliciesSoft Actor-Critic

  9. Prior Evolution and Task Alignment for Aerial Grasping

    Sep 16, 2026Weiliang Deng, Zhengyang Dang, Yao Mu +1Robotic GraspingAerial Manipulation

  10. AlphaRJM: Reward-Jump Memory for Stochastic Return-Guided Alpha Discovery

    Sep 8, 2026Sayan Dhan, Selvaraju NatarajanSoft Actor-CriticStochastic

  11. A Channel-Boosted Multi-Agent System with Iterative Consultation for Document Sensitivity Classification

    Sep 2, 2026Aleesha Zainab, Asifullah Khan, Muhammad Ahmed Khalid +1Large Language Model ClassificationLog-Ratio-Based Gaussian Trust Weight

  12. Co-Evolving Actor-Conditioned Critics for Non-Verifiable Generation

    Aug 31, 2026Jinyoung Kim, Muhammad Khalifa, Lajanugen Logeswaran +4CritiqueCritic

  13. Graph Neural Assisted Actor-Critic for Latency-Efficient Edge Vision System

    Aug 17, 2026Alam Noor, Luis Almeida, Kai Li +3Unmanned Aerial VehiclesVision Sensors

  14. S2-HWM: Sparse Event-Structured Hierarchical World Model for Long-Horizon Surgical Robot Manipulation

    Aug 13, 2026Shuzhe Zhang, Xin Zhu, Yinling Qian +1Efficient World-Action ModelWorld Models

  15. Learning to Modulate, Not to Cycle: Soft Actor---Critic Recovers Inverter-Style Heat-Pump Control

    Aug 10, 2026Faizan Ahmed, Aniket Dixit, James BruseyHvac ControlSoft Actor-Critic

  16. V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control

    Aug 8, 2026Donghu Kim, Youngdo Lee, Hojoon Lee +6Simulation-Based Reinforcement LearningScalable Robot Learning

  17. Learning Suffers More Than the Policy Class Under Partial Observability: A Closed-Form Analysis

    Aug 7, 2026Idil GözelSoft Actor-CriticOffline Reinforcement Learning

  18. Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control

    Aug 5, 2026Mahshad Rastegarmoghaddam, Davoud Nikkhouy, Shima SamadzadehControl Barrier FunctionsSoft Actor-Critic

  19. Foundations of Reinforcement Learning and Control:Connections and New Perspectives

    Aug 3, 2026Claire Vernade, Onno Eberhard, Martha White +4Adaptive ControlSoft Actor-Critic

  20. ReBRAC-v2: The Return of the King

    Aug 2, 2026Denis Tarasov, Robert K. KatzschmannModel-Based Reinforcement LearningSoft Actor-Critic

  21. Hierarchical Multilevel Monte Carlo for Order-Optimal Neural Actor-Critic in Average-Reward CMDPs

    Jul 30, 2026Ankur Naskar, Vaneet AggarwalSoft Actor-CriticMarkov Decision Processes

  22. Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning

    Jul 29, 2026Gong Gao, Xiao Lai, Ziqi Xie +3Soft Actor-CriticPessimism

  23. Shared Voxel-Map-Based Cooperative Indoor UAV Guidance with a Multi-Agent Soft Actor-Critic Controller

    Jul 28, 2026Thomas Hickling, Dylan Wynne, Yu Su +1Multi-UavUnmanned Aerial Vehicles

  24. Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning

    Jul 26, 2026Zahra Abdalla Elashaal, Afef Hfaiedh, Nahla Khraief +2Hierarchical Reinforcement LearningEntropy Regularized Reinforcement Learning

  25. Deep Reinforcement-Learning-Guided Model Predictive Control for Preventing Overtakes in Autonomous Racing

    Jul 23, 2026Yufei Xi, Yijie Liao, Tulga ErsalAutonomous RacingModel Predictive Control

  26. Comparative Study of Multi-Agent Actor-Critic Algorithms in Parameterized Action Reinforcement Learning

    Jul 21, 2026Ubayd Ali Bapoo, Clement N NyirendaMulti-Agent Reinforcement LearningSoft Actor-Critic

  27. Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners

    Jul 14, 2026Haseeb Shah, Lingwei Zhu, Adam White +1Soft Actor-CriticGaussian Primitives

  28. Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies

    Jul 13, 2026Ziheng Cheng, Xin Guo, Huyên Pham +1Stochastic Optimal ControlModel-Free Reinforcement Learning

  29. PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers

    Jul 10, 2026Yujie Pang, Zudong LiAction ChunksSoft Actor-Critic

  30. Adaptive Reparametrized Time for Score-Based Diffusion Sampling

    Jul 2, 2026Yilie Huang, Wenpin Tang, Xun Yu ZhouDiffusion SamplingTimestep

  31. Learning the Supports for Categorical Critic in Reinforcement Learning

    Jul 2, 2026Jen-Yen Chang, Takayuki Osa, Tatsuya HaradaSoft Actor-CriticValue Functions

  32. FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion

    Jun 30, 2026Guanchen Lu, Yajuan Dun, Yi Zhou +4Soft Actor-CriticOffline Reinforcement Learning

  33. Dual-Flow Reinforcement Learning with State-Aware Exploration

    Jun 29, 2026Qijun Li, Zheng Fu, Qi Song +4Multimodal Action DistributionsSoft Actor-Critic

  34. PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

    Jun 29, 2026Doo Hwan Hwang, Kee-Eung KimReinforcement Learning From Human FeedbackCritic-Free Reinforcement Learning

  35. BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

    Jun 27, 2026Yupeng Chang, Yuan Wu, Yi ChangReinforcement Learning With Verifiable RewardCritic-Free Reinforcement Learning

  36. Revisiting Action Factorization for Complex Action Spaces

    Jun 25, 2026Timothy Flavin, Sandip SenAction SpaceSoft Actor-Critic

  37. WaveForward: An Omnidirectional Passive Wheeled Quadruped Robot with Casters

    Jun 24, 2026Chuanlin Zhao, Qifeng Zheng, Shuhan Wang +3Legged RobotsPassive

  38. Bias-Controlled Primal-Dual Natural Actor-Critic: Optimal Rates for Constrained Multi-Objective Average-Reward RL

    Jun 23, 2026Ankur Naskar, Swetha Ganesh, Vaneet AggarwalMulti-Objective Reinforcement LearningSoft Actor-Critic

  39. CKM-Driven Communication-Aware UAV Intelligent Trajectory Optimization for Urban Inspection

    Jun 23, 2026Yang Xiaomeng, Jia Ziye, Zhu Qiuming +1Unmanned Aerial Vehicle TrajectoriesUnmanned Aerial Vehicles

  40. FlowDPG: Deterministic Policy Gradient on Flow Matching Policies for Real-World Manipulation

    Jun 21, 2026Kexin Shi, Junyao Shi, Poorvi Hebbar +5Flow PoliciesRobotic Manipulation Policies

  41. A Test-time Actor-Critic Approach to News Images Generation

    Jun 19, 2026Damianos Galanopoulos, Vasileios MezarisImage GenerationSoft Actor-Critic

  42. Multi-Head Attention-Based Feature Extractor Integration with Soft Actor-Critic for Porosity Prediction and Process Parameter Optimization in Additive Manufacturing

    Jun 18, 2026Kianoush Aqabakee, Leonardo StellaSoft Actor-CriticPorous Media

  43. SWAP: Symmetric Equivariant World-Model for Agile Robot Parkour

    Jun 18, 2026Kaixin Lan, Ze Wang, Hongyi Li +6Scalable Robot LearningWorld Models

  44. Phi-Actor-Critic: Steering General-Sum Games to Pareto-Efficient Correlated Equilibria

    Jun 9, 2026Wongyu Lee, Francesco Lelli, Omran Ayoub +1Multi-Agent Reinforcement LearningSoft Actor-Critic

  45. Mitigating Bias in Low-SNR Financial Reinforcement Learning via Quantum Representations

    Jun 9, 2026Zeyu Liu, Xuanzhi Feng, Sing Kwong Lai +6Soft Actor-CriticOffline Reinforcement Learning

  46. Structure-Conditioned Actor-Critic Branches for Quality-Diversity Reinforcement Learning

    Jun 7, 2026Lianrong Zuo, Peilan Xu, Yong Liu +1Soft Actor-Critic

  47. TT-DAC-PS: Twin-Target Deterministic Actor-Critic with Policy Smoothing for Optimal Trade Execution

    Jun 7, 2026Ilia Zaznov, Atta Badii, Julian Kunkel +1Soft Actor-CriticExponential Moving Average

  48. Retry Policy Gradients in Continuous Action Spaces

    Jun 4, 2026Soichiro Nishimori, Paavo ParmasSoft Actor-CriticRetrying

  49. Representation Learning Enables Scalable Multitask Deep Reinforcement Learning

    Jun 4, 2026Johan Obando-Ceron, Lu Li, Scott Fujimoto +3Multi-Turn Reinforcement LearningModel-Based Reinforcement Learning

  50. From Ticks to Flows: Dynamics of Neural Reinforcement Learning in Continuous Environments

    Jun 2, 2026Saket Tiwari, Tejas Kotwal, George KonidarisSoft Actor-CriticOffline Reinforcement Learning