Reinforcement Learning Post-Training

Latest papers 63

All topics
CardsList
  1. Off-Policy Merging Beats On-Policy Self-Distillation for Continual Learning

    Oct 5, 2026Chen Henry Wu, Thomas Zhang, Aditi RaghunathanReplay-Based Continual LearningOff-Policy Learning

  2. Beyond In-Distribution Preservation: Recovering Generalization in Quantized VLAs via Vulnerability-Oriented Tuning

    Oct 5, 2026Shen Ruan, Wenchang Gao, Jin Wang +4Post-Training QuantizationReinforcement Learning Post-Training

  3. Erased, Rerouted, or Rescaled? Post-Training and the Causal Quotient of a Language Model's Belief State

    Oct 4, 2026Weihan Li, Tianshi Zheng, Junhao Wu +1Reinforcement Learning Post-TrainingHidden States

  4. Sharpening Tax in Post-Training

    Oct 1, 2026Changdae Oh, Qi Zeng, Qi Qi +7Reinforcement Learning Post-TrainingPost-Training

  5. What Pretraining and Midtraining Make Learnable from Rewards?

    Sep 29, 2026Chiwun Yang, Xiaoyu LiReinforcement Learning Post-TrainingPretraining

  6. RoXDrive: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving via Action-Faithful Rollouts

    Sep 29, 2026Hongbin Lin, Chaoda Zheng, Yiming Yang +11Autonomous DrivingDrives

  7. Mutually Adversarial Self-Training with Evolving Data for Unified Multimodal Models

    Sep 28, 2026Wentao Zhou, Weijie Gan, Jiayun WangMultimodal ModelAdversarial Training

  8. Does Learning to Predict the World Help Agents Act? Auditing World-Model Post-Training

    Sep 27, 2026Xinyu Che, Hang Yan, Yanchen Liu +5Next-State PredictionWorld Models

  9. CausalWM: Causal Chain-of-Thought Reasoning for Embodied World Model

    Sep 19, 2026Ziming Xu, Shuang Liang, Ruobing Han +10Efficient World-Action ModelFuture Video Prediction

  10. OPTED: On-Policy Fine-Tuning for End-to-End Driving using a Render-Free Teacher

    Sep 17, 2026Damiano Da Col, Maximilian Igl, Peter Karkus +5Autonomous DrivingReinforcement Learning Post-Training

  11. Performance, Efficiency and Collapse -- Advantages and Challenges in Offline Post-training of Code LLMs

    Sep 14, 2026Abhinav Anand, Sanjana Reddy Pachika, Shweta Verma +1Reinforcement Learning Post-TrainingLarge Language Model Training

  12. From Rollouts to Recipes: Self-Contained Post-Training for LLMs

    Sep 1, 2026Yifei Li, Lingling Zhang, Muye Huang +3Post-TrainingReinforcement Learning Post-Training

  13. MoE Proxy Models for Low-Cost Failure Reproduction and Diagnosis in LLM RL Post-Training

    Aug 11, 2026Yikai Wang, Chuansai Zhou, Yuhang Zhou +10Large Language Model TrainingReinforcement Learning Post-Training

  14. TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models

    Aug 7, 2026Ziheng Liu, Quantao YangDiffusion-Based Vision-Language-ActionsReinforcement Fine-Tuning

  15. RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning

    Jul 31, 2026Chengbo Liu, Lifang Zhou, Ruijie Yan +8Offline Reinforcement LearningReinforcement Learning Post-Training

  16. Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals

    Jul 13, 2026Daocheng Fu, Rong Wu, Yu Yang +7Reinforcement Learning Post-TrainingPost-Training

  17. PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers

    Jul 10, 2026Yujie Pang, Zudong LiAction ChunksSoft Actor-Critic

  18. RL Post-Training Builds Compositional Reasoning Strategies

    Jul 8, 2026Azwar Abdulsalam, Nishil Patel, Andrew SaxeReinforcement Learning Post-TrainingRewrite

  19. CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training

    Jul 3, 2026Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge +1Medical Image GenerationCone-Beam Computed Tomography

  20. The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning

    Jul 1, 2026Daniel Thi Graviet, Lovre Pesut, Ivan Dagelic +2Coding AgentsRollout

  21. When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon

    Jun 29, 2026Huaqing Zhang, Jingchu Gai, Juno Kim +2Imitation LearningReinforcement Learning Post-Training

  22. Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents

    Jun 24, 2026Changdae Oh, Wendi Li, Seongheon Park +3Reinforcement Learning Post-TrainingAgentic Reinforcement Learning

  23. Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training

    Jun 17, 2026Ruiqi Lai, Dakai An, Wei Gao +6Diffusion-Based Reinforcement Learning MethodsReinforcement Learning Post-Training

  24. LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents

    Jun 16, 2026Haoyang Fang, Wei Zhu, Boran Han +11Reinforcement Learning Post-TrainingLarge Language Model Training

  25. Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack

    Jun 12, 2026He Zhang, Lingzhu Xiang, Haitao Lin +23Scalable Robot LearningRobot Systems

  26. Select and Improve: Understanding the Mechanics of Post-Training for Reasoning

    Jun 11, 2026Akshay Krishnamurthy, Audrey Huang, Nived RajaramanReinforcement Learning Post-TrainingLarge Reasoning Models

  27. LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training

    May 28, 2026Minju Gwak, Minseo Kwak, Dongseok Lee +3Reinforcement Learning Post-TrainingRepresentation-Level Misalignment

  28. Label-Free Reinforcement Learning via Cross-Model Entropy

    May 27, 2026Matt Gorbett, Hossein ShiraziReinforcement Learning Post-TrainingCross-Entropy Losses

  29. GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training

    May 25, 2026Yuelin Hu, Zhenbo Yu, Zhengxue Cheng +2Reinforcement Learning Post-TrainingNoise-Aware

  30. Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models

    May 22, 2026Jade Zou, Tao Huang, Weijie Kong +7Accelerated SamplingReward Gradients

  31. Reliability and Effectiveness of Autonomous AI Agents in Supply Chain Management

    May 16, 2026Carol Xuan Long, David Simchi-Levi, Feng Zhu +3Autonomous AgentsSupply Chain Optimization

  32. CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

    May 14, 2026Zhenyang Ni, Yijiang Li, Ruochen Jiao +7Video GenerationReinforcement Learning Post-Training

  33. Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

    May 11, 2026Haoyuan Sun, Jing Wang, Yuxin Song +9Modern Text-To-Image ModelsText-To-Image

  34. Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

    May 11, 2026Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken +2Generative Flow NetworksDiffusion Models

  35. Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

    May 8, 2026Jiaxuan Gao, Yongjian Guo, Zhong Guan +5World ModelsReinforcement Learning Post-Training

  36. Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models

    May 8, 2026Xiaoze Liu, Dhananjay Ram, Yuting Zhang +3Reinforcement Learning Post-TrainingBetter Call Group Relative Policy Optimization

  37. How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment

    May 7, 2026Rui Zhu, Weiheng Bai, Qiushi Wu +3Key-Value Cache CompressionReinforcement Learning Post-Training

  38. On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR

    May 7, 2026Hao Ye, Jisheng Dang, Junfeng Fang +7Reinforcement Learning With Verifiable RewardReinforcement Learning Post-Training

  39. SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

    Apr 22, 2026Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr +2Multimodal Large Language ModelsRecent Vision-Language Models

  40. A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

    Apr 19, 2026Zhiyin Yu, Yuchen Mou, Juncheng Yan +17Large Language Model Reinforcement LearningLarge Language Model Training

  41. Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training

    Apr 17, 2026Moein Salimi, Babak Hosseini Mohtasham, Amin Aghakasiri +6Scientific IdeationLarge Language Model Reinforcement Learning

  42. Policy Improvement Reinforcement Learning

    Apr 1, 2026Huaiyang Wang, Xiaojie Li, Xiaohan Wang +10Reinforcement Learning Post-TrainingDistributional Reinforcement Learning

  43. When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On

    Mar 5, 2026Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna +1Reward SignalVirtual Try-On

  44. Understanding Reward Hacking in Text-to-Image Reinforcement Learning

    Jan 6, 2026Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou +1Text-To-ImageReinforcement Learning Post-Training