cs.LGSep 28, 2026

Not All Rollouts Are Worth Learning: On Trajectory Valuation for Post-Training Reinforcement Learning

Authors: Xuesong Jia, Ziao Yang, Zhanhe Huang, Hongfu Liu

Organizations: Department of Computer Science, Brandeis University

Abstract

We consider the problem of trajectory valuation in reinforcement learning: how to identify and mitigate detrimental trajectories during online training. Unlike classification, where data valuation relies on fixed training and validation sets, reinforcement learning involves dynamically generated trajectories without explicit validation signals, making conventional influence-based methods inapplicable. We propose Dynamic Trajectory Valuation (DTV), a simple and efficient framework that estimates trajectory utility at the mini-batch level and filters detrimental trajectories based solely on gradient information. By operating at the optimization level, DTV integrates seamlessly with existing reinforcement learning pipelines with minimal overhead. Extensive experiments across diverse settings, including PPO, GRPO, and DPO, demonstrate that DTV consistently improves performance, enhances data efficiency, and stabilizes optimization.

Figures & tables

Appendix figures & tables7 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

    Aug 13, 2026Yao Zhou, Hang Gao, Fengge Wu +2Offline Reinforcement LearningTrajectory-Level Credit

  2. Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

    Aug 10, 2026Ting Zhou, Zhenqing Ling, Daoyuan Chen +4Reasoning BenchmarkPost-Training

  3. Counterfactual Transport Flows for Offline Conservative Trajectory Refinement

    Jun 8, 2026Lena Krieger, Xuan Zhao, Zhuo Cao +3Model-Based Reinforcement LearningLong Refinement Trajectories