Rollout

Momentum

14 papers in the last four weeks, up 56% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 66

All topics
CardsList
  1. Iterative Policy Refinement through Semantic Rollout Analysis

    Oct 1, 2026Feiyu Gavin Zhu, Qi Xu, Zhifei Deng +4ImitationRollout

  2. SERA: Scale-Equalized Rollout Allocation for Maximum Likelihood Reinforcement Learning

    Sep 29, 2026Zihao Chen, Fanxiang Xiong, Hongran Ren +6Rollout

  3. One Rollout Is All You Get: Fully Test-Time Adaptation for GUI Agents

    Sep 28, 2026Ziqiang Wang, Li Gu, Zhixiang Chi +6Graphical User Interface AgentsTest-Time Adaptation

  4. TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs

    Sep 27, 2026Zihan Lin, Xiaohan Wang, Jie Cao +4Large Language Model Reinforcement LearningGroup-Based Reinforcement Learning

  5. Rollout Efficiency in Reinforcement Learning for Reasoning Large Language Models: A Taxonomy and Future Directions

    Sep 21, 2026Niloofar Gholipour, Marcos Assuncao, Gursimran Singh +8Large Language Model Reinforcement LearningRollout

  6. WeightBridge: An Efficient Weight Transfer Library for Reinforcement Learning

    Sep 21, 2026Xuanlin Jiang, Samuel Hsia, Michael Kuchnik +3Offline Reinforcement LearningRollout

  7. From Rollout to Reset: A Graph-Based Harness for Autonomous Long-Horizon Manipulation Evaluation

    Sep 16, 2026Jing Jiang, Yue Yang, Xinkai Jiang +3Robot StateRobot Systems

  8. IMPLY: Physically Anchored Consistency for World-Model Rollouts

    Sep 14, 2026Aman Mehta, Riya BaviskarSelf-ConsistencyWorld Models

  9. Expert-Space Exploration in MoE Reinforcement Learning

    Sep 14, 2026Hongyi He, Zhenghao Lin, Xiao Liu +3Mixture-Of-ExpertsLarge Language Model Reinforcement Learning

  10. LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL

    Sep 3, 2026Sijie Wang, Zhiqiang Tan, Xinrui Yang +1Diffusion-Based Reinforcement Learning MethodsReward Gradients

  11. R2S-Eval: Robot Evaluation with Real-to-Sim Calibration via Vision-Language Models

    Sep 3, 2026Yidi Wang, Feixiang Ruan, Ruoqu Chen +4Evaluation BenchmarksSim-To-Real Gap

  12. From Rollouts to Recipes: Self-Contained Post-Training for LLMs

    Sep 1, 2026Yifei Li, Lingling Zhang, Muye Huang +3Post-TrainingReinforcement Learning Post-Training

  13. Group Adaptive Clipping Policy Optimization

    Aug 31, 2026Sheng Jia, Xiao Wang, Shiva Prasad Kasiviswanathan +1Gradient ClippingReinforcement Learning With Verifiable Reward

  14. GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

    Aug 12, 2026Kai Yang, Jingwei Xu, Wanyu Wang +4Autoregressive RolloutRollout

  15. Keep the Future, Drop the Rollout: RIFT for World Action Models

    Aug 12, 2026Chushan Zhang, Jinguang Tong, Xuesong Li +2World ModelsAutoregressive Rollout

  16. PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR

    Aug 11, 2026Pixel Nomand, Elena Voss, Marcus Hale +1Reinforcement Learning With Verifiable RewardVerifiable Rewards

  17. Scheduling Mixed RL Rollouts Beyond Prefix Locality

    Aug 11, 2026Zetao Hong, Song Yuan, Yuanhao Ding +4Parallel RolloutsAutoregressive Rollout

  18. OnEvoMemory: Evolving Memory through Online Robot Rollouts for Pretrained Robot Policies

    Aug 9, 2026Zhongxi Chen, Shenqi ZongRobot PoliciesLong-Horizon Manipulation

  19. Predicting Task Difficulty Without Rollouts

    Aug 6, 2026Stefan Krsteski, Charlotte MeyerAgentic BenchmarksEvaluation Metrics

  20. Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning

    Aug 5, 2026Zheyuan Zhang, Manqing Mao, Hong Wang +8Group-Based Reinforcement LearningRollout

  21. Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

    Aug 3, 2026Wonseok Lee, Jimyeong Kim, Jungmin Ko +1Large Language Model Reinforcement LearningAutoregressive Rollout

  22. Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

    Jul 30, 2026Henglin Liu, Fangyuan Kong, Jing Wang +7Text-To-Video Diffusion ModelsVideo Diffusion Models

  23. How Fast Can Reward Models Score? A Systems Study of C++ and PyTorch Inference Runtimes for RLHF

    Jul 22, 2026Venkata Naga Sai Vishnu Rohit Pulipaka, Anish Katta, Deva Rohit Reddy PeddireddyDestination-Only ScoringFast Inference

  24. Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

    Jul 21, 2026Junyao Yang, Yucheng Shi, Zongxia Li +6Trust RegionGradient Staleness

  25. RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts

    Jul 20, 2026Yuxin Xiong, Xunyi Jiang, Rohan Surana +8Reinforcement Learning With Verifiable RewardRollout

  26. Process Reward Informed Tree Rollout for Effective Multi-Turn RL

    Jul 17, 2026Xintong Li, Sha Li, Yuwei Zhang +8Autoregressive RolloutRollout

  27. Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning

    Jul 15, 2026Bowei He, Yankai Chen, Xiaokun Zhang +1Frictive Policy OptimizationOffline Reinforcement Learning

  28. Prompt-Driven Exploration

    Jul 9, 2026Sunshine Jiang, John Marangola, David Zhang +6Large Language Model Reinforcement LearningRollout

  29. HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation

    Jul 8, 2026Shaopeng Zhai, Qi Zhang, Tianyi Zhang +5Humanoid RoboticsRollout

  30. The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning

    Jul 1, 2026Daniel Thi Graviet, Lovre Pesut, Ivan Dagelic +2Coding AgentsRollout

  31. Understanding Rollout Error in Graph World Models

    Jun 26, 2026Xinyuan Song, Zekun CaiWorld ModelsPrediction Error

  32. RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning

    Jun 25, 2026Rongjian Chen, Jianmin Hu, Kejiang Ye +1Large Language Model Reinforcement LearningRollout

  33. Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts

    Jun 20, 2026Qingfei Zhao, Huan Song, Shuyu Tian +2Unsupervised On-Policy Self-DistillationRollout

  34. EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts

    Jun 17, 2026Minseo Kim, Minjae Lee, Seunghyuk Oh +7Autoregressive RolloutParallel Rollouts

  35. SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter

    Jun 4, 2026Powei Chang, Jinpeng Zhang, Chaoqun Sun +6Reinforcement Learning With Verifiable RewardRollout

  36. DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization

    May 29, 2026Jian Mu, Tianyi Lin, Chengwei Qin +2Reinforcement Fine-TuningOffline Reinforcement Learning

  37. EchoRL: Reinforcement Learning via Rollout Echoing

    May 29, 2026Jinhe Bi, Aniri, Minglai Yang +9Reinforcement Learning With Verifiable RewardLarge Language Model Training

  38. Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO

    May 29, 2026Yiming Ren, Yiran Xu, Zicheng Lin +8Frictive Policy OptimizationRollout

  39. Diversifying RLVR Rollouts via First-Token Exploration

    May 27, 2026Soeun Kim, Albert NoReinforcement Learning With Verifiable RewardVerifiable Rewards

  40. Less is More: Early Stopping Rollout for On-Policy Distillation

    May 26, 2026Zhou Ziheng, Jiaqi Li, Huacong Tang +2Efficient On-Policy DistillationRollout

  41. Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training

    May 26, 2026Woojeong Kim, Ziyi Yang, Jing Nathan Yan +1RolloutToken Budget Allocation

  42. Not All Transitions Matter: Evidence from PPO

    May 22, 2026Ajhesh BasnetTransitionsRollout

  43. Rollout Cards: A Reproducibility Standard for Agent Research

    May 12, 2026Charlie Masters, Ziyuan Liu, Stefano V. AlbrechtReproducibilityRollout

  44. CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG

    May 12, 2026Jianghan Shen, Siqi Luo, Xinyu Cheng +6Agentic Retrieval-Augmented Generation SystemsReinforcement Learning With Verifiable Reward

  45. Ace-Skill: Bootstrapping Multimodal Agents with Prioritized and Clustered Evolution

    May 9, 2026Feng Xiong, Zengbin Wang, Yong Wang +5Self-Evolving AgentsMultimodal Agents

  46. Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR

    May 8, 2026Tao Wang, Shuo Li, Yan Sun +2Reinforcement Learning With Verifiable RewardRepair-Based Group-Relative Policy Optimization

  47. On Training in Imagination

    May 7, 2026Nadav Timor, Ravid Shwartz-Ziv, Micah Goldblum +2Model-Based Reinforcement LearningRollout

  48. Using Common Random Numbers for Simulation-based Planning with Rollouts

    May 6, 2026Sandarbh Yadav, Frederic J Maliakkal, Harshad Khadilkar +1RandomSimulation-Based Reinforcement Learning