Better Call Group Relative Policy Optimization

Latest papers 24

All topics
CardsList
  1. Certified Selective Automation of LLM Agent Evaluation

    Sep 28, 2026Chengguang Gan, Yunhao Liang, Qinghao Zhang +1Agentic EvaluationsAutomated

  2. GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization

    Aug 6, 2026Sajjad Ghiasvand, Nader SehatbakhshAnonymizationBetter Call Group Relative Policy Optimization

  3. Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

    Aug 5, 2026Xuzheng Yang, Jun Ling, Tao Huang +2RefusalsLLM Reasoning Strategies

  4. Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

    Jul 30, 2026Qiangqiang He, Zhongheng Wu, ZiJian WangCredit AssignmentReinforcement Learning With Verifiable Reward

  5. When Synthetic Speech Is All You Have: Better Call GRPO

    Jul 9, 2026Shashi Kumar, Yanis Labrak, Hasindri Watawana +5Flow-GrpoSpeech-To-Text Alignment

  6. Scaling Laws for Collapse in Asynchronous GRPO

    Jul 1, 2026Jingwei Song, Haofeng Xu, Jie Xiao +7Parallel RolloutsBetter Call Group Relative Policy Optimization

  7. ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection

    Jun 17, 2026Jinhao Song, Shan Liang, Yiqun Yue +2DeceptionMultimodal Reasoning

  8. FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data

    Jun 2, 2026Pengyu Chen, Shaowei Li, Kai Wang +4Better Call Group Relative Policy OptimizationFlow-Grpo

  9. CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO

    May 29, 2026Yang Li, Gongle Xue, Yijia Guo +3Reinforcement Learning With Verifiable RewardBetter Call Group Relative Policy Optimization

  10. Touch-R1: Reinforcing Touch Reasoning in MLLMs

    May 26, 2026Yingxin Lai, Yafei Zhou, Fucai Zhu +2TactileMultimodal Large Language Models

  11. CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents

    May 25, 2026Yihong Tang, Kehai Chen, Liang Yue +2Better Call Group Relative Policy OptimizationRole-Playing Agents

  12. ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both

    May 14, 2026Ziyu Guo, Rain Liu, Xinyan Chen +1Latent Visual ReasoningVisual Reasoning

  13. Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models

    May 8, 2026Xiaoze Liu, Dhananjay Ram, Yuting Zhang +3Reinforcement Learning Post-TrainingBetter Call Group Relative Policy Optimization

  14. Cost-Aware Learning

    Apr 30, 2026Clara Mohri, Amir Globerson, Haim Kaplan +2Better Call Group Relative Policy OptimizationStochastic Gradient Descent

  15. M2^{2}GRPO: Mamba-based Multi-Agent Group Relative Policy Optimization for Biomimetic Underwater Robots Pursuit

    Apr 21, 2026Yukai Feng, Zhiheng Wu, Zhengxing Wu +2Underwater RobotsMulti-Agent Reinforcement Learning

  16. Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO

    Apr 17, 2026Arash Ahmadi, Parisa Masnadi, Sarah Sharif +3Better Call Group Relative Policy Optimization