1 paper
Chen Li, Nazhou Liu, Kai Yang
Since DeepSeek-R1 popularized, Group Relative Policy Optimization (GRPO) has become the core part of training Reasoning LLMs. However, we find some deficiency that influences RL st…