1 paper
Yizhou Zhang, Ning Lv, Teng Wang +1
Group relative policy optimization (GRPO) has demonstrated significant potential in improving the reasoning capabilities of large language models (LLMs) via reinforcement learning.…