1 paper
Chen Wang, Lai Wei, Yanzhi Zhang +5
Recent advances in reinforcement learning (RL) have significantly enhanced the reasoning capabilities of large language models (LLMs). Group Relative Policy Optimization (GRPO), a…