1 paper
Egor Denisov, Svetlana Glazyrina, Maksim Kryzhanovskiy +1
Group Relative Policy Optimization (GRPO) has significantly advanced the training of large language models and enhanced their reasoning capabilities, while it remains susceptible t…