1 paper
Zhenlin Wei, Pu Jian, Yingzhuo Deng +6
The alignment of Large Language Models (LLMs) for complex reasoning heavily relies on Reinforcement Learning with Verifiable Rewards (RLVR). However, standard algorithms like GRPO…