1 paper
Qiangqiang He, Zhongheng Wu, ZiJian Wang
Reinforcement learning with verifiable rewards (RLVR) is central to improving long-CoT reasoning in large language models. Critic-free methods such as GRPO convert response-level r…