1 paper
Zhipeng Chen, Tao Qian, Wayne Xin Zhao +1
Recently, scaling reinforcement learning with verifiable rewards (RLVR) for large language models (LLMs) has emerged as an effective training paradigm for significantly improving m…