1 paper · 1 filter
Huanyu Liu, Jia Li, Yihong Dong +6
Reinforcement learning with verifiable reward (RLVR) has become a promising paradigm for post-training large language models (LLMs) to improve their reasoning capability. However,…