1 paper
Tao Ren, Jinyang Jiang, Hui Yang +10
Reinforcement learning with verifiable reward has recently emerged as a central paradigm for post-training large language models (LLMs); however, prevailing mean-based methods, suc…