1 paper · 1 filter
Haechan Kim, Soohyun Ryu, Gyouk Chu +2
Reinforcement learning with verifiable rewards (RLVR) has emerged as an effective post-training paradigm for improving the reasoning capabilities of large language models. However,…