1 paper · 1 filter
Yifan Wang, Bolian Li, David Cho +3
Reinforcement learning is critical to improving large reasoning models, but its success relies heavily on verifiable rewards (RLVR), making it hard to use in open-ended domains whe…