1 paper
Akshansh, Leonardo Rosa Rodrigues, Michael Korostelev +2
The supply of high-quality training tasks is a central bottleneck for reinforcement learning from verifiable rewards (RLVR) on agentic language models. Each task requires a sandbox…