1 paper
Siye Wu, Kai Yang, Yuchen Cai +8
Reinforcement learning with verifiable rewards (RLVR) improves specific capabilities of large language models, but covering multiple capabilities often involves training separate d…