1 paper
Minzheng Wang, Run Luo, Yanbo Wang +6
While Reinforcement Learning with Verifiable Rewards (RLVR) has proven effective for closed-ended tasks, extending it to open-ended social language games via self-play reveals a cr…