1 paper
Xin-Qiang Cai, Wei Wang, Feng Liu +3
Reinforcement Learning with Verifiable Rewards (RLVR) replaces costly human labeling with automated verifiers. To reduce verifier hacking, many RLVR systems binarize rewards to $\{…