1 paper
Xu Wan, Yansheng Wang, Wenqi Huang +1
Traditional on-policy Reinforcement Learning with Verifiable Rewards (RLVR) frameworks suffer from experience waste and reward homogeneity, which directly hinders learning efficien…