1 paper
Xinhao Yao, Lu Yu, Changhao Wang +5
Group-based RLVR methods estimate advantages by repeatedly sampling multiple trajectories for each prompt, making long-horizon agent training expensive and discarding useful experi…