1 paper
Zechuan Wang, Siyuan Lu, Hongxuan Zhang +3
Reinforcement learning with verifiable rewards (RLVR) offers a verifier-bounded performance ceiling for training multi-turn tool-use agents, yet its trajectory-level credit assignm…