1 paper
Shu Zhao, Tan Yu, Anbang Xu +3
Reasoning-augmented search agents such as Search-R1, trained via reinforcement learning with verifiable rewards (RLVR), demonstrate remarkable capabilities in multi-step informatio…