1 paper · 1 filter
Qiang Zhu, Jiajun Wu, Longyi Wang
Reinforcement learning for multi-turn search reasoning typically relies on terminal outcome rewards, which cannot distinguish useful, redundant, and harmful intermediate interactio…