1 paper · 1 filter
Zhaoyang Li, Zenghuang Fu, Qiuyuan Ai +6
Large language models can improve with reinforcement learning for search agents, yet existing self play agents repeatedly generate tasks while discarding the knowledge gained durin…