1 paper
Zhaoyang Li, Zenghuang Fu, Qiuyuan Ai +6
Large language models can improve with reinforcement learning for search agents, yet existing self play agents repeatedly generate tasks while discarding the knowledge gained durin…