1 paper · 1 filter
Zixi Zhu, Jiayuan Su, Jian Zhang +2
Search Agents face a severe reliability crisis during reinforcement learning (RL) fine-tuning. Heuristic Top-K retrieval often causes critical evidence loss or noise inclusion, whi…