1 paper · 1 filter
Fengji Zhang, Tianyu Fan, Yuxiang Zheng +4
Recent advances in equipping Large Language Models (LLMs) with search tools and outcome-reward reinforcement learning (RL) have achieved new state-of-the-art results on open-domain…