1 paper · 1 filter
Vishwas Sathish, Viresh Ranjan, Xinliang Zhu +2
Reasoning agents increasingly rely on external tools such as web search to answer complex queries. Reinforcement learning (RL) finetuning algorithms such as GRPO have improved long…