1 paper
Yunhan Wang, Jiaan Wang, Lianzhe Huang +2
Search Agents -- large language models augmented with search tools -- have intensified the need for future-proof evaluation benchmarks. Existing benchmarks such as BrowseComp rely…