1 paper · 1 filter
Guangxiang Zhao, Qilong Shi, Xusen Xiao +13
Benchmark saturation and data contamination increasingly obscure genuine scientific reasoning in frontier LLMs. We introduce \textsc{ScienceArena}, an olympiad-style benchmark from…