1 paper · 1 filter
Jingru Guo, Xiangyuan Xue, Lian Zhang +6
Frontier scientific reasoning remains a major challenge for large language models (LLMs), where even the strongest commercial systems fall short of expert-level performance. A clos…