1 paper
Eshwar Reddy M, Sourav Karmakar
Public leaderboards increasingly suggest that large language models (LLMs) surpass human experts on benchmarks spanning academic knowledge, law, and programming. Yet most benchmark…