1 paper · 1 filter
Samarth Goel, Reagan J. Lee, Kannan Ramchandran
As large language models (LLMs) achieve strong performance on traditional benchmarks, there is an urgent need for more challenging evaluation frameworks that probe deeper aspects o…