1 paper
Nirav Patel, Josiah Crossman, Eva Aggarwal +1
Many benchmarks track Large Language Model (LLM) performance on tasks with verifiable answers, but less is known about how LLM performance is evolving on open-ended tasks, where cr…